至於中間那列的到底係數(-2, 0, 2)比兩側的(-1, 0, 1)更大 ,也會同時在左右和上下兩個方向上產生亮度差,聪明从手發現了很多有意思的机人東西 ,然後全部相加 :(10×-1) + (10×0) + (10×1) +(10×-2) + (10×0) + (200×2) +(10×-1) + (200×0) + (200×1)= -10 + 0 + 10 + -20 + 0 + 400 + -10 + 0 + 200= 570
結果是脸识 570 ,
有的别说變成了邊緣檢測器(類似 Sobel 算子——電腦自己"發明"了類似的東西) 。而發型屬於臉的到底外圍,後 3 層負責把前麵提取到的聪明从手所有信息匯總起來做最終判斷(叫"全連接層"——你可以把它想象成"匯總投票" ,
順便說一下這個檢測器的机人來曆:Sobel 算子是 1968 年由 Irwin Sobel 和 Gary Feldman 在斯坦福人工智能實驗室的一次演講中提出的,這也是脸识邊緣。它隻是别说在做加減乘除:把像素變成邊緣 ,說明邊緣越明顯。到底
回到手機人臉識別

現在你知道手機是聪明从手怎麽認出你的了。
讓我用一個具體例子來演示 。机人AI 為什麽能通過律師考試卻會一本正經地撒謊。脸识它輸出"60% 可能是别说貓" ,超過 1400 萬張標注圖片
這個設計很聰明,中間一列全是 0 。
電腦用隨機檢測器算出一個結果,
疊加 :從線條到人臉
但一層檢測器還不夠 。兩個檢測器都會給出非零結果 。
這就是 AI 的"聰明" :不是真的理解,沒有人花這麽大力氣去收集和標注這麽多圖片 。而是從海量數據中找到了反複出現的模式——比如"眼睛區域的像素通常呈現這樣的數字組合"。"神經網絡"名稱的起源
讓我一步一步算給你看 :
圖片: 檢測器:10 10 10 -1 0 110 10 200 -2 0 210 200 200 -1 0 1對應位置相乘,怎麽可能認出一張臉?第一個線索:邊緣
什麽是邊緣
?就是照片裏顏色突然變化的地方 。和正確答案對比
:
- 如果猜對了——不錯
,
它錯了。就 9 個像素 ,GPU 算力、參數量更是以億計。越大越亮 。對應位置的數字相乘
,最終這個數據集包含了超過 1400 萬張標注好的圖片
,它"看到"的是什麽?不是一個水果的畫麵,貓臉、Hinton 和 Williams 發表在《Nature》(全球最權威的科學期刊之一)上的一篇論文奠定了這個方法的基礎。分給大量網上工人完成的平台)
,
那些檢測器裏的數字,瞳孔是深色的
,你會看到一個讓我非常震撼的例子:"國王"減去"男人",那可能是一張臉"
- 有人試著提取更複雜的特征:"檢測眼睛的形狀"
、綠色、對應位置相乘再相加(這個操作的專業名稱叫"卷積",花了大約 5-6 天
,在 AI 領域有一個專門的名稱 ,但核心識別原理——把采集到的數據變成數字、
神奇的事情發生了:那些原本隨機的數字,是數字
。
2. 算力
訓練一個模型,
這就是"訓練"。一種讓深層網絡更容易訓練的數學技巧(叫 ReLU) ,結果是 0(沒有邊緣)
- 如果右邊比左邊亮——正數那邊貢獻更大,建議零售價 $499
訂閱
如果覺得有意思,然後比較兩組數字有多接近
。現在一些新手機即使戴口罩也能解鎖——那是因為廠商後來專門用大量戴口罩的照片重新訓練了模型
,我產生了一個新的疑問:
AI 能"看"了——圖片在它眼裏是數字矩陣,從 1.6 億張候選圖片中篩選和標注
。結果是正數(有一條從暗到亮的邊緣)
這種"很多層檢測器疊加"的結構,遊戲畫麵需要同時計算屏幕上幾百萬個像素的顏色 ,但正確答案是"狗"。分別表示紅色、這可能要算好幾個月甚至幾年。算法改進——同時到位,逼網絡學到更通用的規律,所以這幾層叫"卷積層") 。用普通電腦的 CPU(中央處理器 ,叫"參數" 。表情——這些讓一張臉變得獨特的要素。不過你不需要把這個類比想得太深——它隻是一種"層層傳遞、
核心突破:讓電腦自己學
還記得前麵的 Sobel 算子嗎 ?
-1 0 1-2 0 2-1 0 1這 9 個數字是人類設計的。即可訂閱 。什麽是"眼睛"。這樣就不會被一張照片騙過去 。我們得先搞清楚一個更基本的問題:手機到底是怎麽"人臉識別"的 ?
答案要從一個讓人意外的事實說起——
你的手機看到的不是一張臉 ,是因為上一層的某個檢測器輸出偏了
讓我用一個簡化的例子來說明。
整個網絡包含 6000 萬個可調整的數字 。隻用加減乘除,

每個像素都有一個顏色,也就是你臉的輪廓 。
這就是電腦"看到"的東西 。上百層,沒有邊緣的區域呢?
圖片: 檢測器:100 100 100 -1 0 1100 100 100 -2 0 2100 100 100 -1 0 1計算
:(100×-1) + (100×0) + (100×1) +(100×-2) + (100×0) + (100×2) +(100×-1) + (100×0) + (100×1)= -100 + 0 + 100 + -200 + 0 + 200 + -100 + 0 + 100= 0結果是 0。所以選擇了這樣的數字組合。之所以叫這個名字,涵蓋 2 萬多個類別 。"這是汽車" 。曲線
這就是"深度學習"裏"深度"的含義——很多層檢測器疊加在一起 。到達一個"很少出錯"的狀態 。不是咬一口的味道——那它"看到"的是什麽?
文字怎麽變成數字?AI 又怎麽"理解"這些數字的意思?
下一篇,我後麵會專門講。
為什麽 2012 年才成功 ?
你可能會好奇:如果"讓電腦自己學"這個想法這麽好,完全不需要知道什麽是"臉"、中間的灰色就是 1 到 254 。為了建成 ImageNet,這些"正確答案"是電腦學習的前提——沒有答案 ,層層疊加
