回到手機人臉識別

現在你知道手機是机人怎麽認出你的了。一種讓深層網絡更容易訓練的脸识數學技巧(叫 ReLU) ,
現在我用一個"檢測器"來掃描它 。别说都不是到底人類設計的,會自己變成有意義的聪明从手檢測器。
不過你可能注意過一個奇怪的机人事:在幾年前,旗艦模型超過 1 億個參數 ,脸识手機往往就不認識你了。别说就要比較左右兩邊的到底亮度",但疊加四五層之後,聪明从手把那個數字調大一點
2012 年的别说突破用了一個聰明的辦法:用遊戲顯卡(GPU ,汽車
像素 → 邊緣 → 形狀 → 部件 → 整體
每一層都是在上一層的基礎上,從互聯網上收集的真實場景人臉照片,數字越小越暗,什麽是"眼睛",最終這個數據集包含了超過 1400 萬張標注好的圖片,
- 如果上下顏色一樣——結果是 0(沒有水平邊緣)
- 如果下麵比上麵亮——結果是正數(有一條水平邊緣)
兩個檢測器配合使用——一個管左右,
給電腦看 1000 張貓的照片和 1000 張狗的照片,
一個人的臉可以有無數種表情、訓練出了 AlexNet 。但正確答案是"狗"。但應該是 0%。再傳給下一個 。是因為它的工作方式有點像人腦中的神經元——每個神經元接收信號、
重複這個過程幾百萬次。
邊緣勾勒出了圖片裏"有東西"的地方 。
至於中間那列的係數(-2, 0, 2)比兩側的(-1, 0, 1)更大 ,
解決方法是
:疊加很多層。發表於 Nature
一個新的問題
理解了 AI 怎麽"認人"之後 ,而顏色在電腦裏是用數字表示的 。重複幾百萬次之後,不過你不需要把這個類比想得太深——它隻是一種"層層傳遞、識別簡單形狀——圓形、至今已經用了半個多世紀。綜合判斷最終結果) 。把部件變成一組代表你這張臉的數字 ,自己找到了有用的規律。也就無法調整那些數字 。三角形 、它照樣能解鎖 。一個管上下——就能找到圖片中任意方向的邊緣 。
這就是 AI 的"聰明":不是真的理解,就能看到"臉"了。這個檢測器會在整張圖片上一格一格地滑動 ,5 次都猜錯才算錯)——領先超過 10 個百分點。叫 Sobel 算子("算子"就是"計算工具"的意思) 。發現了很多有意思的東西,就能找到圖片裏顏色變化的地方。
Alex Krizhevsky 正是用兩塊遊戲顯卡(NVIDIA GTX 580 ,所以 GPU 特別擅長"同時做很多簡單的計算"。這些"正確答案"是電腦學習的前提——沒有答案,LFW 準確率 99.63%
讓我一步一步算給你看:
圖片: 檢測器:10 10 10 -1 0 110 10 200 -2 0 210 200 200 -1 0 1對應位置相乘,把兩個結果綜合起來
,它怎麽找到邊緣?答案讓我很驚訝
:隻用簡單的加減乘除就能做到。為什麽這幾個數字能檢測邊緣?先看看它怎麽用,錯了多少?差了很多——它說 60% 是貓,不是咬一口的味道——那它"看到"的是什麽?
文字怎麽變成數字?AI 又怎麽"理解"這些數字的意思?
下一篇 ,第三層找五官部件
,
2012 年,而是從海量數據中找到了反複出現的模式——比如"眼睛區域的像素通常呈現這樣的數字組合"。
這就是"學習"的本質:不是有人教了它規則,無數種光線 。人臉識別的學習過程完全一樣 。但原理完全一樣——歸根到底還是數字。斯坦福大學的李飛飛教授團隊發布了 ImageNet 數據集。這些技術讓更深的網絡變得可訓練。

"標注好"的意思是:每張圖片都有人告訴你"這是貓"
、要理解這件事 ,"這是汽車"。這個方法叫"反向傳播",你能看出來這是一個十字形嗎?——中間一橫一豎的數字是 200(亮),把邊緣變成形狀 ,判斷"這是不是主人的臉"。圖形處理器)來算。它就是這樣一張表格:
0 0 200 0 0 0 0 200 0 0200 200 200 200 200 0 0 200 0 0 0 0 200 0 0
0 是黑色
,結果是正數(有一條從暗到亮的邊緣)

每個像素都有一個顏色 ,
2009 年,所以還能匹配上 。檢測更複雜的東西 。
一道簡單的數學題
假設我們有一小塊圖片 ,
疊加 :從線條到人臉
但一層檢測器還不夠 。
怎麽用呢?把檢測器疊放到圖片上 ,

- 如果左右兩邊顏色一樣——正數和負數互相抵消,數字越大,
那些檢測器裏的數字,是為了讓檢測器更關注正中間一行的變化,即可訂閱 。
而訓練神經網絡恰好也是這種活——對幾百萬個數字做大量簡單的乘法和加法。ChatGPT 回答你的那三秒鍾裏究竟在算什麽,找到了邊緣,側臉怎麽辦 ?戴帽子怎麽辦?隻露出半張臉怎麽辦?
你怎麽可能把所有情況都寫成規則?
規則越寫越多,
最簡單的情況是黑白照片:純黑是 0,
這種"很多層檢測器疊加"的結構,也就是你臉的輪廓。曲線
- 第二層檢測器
:把第一層找到的邊緣組合起來,我產生了一個新的疑問 :
AI 能"看"了——圖片在它眼裏是數字矩陣 ,你會看到一個讓我非常震撼的例子 :"國王"減去"男人",用它來學習的方法 ,神經網絡研究的先驅 Geoffrey Hinton 的學生 Alex Krizhevsky 用這種"多層疊加"的方法做了一個圖像識別程序,就是邊緣。反向傳播算法在 1986 年就發表了。每張都貼好標簽——"這是貓"、層層提取特征——和我們前麵講的完全一樣)
- 層層檢測
