邊緣勾勒出了圖片裏"有東西"的到底地方 。
你看,聪明从手會自己變成有意義的机人檢測器。
脸识
它錯了。别说
但如果我們告訴電腦"正確答案"呢 ?到底
就像老師批改作業一樣 。和正確答案對比:
- 如果猜對了——不錯,聪明从手
有的机人變成了顏色變化檢測器。幾千萬個參數反複做計算 。脸识最終這個數據集包含了超過 1400 萬張標注好的别说圖片 ,接近黑色) ,數字越大,能識別的東西就越複雜 。但原理完全一樣——歸根到底還是數字。歡迎分享+關注。49000 名標注工人來自 167 個國家 - Large-scale Deep Unsupervised Learning using Graphics Processors - Raina, Madhavan, Ng (2009) — GPU 訓練神經網絡比 CPU 快約 70 倍
- NVIDIA GeForce GTX 580 - VideoCardz — GTX 580 於 2010 年 11 月發布,動用了來自 167 個國家的近 5 萬名標注工人,比如,藍色的強度(也是 0 到 255)
。是因為它的工作方式有點像人腦中的神經元——每個神經元接收信號 、這個檢測器會在整張圖片上一格一格地滑動
,
那次突破有多震撼?在 ImageNet 圖像識別比賽中,判斷"這是不是主人的臉" 。手機往往就不認識你了 。
怎麽用呢?把檢測器疊放到圖片上,它專門用來檢測垂直方向的邊緣。瞳孔是深色的 ,是因為上一層的某個檢測器輸出偏了
- 那個檢測器偏了,逼網絡學到更通用的規律 ,歡迎關注我,
不過你可能發現了 ,AlexNet 的 6000 萬個參數震驚了整個計算機視覺領域 。
實際使用時,
就像考試之後對答案 :
- 最終結果錯了
- 是因為最後一步的某個數字偏了
- 那個數字偏了
,算法改進——同時到位,就要比較左右兩邊的亮度" ,現在你隻需要知道:電腦有辦法算出調整的方向和幅度。就 9 個像素 ,鼻子(一個三角形輪廓)、就是一組數字組成的小模板——把它疊到圖片上
,什麽是"眼睛"。所謂檢測器,第一層隻能看到線條,
如果我們換一塊顏色完全相同 、沒有邊緣的區域呢?
圖片: 檢測器:100 100 100 -1 0 1100 100 100 -2 0 2100 100 100 -1 0 1計算:(100×-1) + (100×0) + (100×1) +(100×-2) + (100×0) + (100×2) +(100×-1) + (100×0) + (100×1)= -100 + 0 + 100 + -200 + 0 + 200 + -100 + 0 + 100= 0結果是 0。是為了讓檢測器更關注正中間一行的變化 ,電腦怎麽知道該把那些數字往大了調還是往小了調?
這是整個係統最精巧的部分,得先回答一個基本問題:電腦看到的"照片"長什麽樣 ?
一張照片是由很多個小點組成的,有一個名字 ,它自己發現了"檢測邊緣有助於區分貓和狗"。把部件變成一組代表你這張臉的數字,

"標注好"的意思是:每張圖片都有人告訴你"這是貓" 、它輸出"60% 可能是貓" ,不是咬一口的味道——那它"看到"的是什麽?
文字怎麽變成數字?AI 又怎麽"理解"這些數字的意思?
下一篇 ,什麽是"眼睛" ,用它來學習的方法 ,下巴這些區域的麵部特征被口罩擋住了 ,
讓我用一個具體例子來演示。經過層層計算 ,如果邊緣是水平的(上下亮度差)呢?
很簡單——把檢測器旋轉 90° :
-1 -2 -1 0 0 0 1 2 1看出來了嗎 ?現在上麵一行全是負數,

這就是 AI 在"看"這件事上卡住了幾十年的地方。

每個像素都有一個顏色,不是圖像 ,
最簡單的情況是黑白照片:純黑是 0,它通過層層檢測器從數字中提取特征 。Graphics Processing Unit,
這需要大量的計算 。
還有一些 ,什麽是鼻子。讓我把完整的過程串起來 :
- 采集麵部數據:手機用攝像頭和傳感器采集你的麵部信息 ,原理完全一樣 ,結果的數字越大(不管是正還是負) ,訓練出了 AlexNet。把邊緣變成形狀,叫做反向傳播——1986 年由 Rumelhart、現在一些新手機即使戴口罩也能解鎖——那是因為廠商後來專門用大量戴口罩的照片重新訓練了模型 ,一個很大的正數。
但文字呢?
當你對 ChatGPT 說"蘋果",
但如果讓電腦自己來選呢 ?
假設我們不再指定這 9 個數字 ,
給電腦看 1000 張貓的照片和 1000 張狗的照片,但邊緣隻是一堆線條。
這是 「AI是怎麽回事」係列的第
1篇 。你很快就會明白。看一眼屏幕 ,但眼睛、無數種角度 、綜合判斷最終結果)。是數字。一個三角形在中間 ,對每個位置都做一次這樣的計算 。"神經網絡"名稱的起源 - ImageNet Classification with Deep Convolutional Neural Networks - Krizhevsky, Sutskever, Hinton (2012) — AlexNet 論文,
- 如果上下顏色一樣——結果是 0(沒有水平邊緣)
- 如果下麵比上麵亮——結果是正數(有一條水平邊緣)
兩個檢測器配合使用——一個管左右 ,結果肯定是亂七八糟的。中間一行全是 0。後續文章也會持續更新。三角形 、
回到手機人臉識別

現在你知道手機是怎麽認出你的了 。我一直很好奇 AI 到底是怎麽工作的,讓檢測器學會了隻靠眼睛和眉毛區域的特征來識別你 。
神奇的事情發生了:那些原本隨機的數字,隻用加減乘除 ,上百層 ,比如 :
0.1 -0.3 0.50.2 0.1 -0.40.3 0.2 0.1用這個隨機檢測器去掃描圖片,這些"正確答案"是電腦學習的前提——沒有答案 ,越大越亮 。它就是這樣一張表格 :
0 0 200 0 0 0 0 200 0 0200 200 200 200 200 0 0 200 0 0 0 0 200 0 00 是黑色,突然有人考了 85 分 。
不過你可能注意過一個奇怪的事:在幾年前,
為什麽 2012 年才成功 ?
你可能會好奇:如果"讓電腦自己學"這個想法這麽好,而是有一套精巧的方法能算出每個數字該往大了調還是往小了調 。
從邊緣到形狀:AI 卡了幾十年
找到邊緣之後呢?
1968 年的 Sobel 算子能找到邊緣,說明邊緣越明顯。
2009 年,不能告訴你"這是一隻眼睛"。結果是 0(沒有邊緣)
- 如果右邊比左邊亮——正數那邊貢獻更大,那些數字就會逐漸穩定下來 ,就叫"深度神經網絡"
,而是把它們變成"空的"——可以填入任何數值:
? ? ?? ? ?? ? ?一開始 ,層層提取特征——和我們前麵講的完全一樣)
- 層層檢測:這些數字經過很多層檢測器——第一層找邊緣
,旗艦模型超過 1 億個參數,一個管上下——就能找到圖片中任意方向的邊緣。人臉識別的學習過程完全一樣
。
現在我用一個"檢測器"來掃描它。
一個新的問題
理解了 AI 怎麽"認人"之後 ,然後全部加起來。排成 3×3:
10 10 1010 10 20010 200 200左上角是深色(數字 10,都是黑色線框" loading="lazy">
比如你的臉和背景之間——皮膚是淺色的,神經網絡的概念在 1940 年代就有了,什麽是"鼻子" 。發現了很多有意思的東西,

- 采集麵部數據:手機用攝像頭和傳感器采集你的麵部信息 ,原理完全一樣 ,結果的數字越大(不管是正還是負) ,訓練出了 AlexNet。把邊緣變成形狀,叫做反向傳播——1986 年由 Rumelhart、現在一些新手機即使戴口罩也能解鎖——那是因為廠商後來專門用大量戴口罩的照片重新訓練了模型 ,一個很大的正數。
