如何用 DeepSeek 的視覺能力在發貨前核驗硬件套件
一句話結論:發往全國另一頭門店的設備套件,如果配錯了電源線,或者把 48 口交換機裝成了 24 口,發現問題的往往是現場最沒辦法解決它的那個人。DeepSeek 的 API 現在可以在文字之外接收圖片,這讓一件事變得可行:在備貨台上給每個套件拍照,讓模型在封箱前把看到的東西與裝箱單逐行比對。它會標出不一致之處交給人複核;它看不到密封包裝裡面,讀不全每一個細小的標籤,也無法告訴你設備能不能用。
設想蘇州一個備貨倉庫裡的物流協調員,正處在一家零售連鎖企業門店上線項目的第三週:四川、重慶和雲南共要新開 30 家門店。每家門店配同樣一套設備:一台 PoE 交換機、兩台帶支架的吸頂無線 AP、一台防火牆設備、一台標籤打印機、若干跳線,以及每台設備的電源線。套件按從 ERP 導出到 Excel 的揀貨單打包,對著打印件目視核對後封箱。
位於成都的 14 號店在一個週六早上拆箱。交換機是 24 口型號,而不是平面佈局所依據的 48 口型號;防火牆配的是英標插頭電源線,牆上沒有一個插座插得進去。現場沒有 IT 人員。替換件只能再走一次快遞,原本預約兩小時上門的安裝工程師還得再跑一趟。
這並不罕見。揀貨單本身是對的。貨架上兩種交換機型號並排擺放,料號只差兩個字符,而核對的人在快遞截單前還有四十個套件要過。
這篇文章講的,是在這個流程里加一個便宜又快的步驟:每個套件開箱擺好後拍一張照片,在封箱前由具備視覺能力的 AI 模型對照裝箱單比對。它不取代人工核對;它讓人工核對有了具體要看的地方。
為什麼配錯的線纜或漏裝的適配器,總要等套件到了現場才被發現
配貨錯誤很少是清單寫錯造成的。它們出在從清單到箱子之間的那個實物環節:外觀相似的物品並排存放、某個料箱空了臨時替換、從錯誤的紙箱裡拿了另一個地區版本的電源線、主設備看起來齊了就忘了放配件袋。
本該發現這些問題的人工核對,有一個結構性弱點。核對的人讀著清單,逐項找東西。同一產品系列的 24 口和 48 口交換機顏色一樣、尺寸常常也差不多,型號只印在一張小貼紙上。國標電源線和英標電源線,不看插頭那一端就一模一樣,而插頭通常盤在箱子底部。
對單個站點的安裝來說,這類錯誤損失一個下午。對於門店沒有本地 IT 人員的多站點上線來說,它意味著一次失敗的上門安裝、一輪快遞往返和一次推遲的開業。這種錯誤在倉庫裡發現成本很低,到了任何其他地方都很昂貴。
具備視覺能力的模型,究竟能從照片裡核對什麼
DeepSeek 於 2026 年 8 月 21 日發佈了實驗性視覺模型 `deepseek-v4-flash-vision-exp`。幾周之內,其 API 文檔就寫明主力模型 `deepseek-flash` 支援圖片輸入:JPEG、PNG、GIF 和 WebP 格式,放在用戶消息中,採用與文本相同的 OpenAI 兼容 Chat Completions 格式,可以用 base64、URL 或通過 Files API 上傳。鑑於變化如此之快,動手之前請查看 DeepSeek 的最新文檔,確認模型名稱、圖片限制和價格,而不要相信任何一篇文章裡的數字,包括本文。
對配貨來說,有用的能力範圍不大,但很實用。給它一張開箱後攤在工作台上的清晰照片和一份文字裝箱單,模型可以描述它看到的東西、把物品對應到清單行,並指出哪些行它找不到依據。
把套件照片與裝箱單逐項比對
最基本的核對是"在不在"。你把 14 號店的裝箱單——每行的料號、描述和數量——和一張俯拍照片交給模型,照片裡每件物品都攤開擺放、互不疊壓。你要求它按順序過一遍清單,對每一行說明能不能看到這件物品、有幾件。
價值不在於模型比人看得更準。而在於它每次都會過完每一行,到第 38 個套件也不會疲勞,並給出一份書面結果,人對照照片一分鐘內就能核完。一行標著"看不到",就是讓人去實物上查的指令。
標出"看起來對、其實不對"的替換(品牌對、型號錯),這是趕時間的人工核對最容易漏掉的
更有價值的核對,是疲憊的人最容易跳過的那一步:讀標籤。如果裝箱單寫的是 `SW-48P-POE`,而照片裡交換機前面板的端口明顯更少,或者特寫裡標籤寫著 `SW-24P-POE`,即使這件物品乍看沒問題,模型也能標出不一致。電源線也一樣,只要擺放時插頭朝向鏡頭:英標 G 型插頭和國標插頭在外觀上區別明顯。
實操流程:從裝箱單到經過照片核驗、可以發貨的套件
這是物流協調員用現有導出的揀貨單、再在備貨台上方架一部手機,一週內就能搭起來的版本。文中料號僅作示例。
第 1 步:按站點統一裝箱單格式。把每個套件的揀貨單從 ERP 或 Excel 導出成一張簡單的表:站點代碼、行號、料號、描述、數量,再加一列"核對要點",寫明哪些東西必須拍得到——例如電源線寫"插頭朝向鏡頭",交換機寫"前面板端口可見"。
第 2 步:固定拍照設定。把手機或一台便宜的文檔攝像頭固定在工作台上方的同一高度,檯面鋪一塊純色、對比明顯的墊子。在墊子上畫好擺放網格,讓每件物品每次都放在同一位置:交換機放左上,AP 和支架放右上,電源線和適配器沿底邊擺放、插頭朝外。
第 3 步:每個套件拍兩張照片。一張拍完整擺放的全景,一張拍最關鍵標籤的特寫——交換機型號貼紙、防火牆標籤和各個插頭。文件名用站點代碼加套件編號命名。
第 4 步:遮擋模型不需要看到的信息。發送之前,裁掉或遮住帶有門店地址的快遞面單;資產標籤和序列號也一樣處理,除非你的流程確實需要模型讀取它們。
第 5 步:把照片和清單一起發送。用一段簡短腳本或內部工具,把兩張圖片和該站點的裝箱單放在同一個請求裡發送。可以從這樣一段提示詞開始:
"你正在對一個即將發貨的硬件套件做發貨前核對。下面是站點 CD-014 的裝箱單,後面是兩張該套件攤放在工作台上的照片。請按順序針對裝箱單的每一行報告:行號、物品是否可見(是 / 否 / 不確定)、你能數出的數量,以及與所列料號或描述之間任何可見的差異,例如型號標籤、端口數量或插頭類型不同。不要猜測。如果標籤太小或太模糊無法讀取,請寫'無法讀取',不要推斷。然後列出照片中與任何一行都對不上的物品。最後單獨一行:如果每一行都是'是'、數量一致且沒有差異,寫 PASS,否則寫 REVIEW。"
第 6 步:每個 REVIEW 都由人來處理。核對人員把標出的行與實物逐一比對,糾正錯誤,或者附一句簡短說明後撤銷標記,然後才封箱。PASS 的套件也仍要由人快速看一眼。
第 7 步:留存記錄。把照片、模型輸出和核對人員的處理結果按站點代碼歸檔。當某個站點反饋問題時,你能準確看到從倉庫發出的是什麼;時間久了,也能看出哪些物品需要換個拍攝角度。
AI 輔助照片核驗 vs 人工清單檢查 vs 沒有正式的配貨質檢
- AI 輔助照片核驗:每個套件的每一行都按順序核對,留下帶時間戳的書面記錄,並給出需要人來處理的具體標記。代價是一套拍照設定、每個套件少量的 API 費用,以及一個關於照片裡包含哪些數據的數據治理決定。
- 人工清單檢查:不需要新工具,有經驗的核對人員打開箱子就能察覺哪裡不對。但可靠性會隨工作量和疲勞下降,外觀相似的替換會被放過,而且除了紙上打的一個勾,通常沒有任何記錄。
- 沒有正式的配貨質檢:在倉庫裡最快、最省錢。所有錯誤都由站點發現,而在多站點上線中,這意味著由既沒有配件、也不具備相關知識的人,在整個流程中成本最高的環節發現。
照片核對做不到的地方
照片顯示的是"在不在"和"長什麼樣"。它無法告訴你交換機能否通電、固件版本是否正確,或者某台 AP 是不是到貨即壞。功能測試——給每台設備通電並確認它加載了預配置——是另一個獨立步驟,照片核對不能替代它。
它也看不到密封包裝裡面。如果十根跳線捆在一個袋子裡,或者 AP 的安裝螺絲裝在零售包裝盒內的密封小袋裡,模型最多隻能確認袋子或盒子在。需要清點的東西就拆開攤平,否則就要接受:這些行靠的是供應商的包裝,而不是照片。
視覺模型還可能數錯外觀相同的小件,也可能讀錯細小或有角度的型號標籤。這正是提示詞要求寫"不確定"和"無法讀取"而不是盡力猜測的原因,也是每個 REVIEW 都交給人處理的原因。把模型的 PASS 理解為"沒有明顯問題",而不是保證。
在規模化的情況下——每週數百個套件、帶序列號管理的資產——照片核對只是質檢流程中的一道控制點,這個流程仍然需要掃碼揀貨確認、序列號採集、功能測試和簽字確認。
做對這件事:核驗準確率、站點數據保密,以及什麼時候該找 IT
不要向任何人——包括你自己——引用一個準確率數字。用你自己的套件去測:頭幾周裡,記下每一次模型標出了其實沒問題的物品,以及每一次站點發現了而模型判為 PASS 的錯誤。這才是對你的流程有意義的唯一準確率數字。
在發出第一張照片之前,就決定照片裡放什麼。DeepSeek 的託管 API 在中國運營,而套件照片很容易拍進快遞面單上的門店地址、資產標籤、設備序列號,以及寫在貼紙上的備貨網絡信息。裁掉或遮住核對不需要的內容,擺放區域裡不要放紙質單據,並查清公司關於把業務圖片發送到外部 AI 服務的政策。
像對待任何生產環境憑據一樣對待 API 密鑰:放在密鑰管理工具裡而不是寫在腳本中,負責搭建的人調職後就輪換。
這就是外部幫助能發揮作用的地方。搭建圖片處理管道、日誌和密鑰管理,正是 AI 支援所涵蓋的工作;而套件裡的設備到貨之後,仍然需要有人配置和支援,這是常規的 IT 支援工作。同一批貨的單據一側,可以參考我們的 用 DeepSeek 準備中國硬件進口報關單據 指南;把實際發出的設備與資產清冊對帳,則可以參考 用 DeepSeek 做 IT 資產盤點對帳。
如果你不想在內部承擔配貨和備貨工作,2007 年創立於北京的 Brocent 可以通過其倉儲即服務,為多站點上線項目完成設備套件的備貨、核對和發運。
常見問題
視覺模型識別錯誤物品的準確率有多高?
沒有一個誠實的統一數字;任何脫離你的物品、你的照片和你的光線條件給出的數字,都應該忽略。準確率在很大程度上取決於照片:平鋪、光線充足、標籤朝向鏡頭的擺放有幫助;亂成一團的箱子則不行。在依賴它之前,先用你自己的套件測幾周。
這能完全取代人工質檢嗎?
不能。它改變的是人要做的事:核對人員不再為每個套件重讀整份清單,而是處理模型標出的具體行,並快速看一眼通過的套件。箱子發不發,仍然由人決定。
它能檢查功能狀態,而不只是物品在不在嗎?
不能。照片無法顯示設備能否通電、能否保持配置或是否存在故障。功能測試仍是一個獨立步驟。
對於有幾十個小零件的套件,這個方法管用嗎?
部分管用。視覺模型可能數錯螺絲、紮帶或袋裝跳線這類外觀相同的小件。把小零件裝進貼好標籤的袋子並在打包時清點,照片則用於核對體積較大、容易區分的物品。
把套件照片發給 DeepSeek 的 API 安全嗎?
這取決於照片裡有什麼,以及你們公司的政策。託管 API 在中國運營。除非核對需要,不要把地址、序列號和資產標籤拍進畫面,並在上線之前而不是之後把政策問題弄清楚。
我們應該用哪個 DeepSeek 模型?
用 DeepSeek 最新文檔中列明支援圖片輸入的模型。動手搭建時,請在 Vision 指南中確認當前的模型名稱、限制和價格。
分享:
📬 亞太IT月報
中國合規動態、網絡安全預警及亞太IT實踐指南,每月一期。
不發垃圾郵件,隨時可取消訂閱。