Home / FAQs / AI系統運維、語音Agent與視覺識別
QUESTION & ANSWER

AI視覺識別專案需要準備多少圖片,資料應該怎麼整理?

視覺專案沒有適用於所有場景的固定圖片數量,代表性通常比簡單堆數量更重要。資料需要覆蓋不同裝置、光照、角度、批次、背景、正常類別和稀有異常。正式標註前應先統一缺陷或物件定義,並保留無法判斷和類別衝突樣本。PoC可以從小規模代表性資料開始,再依據錯誤分佈補充,而不是一次收集大量重複圖片。

直接回答

先給出可以用於決策的結論

資料準備應先回答識別物件、業務動作和錯誤後果,再設計採集與標註。分類、檢測、分割和OCR需要不同標註形式,嚴重缺陷與普通缺陷也應單獨分層。訓練、驗證和測試資料要儘量按時間、批次、裝置或現場隔離,避免相似圖片洩漏導致評測虛高。上線後仍要收集新批次和困難樣本,持續監控分佈變化。

DECISION FACTORS

判斷前需要確認哪些條件

同一個問題在不同企業、資料和專案階段下可能有不同答案。建議先核對以下條件,再把網上的通用結論代入自己的專案。

類別定義是否讓不同業務專家得到一致結論現場變化和稀有異常是否進入資料集同一影片連續幀是否被錯誤地分到訓練和測試圖片錄製與使用是否具有合法授權和保留規則
ACTION STEPS

建議按什麼順序推進

01

先明確目標與邊界

明確物件、類別、風險、最終動作和無法判斷規則。

02

驗證關鍵依賴

按現場條件和時間批次抽取代表性樣本並做資料體檢。

03

形成可評審成果

先進行小批雙人標註,核對一致性後再擴大。

04

用真實結果決定下一步

按模型失敗型別補充難例,並保留獨立最終測試集。

PRACTICAL EXAMPLE

放到實際業務中如何理解

示例用於說明判斷方法

工廠收集了十萬張正常產品圖片,卻只有幾十張真實缺陷,而且這些缺陷都來自同一臺相機。大量資料並不能保證生產效果。團隊應先重新定義缺陷等級,補充不同產線、光照和批次的異常樣本,必要時透過現場試採和專家複核建立可靠的小規模評測集。 示例不代表特定客戶業績,實際結論需要結合企業自己的業務量、樣本、系統和責任邊界驗證。

COMMON RISKS

最容易踩的坑

只追求圖片總數,不記錄來源和現場條件

標註人員對缺陷定義不一致卻直接訓練

把同一影片相鄰幀同時放入訓練和測試

ACCEPTANCE

最終應該怎樣驗收或確認

資料階段應交付類別說明、採集範圍、標註規範、樣本分佈、質量抽檢、授權邊界和版本記錄。獨立人員應能依據規範複核一批樣本並獲得可接受的一致性,測試集與訓練資料應保持合理隔離。

準備與供應商或內部團隊溝通時,建議帶上當前流程、代表性樣本、現有系統、計劃時間和預算等級。先把未知項明確標註,再決定採用診斷、PoC、固定範圍專案或持續研發,通常比直接索要一個缺少邊界的價格和工期更可靠。

你的專案條件與上面的示例不同?

可以先整理業務目標、現有系統、樣本與計劃時間,再由顧問結合實際邊界給出初步判斷。

聯絡專案顧問