
資料工作、評估與人機協作,正在變成 AI 系統從 demo 走向可靠運作的營運層。
來源:Lightcone Podcast〈Alexandr Wang: Building Scale AI…〉|原始發表日期:2025 年 6 月 18 日
PART 1|起點
Alexandr Wang 說,Scale AI 的起點很樸素:讓機器學習團隊更快取得可用的標註資料。但真正難題不是把任務丟給一群人,而是把雜亂的真實世界轉成可以反覆檢查、回饋與改進的資料流程。
自駕、企業工作流與國防情境都會遇到同一件事:模型輸出看起來合理,不代表在邊緣案例裡可靠。當資料分布改變、輸入不完整或成本必須受控,團隊需要的不只是更多資料,而是知道哪一種資料、哪一項失敗、哪一個評估最值得優先處理。
PART 2|評估
訪談把 evaluation 放到中心。Wang 認為,AI 產業缺少足夠困難、能辨識前沿能力差異的測試。模型在容易的題目上表現很好,並不能告訴團隊它在長流程、模糊目標、真實工具操作與高風險決策上是否可靠。
先定義使用者真的想完成什麼。
把成功、失敗與不確定性留下來。
用新資料和評估回寫系統。
這讓「模型能力」變成一個營運問題。評估不是發表會上的排名,而是團隊決定何時能放權、何時要人工覆核、又該把下一筆預算花在哪裡的依據。
PART 3|agents
談到 agentic workflows,Wang 沒有把它描述成按下按鈕就能無人運作的魔法。代理人可以把資訊搜尋、工具呼叫與多步驟任務串起來,但越接近真實工作,越需要清楚的權限、可回溯紀錄與人類升級路徑。
因此,能否讓 agent 上線,取決於系統是否能回答三個問題:它根據什麼做決定?失敗時誰能發現?發現後誰能改正?這些問題把資料品質、評估設計與工作責任重新接在一起。
PART 4|競爭
訪談也談到中國 AI 實驗室與硬科技競爭,但沒有把它縮成單一排名。模型、算力、資料、人才與部署場景彼此牽動。Scale 的位置正好說明,AI 的競爭不只在訓練出哪個模型,也在於誰能把模型放進企業、公共部門與複雜流程,仍保持可驗證與可改進。
這是訪談中的界線:受訪者對產業與競爭的描述是其觀點;哪些部署能安全擴大、哪些能力已被獨立證實,仍須以個別證據與實測判斷。
「可靠的 AI,不是一次回答得漂亮;而是能在真實工作裡被測、被追問,也被修正。」
選一個你認為最容易被 AI 團隊低估的工作。