Inferact 共同創辦人 Simon Mo 與 a16z 討論:當模型可以被下載、微調與部署,真正稀缺的可能不再只是模型本身,而是讓它可靠運轉的推論、評估與營運能力。
本頁整理受訪者的觀點;「開放模型已追上前沿模型」等判斷屬於對談中的主張,不應當成獨立驗證的結論。
Mo 將 vLLM 描述為推論引擎:它安排請求、批次、記憶體與不同硬體,讓模型能在 GPU 或其他加速器上回應。這層看似在模型之後,卻直接決定延遲、成本、吞吐量與可用性。
對談的重點不是某個工具「取代」模型,而是說明模型發布後仍要經過硬體、格式、雲端與部署者的協作,才會從幾 TB 的檔案變成使用者真的能呼叫的服務。
受訪者認為,企業採用開放權重模型的理由可能包括成本,也包括能自行設定速度、資料保留、模型行為與特定工作負載。對需要固定延遲或特殊合規邊界的團隊,這些控制可能和價格同等重要。
但「開放」不會自動消除成本或風險。大型模型仍需要大量運算;模型授權也可能限制商業用途。要比較方案,應在自己的任務、延遲目標、資料政策與維運能力上測量,而不是只看公開排行。
對談刻意區分 open source 與 open weights。前者通常談程式碼與協作;後者常指可取得模型權重。模型研發涉及昂貴的資料、算力與多次失敗的訓練,因此發布者可能附帶使用條款或不同商業安排。
這個區分影響企業採購:除了能力與價格,也要問能否修改、如何部署、資料是否外流、授權是否涵蓋用途,以及誰負責長期維護。
受訪者提到,封閉 API 的安全限制可能誤傷正當的研究或工程工作;開放部署讓組織能為可信用途調整防護。但這不是主張撤除保護,而是把責任移回部署者:要清楚定義用途、權限、監測與升級路徑。
因此,控制權不是一張免責卡。越能自行設定系統,越需要能解釋的操作紀錄、測試與人工介入點。
「模型釋出只是起點;讓它在不同硬體、不同任務與真實風險裡可靠運作,才是基礎設施的工作。」
依據訪談對 vLLM、開放權重與部署協作的論點整理。
這不是測驗;選一個你認為不能被展示影片取代的檢查。