區塊勢

讓 Codex 操作電腦之前,
先把它變成可驗證的工作流

How I AI 於 2026 年 7 月 22 日示範 browser 與 computer use。重點不是讓 AI 幫你點更多按鈕,而是把它每一次替你瀏覽、填寫與判斷,變成能回看、能拒絕、能修正的任務。

SCROLL
PART 1 |把「能不能用」交給會瀏覽的 agent

單元測試告訴你功能是否通過,
瀏覽器測試才看得見人會不會卡住

Claire Vo 用 ChatPRD 的 onboarding flow 示範:她請 Codex 在已登入的本機環境,用桌面與手機尺寸走完流程、截圖,再把問題整理成試算表。影片中的一次執行找到 11 個問題,其中 1 個被列為高嚴重度;每一列附上 viewport、重現步驟、修正方向與截圖。

這不是把 QA 「外包」給模型。它把人工最容易省略的窮舉瀏覽,改成一份可供人審核、也可供 agent 後續修復的問題清單。後端測試、前端測試與實際操作感受,仍是不同的證據層。

能要求 agent 產出可重現的證據,才有資格讓它做「看起來能用」的判斷。
PART 2 |提示不是越長越好,驗收條件才是

先給任務邊界與成功條件,
不要替模型逐格指揮滑鼠

影片把 Codex 的操作分成 browser、Chrome extension 與整台電腦三種範圍。選哪一種,不是介面偏好,而是權限選擇:已登入的本機流程可用 browser;需要既有 Chrome session 時才用 extension;需要跨 app 操作才考慮 computer use。

01 範圍限定網站、帳號、資料與可操作的 app。
02 任務描述要完成的流程與不可跨越的動作。
03 證據要求截圖、步驟、差異與待人處理的例外。

Vo 的實作觀察是,細到每一步的指令不一定更好;清楚說明目標、限制與可檢查的輸出,通常比把 agent 當成遙控滑鼠更有用。這不代表可以省略 review:產出的表格與修正仍要有人決定是否接受。

PART 3 |用 persona 找到建造者看不見的摩擦

讓 agent 扮演一個使用者,
不是叫它假裝代表所有使用者

另一個工作流是把角色輪廓寫清楚,再讓 browser use 以那個 persona 走網站、回報哪裡順、哪裡不順。它的價值在於強迫產品團隊把「誰在什麼情境下要完成什麼」說得具體,並用真實介面驗證這個假設。

但 persona 不是使用者研究的替代品。它只能檢查你提供的角色與流程,不能證明市場真的存在、也不能替代無障礙測試、隱私審查或真實使用者訪談。把它當成高頻的假設檢查,而非真相生成器。

角色越具體,回報越可行;角色越像刻板印象,輸出越可能只是把偏見寫得更流暢。
PART 4 |真正危險的不是點擊,而是不可逆的權限

收件匣、購物車、手機與路由器,
都需要人類留在關鍵確認點

影片也展示了讓 agent 分流 LinkedIn 未讀訊息、依條件把商品加入購物車、填寫麻煩表單,以及透過 iPhone Mirroring 調整遠端網路設定。這些案例共同的前提是:agent 能瀏覽不等於它應該自行送出、付款、開放連線或改變安全設定。

最實際的模式是把流程切成「可逆的探索」與「不可逆的提交」。讓它蒐集、篩選、草擬、填寫並列出差異;付款、送出外部訊息、改權限、開 port 或刪除資料,保留給人確認。影片中的購物示範也出現需要人類驗證的阻礙,正好說明自動化不是消失的責任。

Computer use 的價值,不是把人移出流程;
而是把人留在真正需要判斷的地方。

來源:How I AI,原始發表日期 2026 年 7 月 22 日。

如果讓 agent 幫你操作網頁,
你會先把哪一段交出去?

選完之後,分享你的觀點

你的觀點

想看原始示範的完整流程?

原始影片保留了 Codex browser、Chrome extension 與 computer use 的操作差異,以及 QA、角色走讀與個人工作流的實際畫面。

閱讀完整文章 →