Harness Engineering(二):OpenAI 百萬行實驗與五個工程答案
OpenAI 三名工程師用 Codex 五個月產出百萬行程式碼、零手寫——這場實驗真正的價值不在數字,而在它證明了『Harness 設計』是可以工程化的。拆解五個具體實踐:讓 App 對 Agent 可見、倉庫即事實來源、架構約束機械化、合併哲學重寫、後台熵管理。
Tag
9 篇文章
OpenAI 三名工程師用 Codex 五個月產出百萬行程式碼、零手寫——這場實驗真正的價值不在數字,而在它證明了『Harness 設計』是可以工程化的。拆解五個具體實踐:讓 App 對 Agent 可見、倉庫即事實來源、架構約束機械化、合併哲學重寫、後台熵管理。
把 Harness Engineering 從概念和標竿案例,收斂成你今天就能開始執行的東西:Agent 的四種固定翻車姿勢、上下文的 40% 甜蜜區間、業界收斂出的四大支柱框架,以及從『下午就能做』到『兩週後全自動化』的三階段路線圖——最後點出六大業界共識和三個至今無解的難題。
Headroom 在 LLM 請求送到供應商前,於本地把 tool 輸出、log、RAG chunk 壓掉 60–95% 的 token。真正值得學的不是壓縮率,而是它用『mask 抽取 + 快取變異經濟學』決定該不該壓——以及一個文件超前實作的提醒。
兩個 2026 年的產品都在回答同一個問題:單一模型撞到天花板時,與其挑一顆模型,不如把一群模型編排在同一個 API 後面。Fugu 走『學出來的協作』,Fusion 走『並行審議 + 裁判合成』。
Agent 按需載入工具,本質就是把 RAG 的『先檢索再注入』套在 tool schema 上,差別只在檢索器從向量相似度換成 LLM 自己的推理。
研究發現 AI Agent 之間用「湧現語言」(emergent language)比用自然語言溝通更有效率——更短、更省計算資源,但也更不透明
Loop Engineering 是把『下 Prompt 的你』換成一個系統:設計自動化的回饋迴圈,讓 Agent 在無人監督下持續、正確地工作
從 Cursor 團隊談 Composer 1.5 的訪談整理:他們為什麼要自研模型、RL 能帶來哪些外部工具做不到的能力,以及支撐 RL 訓練所需的自建基礎設施。
從 OpenClaw 引爆的裝機熱潮談起,拆解 Agentic Social Network 背後的技術演變:Model Router、Memory OS、協議三層架構,以及讓 Agent 走向長時陪伴、主動行動與自我進化的關鍵機制。