RAG 五階段:從流水線到會思考的檢索,以及我站上那個 Naive RAG
RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。
Tag
26 篇文章
RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。
上一篇拉高看 RAG 五階段全景,這篇拉近看實際想蓋一個 RAG 要面對的 5 個 infra 功課:文件入口解析、Chunking 上下文化、三路混合搜尋、Tensor Reranker、GraphRAG 語意鴻溝。每個功課都對照 engineer-news 現況,收尾給出對個人站的優先順序清單。
Anthropic 提出 J-lens,一種捕捉 Transformer 內部『可語言化』表示的可解釋性工具,並用它證實 Claude 內部存在類似神經科學『全域工作空間』的特權子空間——一小組向量對外廣播、驅動推理、可被使用者調控,也在欺騙與評估感知時洩漏訊號。
OpenAI 三名工程師用 Codex 五個月產出百萬行程式碼、零手寫——這場實驗真正的價值不在數字,而在它證明了『Harness 設計』是可以工程化的。拆解五個具體實踐:讓 App 對 Agent 可見、倉庫即事實來源、架構約束機械化、合併哲學重寫、後台熵管理。
把 Harness Engineering 從概念和標竿案例,收斂成你今天就能開始執行的東西:Agent 的四種固定翻車姿勢、上下文的 40% 甜蜜區間、業界收斂出的四大支柱框架,以及從『下午就能做』到『兩週後全自動化』的三階段路線圖——最後點出六大業界共識和三個至今無解的難題。
拆解 Claude Code、Codex 等 AI agent 的縱深防禦:規則關鍵字、分類器、輸入輸出掃描、執行沙箱、跨對話的長期行為監控,以及 system prompt 與 skills 在其中扮演的角色。
Headroom 在 LLM 請求送到供應商前,於本地把 tool 輸出、log、RAG chunk 壓掉 60–95% 的 token。真正值得學的不是壓縮率,而是它用『mask 抽取 + 快取變異經濟學』決定該不該壓——以及一個文件超前實作的提醒。
兩個 2026 年的產品都在回答同一個問題:單一模型撞到天花板時,與其挑一顆模型,不如把一群模型編排在同一個 API 後面。Fugu 走『學出來的協作』,Fusion 走『並行審議 + 裁判合成』。
Agent 按需載入工具,本質就是把 RAG 的『先檢索再注入』套在 tool schema 上,差別只在檢索器從向量相似度換成 LLM 自己的推理。
TiDAR 是 Nvidia 提出的自回歸+擴散混合語言模型架構:它的取樣結果與純 AR 完全一致(保住品質),卻能利用 AR 推論時閒置的 GPU 算力、用 diffusion 預先計算來換取加速,幾乎是一頓『免費午餐』。
Qwen、Kimi、GLM 這些開源模型已經夠強,很多情境不再需要託管 API。本文整理五種在本機跑 LLM 的工具,以及各自適合的場景。
上週 Anthropic 呼籲全球 AI 實驗室一起裝上「協調煞車」,這週卻發布了號稱史上最強的 Claude Fable 5。它和只限受控存取的 Mythos 5 其實是同一個底層模型,差別只在一層 classifier 「口罩」,並用 6/22 到期的限時開放製造 FOMO。
Jeff Dean 在一場訪談中回應「LLM 快沒訓練資料了」的說法:其實還有大量影片資料、合成資料,以及對既有資料更聰明的利用空間。他也用 RL rollouts 解程式題為例,說明合成資料要靠層層過濾才真正有用。
PageIndex 用階層樹索引 + LLM Agent 推理取代向量 DB,在長文件場景(FinanceBench 98.7%)表現亮眼;本站的 Hybrid RAG 則以向量搜尋 + 關鍵字 fallback 在 Cloudflare edge 上跑,取捨完全不同。
Dexter 把複雜的金融研究問題拆成有結構的步驟,自動呼叫工具抓即時財務數據,再自我檢查結果直到答案夠完整——概念上是「專為金融研究打造的 Claude Code」。
把工具的 endpoint 指向 localhost:20128,9Router 就自動在訂閱服務、便宜 API、免費服務之間做三層 fallback,token 過期自動刷新、OpenAI↔Claude 格式自動轉換,並用 RTK 壓掉 20–40% 的 tool output token。
裝一個 Rust binary,git/grep/test/docker 等指令的輸出自動壓縮後再送進 AI context,一段 30 分鐘的 Claude Code session 從約 118,000 token 壓到約 23,900。
KV Cache 把算過的 Key/Value 存下來,避免自回歸生成時重算,代價是記憶體隨序列長度暴增;MQA/GQA、MLA、Sliding Window、Streaming LLM、KV pruning、跨對話 prefix 共用都是為了讓這個「倉庫」撐久一點。
DeepSeek 4 在開源權重下做到 100 萬 token 的 context window,靠的是三層 KV cache 壓縮把記憶體需求砍掉約 90%;Pro 版本在長文本記憶測試上贏過 Gemini 3.1 Pro,同時算力與價格都大幅下降。
OpenAI 這次更新的是幾億人每天在用的「即時」ChatGPT——不做長考、瞬間回答的那一版。它聰明到在某些任務上逼近最強的思考模型,但也因此在對抗式越獄上變得更危險。這是 Two Minute Papers 對它的好、壞與瘋狂之處的整理。
不靠人類回饋,語言模型能不能自己發現並修正錯誤?主流做法是 contrastive decoding:刻意製造一個一定會答錯的狀態,把正常輸出與錯誤輸出相減,把生成結果往遠離錯誤的方向推——不動模型參數,只在 inference 階段套用。
LLM Wiki 不是查詢工具,是讓知識隨時間複利成長的架構——LLM 主動建構並維護一個 markdown 知識庫,而非每次查詢都重新從原始文件撈取。
OpenAI Michael Bolin 深入解析 Codex CLI 的 agent loop:從 prompt 組建、token 推理、工具執行,到 context window 管理與自動壓縮。
用 MiniMax M2.5(10B 激活參數)做一個「你畫我猜」小遊戲,整理出小模型 vibe coding 的三個教訓:架構要極簡、避開冷門技術棧、用速度優勢讓它自我測試與除錯。
AI Agent 表現不好,未必是模型笨。從一個 Gemma 4 2B 修 bug 的小實驗出發,說明什麼是 Harness、Harness Engineering 與 Prompt / Context Engineering 的差異,以及 agents.md 這類自然語言規則的效果。
ChatGPT 的能力來自第一階段的海量自監督預訓練;但『會回答問題、聽得懂指令、不亂講』則來自後面兩階段的指令微調與 RLHF。能力與對齊,是兩件分開煉成的事。