RAG 五階段:從流水線到會思考的檢索,以及我站上那個 Naive RAG
RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。
Tag
50 篇文章
RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。
上一篇拉高看 RAG 五階段全景,這篇拉近看實際想蓋一個 RAG 要面對的 5 個 infra 功課:文件入口解析、Chunking 上下文化、三路混合搜尋、Tensor Reranker、GraphRAG 語意鴻溝。每個功課都對照 engineer-news 現況,收尾給出對個人站的優先順序清單。
Anthropic 提出 J-lens,一種捕捉 Transformer 內部『可語言化』表示的可解釋性工具,並用它證實 Claude 內部存在類似神經科學『全域工作空間』的特權子空間——一小組向量對外廣播、驅動推理、可被使用者調控,也在欺騙與評估感知時洩漏訊號。
OpenAI 三名工程師用 Codex 五個月產出百萬行程式碼、零手寫——這場實驗真正的價值不在數字,而在它證明了『Harness 設計』是可以工程化的。拆解五個具體實踐:讓 App 對 Agent 可見、倉庫即事實來源、架構約束機械化、合併哲學重寫、後台熵管理。
把 Harness Engineering 從概念和標竿案例,收斂成你今天就能開始執行的東西:Agent 的四種固定翻車姿勢、上下文的 40% 甜蜜區間、業界收斂出的四大支柱框架,以及從『下午就能做』到『兩週後全自動化』的三階段路線圖——最後點出六大業界共識和三個至今無解的難題。
拆解 Claude Code、Codex 等 AI agent 的縱深防禦:規則關鍵字、分類器、輸入輸出掃描、執行沙箱、跨對話的長期行為監控,以及 system prompt 與 skills 在其中扮演的角色。
Headroom 在 LLM 請求送到供應商前,於本地把 tool 輸出、log、RAG chunk 壓掉 60–95% 的 token。真正值得學的不是壓縮率,而是它用『mask 抽取 + 快取變異經濟學』決定該不該壓——以及一個文件超前實作的提醒。
兩個 2026 年的產品都在回答同一個問題:單一模型撞到天花板時,與其挑一顆模型,不如把一群模型編排在同一個 API 後面。Fugu 走『學出來的協作』,Fusion 走『並行審議 + 裁判合成』。
Agent 按需載入工具,本質就是把 RAG 的『先檢索再注入』套在 tool schema 上,差別只在檢索器從向量相似度換成 LLM 自己的推理。
研究發現 AI Agent 之間用「湧現語言」(emergent language)比用自然語言溝通更有效率——更短、更省計算資源,但也更不透明
WWDC26 是蘋果新領導層的檢驗時刻——Tim Cook 卸任前最後一次主持,Ternus 9 月接任。蘋果端出五款自研 AFM 模型、系統編排器,以及和 Google 合建的 PCC 隱私架構;但發布會 demo 仍以生成式 AI 為主,真正的 Agentic 能力才剛起步。
Fireship 用一支影片串起百年 CS 論文。本文跟著它的開場,走過真正啟動這條連鎖反應的四個關鍵節點:圖靈、Shannon、感知機,以及把神經網路打進寒冬的那本書。
Google Research 的 Titans 提出一種讓模型在測試時(推論期間)記憶的架構:把很長的文本切成好幾段,用記憶把前段學到的東西帶到後段,藉此突破 transformer 的 context window 限制。想法確實不錯,但論文裡不少被稱為「memory」的東西,其實是既有做法換了名字。
TiDAR 是 Nvidia 提出的自回歸+擴散混合語言模型架構:它的取樣結果與純 AR 完全一致(保住品質),卻能利用 AR 推論時閒置的 GPU 算力、用 diffusion 預先計算來換取加速,幾乎是一頓『免費午餐』。
上週 Anthropic 呼籲全球 AI 實驗室一起裝上「協調煞車」,這週卻發布了號稱史上最強的 Claude Fable 5。它和只限受控存取的 Mythos 5 其實是同一個底層模型,差別只在一層 classifier 「口罩」,並用 6/22 到期的限時開放製造 FOMO。
Two Minute Papers 讀完 Opus 4.8 長達 244 頁的 system card:這一版最大的賣點不在智商,而在「水管」——它不再對自己寫的程式碼說謊、不再偷懶亂猜。
Anthropic 這週同時做了兩件互相矛盾的事:申請兆元估值 IPO,以及呼籲全球一起踩煞車暫停 AI。本文整理這個矛盾背後的三種可能結局。
DeepMind 的 AlphaProof Nexus 挑戰約 350 道 Erdős 開放難題、解出其中九道。真正的突破不在模型更聰明,而在外面那圈『judge + 錦標賽』的迴圈:讓不可靠的 AI 反覆嘗試、互相評分,最後由 Lean 驗證器確認出可被機器檢查的形式化證明。
Claude Code 本身只能讀檔案、跑 bash;MCP 這個開放協定讓你把 Figma、Slack 等外部工具接進來——加一台 MCP server,Claude 就拿到它暴露的全部工具,還有數千個現成的公開 server 可用。
當前沿大模型在水面上廝殺,高通在水面下靠通訊 + 晶片 + 端側 AI 的組合,成為 Physical AI 時代邊緣裝置的核心供應商。這篇整理自高通全球副總裁徐晧在「驍友會五週年」現場的對談,拆解高通對手機、機器人、汽車、XR 眼鏡、PC 與 6G 的佈局邏輯。
一段訪談短片提出「二階諾貝爾獎」的概念——不是 AlphaFold 團隊再得獎,而是某位用 AlphaFold 做研究的人拿下諾貝爾獎。受訪者認為,以目前超過 300 萬名使用者的規模,這件事有機會成真。
Jeff Dean 在一場訪談中回應「LLM 快沒訓練資料了」的說法:其實還有大量影片資料、合成資料,以及對既有資料更聰明的利用空間。他也用 RL rollouts 解程式題為例,說明合成資料要靠層層過濾才真正有用。
AlphaFold 團隊回顧開發過程:當各種想法一個接一個奏效、成績直線上升時,他們沒有慶祝,反而開始懷疑自己是不是犯了機器學習最經典的錯——洩漏測試集。這篇整理這段自述,以及他們如何看待 AlphaFold 對健康與科學的真實影響。
一段訪談花絮:主持人請 Demis Hassabis 用「一句話、有時甚至一個字」回答簡單問題,結果他直呼「這好難」,被問到『Feynman 還是 Newton?』更笑說「這更難」。
Demis Hassabis 在對談中談他怎麼實際使用 Gemini(腦力激盪、快速掌握陌生領域、當 sparring partner),並介紹 co-scientist 這個以 Gemini 微調而成、能生成研究假設的系統。
Google I/O 2026 的主軸是把 Gemini 塞進每一個產品,並宣告進入「agentic Gemini era」:搜尋、Gmail、Android、眼鏡全都變成 AI agent。重點發表包含 Gemini Omni、Gemini Flash 3.5、TPU 拆分為訓練/推論兩種晶片,以及改頭換面的 Antigravity IDE。
一位技術 YouTuber 全程讓 AI 寫程式,做出一個純瀏覽器、不需安裝、無時間限制的一對一視訊通話平台 o2o。關鍵決策是只用 STUN、不提供 TURN,把頻寬成本轉嫁給使用者自己;而整個開發約 120 萬 token 裡,絕大多數花在斷線重連的狀態同步 bug 上。
PageIndex 用階層樹索引 + LLM Agent 推理取代向量 DB,在長文件場景(FinanceBench 98.7%)表現亮眼;本站的 Hybrid RAG 則以向量搜尋 + 關鍵字 fallback 在 Cloudflare edge 上跑,取捨完全不同。
Dexter 把複雜的金融研究問題拆成有結構的步驟,自動呼叫工具抓即時財務數據,再自我檢查結果直到答案夠完整——概念上是「專為金融研究打造的 Claude Code」。
把工具的 endpoint 指向 localhost:20128,9Router 就自動在訂閱服務、便宜 API、免費服務之間做三層 fallback,token 過期自動刷新、OpenAI↔Claude 格式自動轉換,並用 RTK 壓掉 20–40% 的 tool output token。
裝一個 Rust binary,git/grep/test/docker 等指令的輸出自動壓縮後再送進 AI context,一段 30 分鐘的 Claude Code session 從約 118,000 token 壓到約 23,900。
KV Cache 把算過的 Key/Value 存下來,避免自回歸生成時重算,代價是記憶體隨序列長度暴增;MQA/GQA、MLA、Sliding Window、Streaming LLM、KV pruning、跨對話 prefix 共用都是為了讓這個「倉庫」撐久一點。
DeepSeek 4 在開源權重下做到 100 萬 token 的 context window,靠的是三層 KV cache 壓縮把記憶體需求砍掉約 90%;Pro 版本在長文本記憶測試上贏過 Gemini 3.1 Pro,同時算力與價格都大幅下降。
OpenAI 這次更新的是幾億人每天在用的「即時」ChatGPT——不做長考、瞬間回答的那一版。它聰明到在某些任務上逼近最強的思考模型,但也因此在對抗式越獄上變得更危險。這是 Two Minute Papers 對它的好、壞與瘋狂之處的整理。
不靠人類回饋,語言模型能不能自己發現並修正錯誤?主流做法是 contrastive decoding:刻意製造一個一定會答錯的狀態,把正常輸出與錯誤輸出相減,把生成結果往遠離錯誤的方向推——不動模型參數,只在 inference 階段套用。
用 optical flow 把『動作』從『外觀』中分離,並把它套在 AI 的內部學習訊號上,就能反查某個動作是從哪些訓練影片學來的;再用 Johnson–Lindenstrauss 投影把十億級參數壓到 512 維讓比對變得可行。最後剔除教壞模型的爛資料、用乾淨資料微調,動作品質在使用者研究中拿下 74.1% 勝率。
Sakana AI(東京)做了一個讓你扮演神的數位生態模擬器:一個會學習、會攻防的神經細胞自動機格子世界。你不控制單一生物,只調整環境規則,就能決定整個生態系是滅絕、是脆弱繁榮、還是穩定共存——展示了規則如何徹底形塑系統命運。
LLM Wiki 不是查詢工具,是讓知識隨時間複利成長的架構——LLM 主動建構並維護一個 markdown 知識庫,而非每次查詢都重新從原始文件撈取。
OpenAI Michael Bolin 深入解析 Codex CLI 的 agent loop:從 prompt 組建、token 推理、工具執行,到 context window 管理與自動壓縮。
AI 推理與 Agent 把記憶體從計算瓶頸推向容量與頻寬瓶頸;HBM 因良率低反而排擠了普通 DRAM 產能,造成四十年來最嚴重的供需失衡。2026 年產能全數售罄,這次的「超級周期」有機會打破過去『撐不過兩年』的鐵律。
用 MiniMax M2.5(10B 激活參數)做一個「你畫我猜」小遊戲,整理出小模型 vibe coding 的三個教訓:架構要極簡、避開冷門技術棧、用速度優勢讓它自我測試與除錯。
群核科技成為「杭州六小龍」首家完成 IPO 的公司,創始人黃曉煌押注空間智能。本文整理空間智能與世界模型、具身智能的關係,以及群核「緊貼物理世界」的技術與商業路線。
業界的資安防護往往「離資料庫越近越鬆散」,後端常直接用 admin 帳號裸連。PostgreSQL 用 role + schema + 欄位 GRANT + RLS 打造由外而內、可細到每一列(甚至每個 cell)的分層權限,把最後一道鎖留在資料庫本身。
AI Agent 表現不好,未必是模型笨。從一個 Gemma 4 2B 修 bug 的小實驗出發,說明什麼是 Harness、Harness Engineering 與 Prompt / Context Engineering 的差異,以及 agents.md 這類自然語言規則的效果。
一套以即時語音為核心的 AI 英文家教系統:學生用麥克風(選配視訊/螢幕分享)跟 AI 老師 Emma 對話練習,系統即時糾錯並生成課後中文報告。技術核心是 LiveKit(Self-hosted WebRTC)+ Google Gemini 2.5 Flash Native Audio,後端 FastAPI 負責認證、課程與資料持久化。
用純 TypeScript 的 tag 評分引擎,為痛風、高血脂、糖尿病、高血壓四種病症即時計算 140 種食物的風險,後端全跑在 Cloudflare 免費額度上,月費 $0。
一套以 Docker Compose 編排的微服務平台:每日自動爬取 arXiv 論文、建立 Qdrant 向量索引,透過 hybrid search + re-ranking + Ollama 完成雙語 RAG 問答,並提供 Email 訂閱與 Grafana 監控。
從 OpenClaw 引爆的裝機熱潮談起,拆解 Agentic Social Network 背後的技術演變:Model Router、Memory OS、協議三層架構,以及讓 Agent 走向長時陪伴、主動行動與自我進化的關鍵機制。
ChatGPT 的能力來自第一階段的海量自監督預訓練;但『會回答問題、聽得懂指令、不亂講』則來自後面兩階段的指令微調與 RLHF。能力與對齊,是兩件分開煉成的事。
把對話當成可寫成文章的材料:用結構化 prompt 與範本,讓 Claude Code 自動把 debugging thread 轉為可發佈的技術文章。