RAG 五階段:從流水線到會思考的檢索,以及我站上那個 Naive RAG
RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。
Tag
6 篇文章
RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。
上一篇拉高看 RAG 五階段全景,這篇拉近看實際想蓋一個 RAG 要面對的 5 個 infra 功課:文件入口解析、Chunking 上下文化、三路混合搜尋、Tensor Reranker、GraphRAG 語意鴻溝。每個功課都對照 engineer-news 現況,收尾給出對個人站的優先順序清單。
說 Kafka「快」通常指的是它的高吞吐能力。關鍵設計之一是用 append-only log 把磁碟存取變成循序 I/O,避開隨機尋道;再加上 HDD 便宜又大容量,Kafka 得以低成本長期保留訊息。
Kafka 高效能的第二根支柱是 zero copy:透過 sendfile 系統呼叫,讓資料從 OS cache 直接送到網卡,省下多餘的記憶體複製與 system call。
從 Cursor 團隊談 Composer 1.5 的訪談整理:他們為什麼要自研模型、RL 能帶來哪些外部工具做不到的能力,以及支撐 RL 訓練所需的自建基礎設施。
Data Lakehouse 用「單一物件儲存層 + open table format + 共享 catalog + 治理層」,把原本各自為政的資料湖與資料倉儲合併成一個共享資料層。