Titans:讓模型在測試時記憶(論文分析重點整理)
Google Research 的 Titans 提出一種讓模型在測試時(推論期間)記憶的架構:把很長的文本切成好幾段,用記憶把前段學到的東西帶到後段,藉此突破 transformer 的 context window 限制。想法確實不錯,但論文裡不少被稱為「memory」的東西,其實是既有做法換了名字。
Tag
5 篇文章
Google Research 的 Titans 提出一種讓模型在測試時(推論期間)記憶的架構:把很長的文本切成好幾段,用記憶把前段學到的東西帶到後段,藉此突破 transformer 的 context window 限制。想法確實不錯,但論文裡不少被稱為「memory」的東西,其實是既有做法換了名字。
同一個運算在 CPU、GPU、TPU 上表現差很多,因為三種晶片針對的計算型態不同:CPU 追求彈性、GPU 追求平行吞吐量、TPU 專攻機器學習的張量運算。
KV Cache 把算過的 Key/Value 存下來,避免自回歸生成時重算,代價是記憶體隨序列長度暴增;MQA/GQA、MLA、Sliding Window、Streaming LLM、KV pruning、跨對話 prefix 共用都是為了讓這個「倉庫」撐久一點。
不靠人類回饋,語言模型能不能自己發現並修正錯誤?主流做法是 contrastive decoding:刻意製造一個一定會答錯的狀態,把正常輸出與錯誤輸出相減,把生成結果往遠離錯誤的方向推——不動模型參數,只在 inference 階段套用。
AI Agent 表現不好,未必是模型笨。從一個 Gemma 4 2B 修 bug 的小實驗出發,說明什麼是 Harness、Harness Engineering 與 Prompt / Context Engineering 的差異,以及 agents.md 這類自然語言規則的效果。