Titans:讓模型在測試時記憶(論文分析重點整理)
Google Research 的 Titans 提出一種讓模型在測試時(推論期間)記憶的架構:把很長的文本切成好幾段,用記憶把前段學到的東西帶到後段,藉此突破 transformer 的 context window 限制。想法確實不錯,但論文裡不少被稱為「memory」的東西,其實是既有做法換了名字。
Tag
5 篇文章
Google Research 的 Titans 提出一種讓模型在測試時(推論期間)記憶的架構:把很長的文本切成好幾段,用記憶把前段學到的東西帶到後段,藉此突破 transformer 的 context window 限制。想法確實不錯,但論文裡不少被稱為「memory」的東西,其實是既有做法換了名字。
一段訪談短片提出「二階諾貝爾獎」的概念——不是 AlphaFold 團隊再得獎,而是某位用 AlphaFold 做研究的人拿下諾貝爾獎。受訪者認為,以目前超過 300 萬名使用者的規模,這件事有機會成真。
Self-Attention 本質上分不出 Token 的先後順序,所以要靠位置編碼把順序補回來。這篇從最早的 Absolute Positional Embedding 講到 Sinusoidal 位置編碼,並拆解它為何能隱含相對位置資訊。
用 optical flow 把『動作』從『外觀』中分離,並把它套在 AI 的內部學習訊號上,就能反查某個動作是從哪些訓練影片學來的;再用 Johnson–Lindenstrauss 投影把十億級參數壓到 512 維讓比對變得可行。最後剔除教壞模型的爛資料、用乾淨資料微調,動作品質在使用者研究中拿下 74.1% 勝率。
AI Agent 表現不好,未必是模型笨。從一個 Gemma 4 2B 修 bug 的小實驗出發,說明什麼是 Harness、Harness Engineering 與 Prompt / Context Engineering 的差異,以及 agents.md 這類自然語言規則的效果。