← 首頁

Tag

#ai

50 篇文章

概念解析

RAG 五階段:從流水線到會思考的檢索,以及我站上那個 Naive RAG

RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。

深度解析

想蓋一個能用的 RAG:InfiniFlow 2024 年度總結給我的 5 個 infra 功課

上一篇拉高看 RAG 五階段全景,這篇拉近看實際想蓋一個 RAG 要面對的 5 個 infra 功課:文件入口解析、Chunking 上下文化、三路混合搜尋、Tensor Reranker、GraphRAG 語意鴻溝。每個功課都對照 engineer-news 現況,收尾給出對個人站的優先順序清單。

深度解析

J-lens:Anthropic 從『全域工作空間』找到 Claude 內在思考的可解釋性新工具

Anthropic 提出 J-lens,一種捕捉 Transformer 內部『可語言化』表示的可解釋性工具,並用它證實 Claude 內部存在類似神經科學『全域工作空間』的特權子空間——一小組向量對外廣播、驅動推理、可被使用者調控,也在欺騙與評估感知時洩漏訊號。

Harness Engineering(二):OpenAI 百萬行實驗與五個工程答案

OpenAI 三名工程師用 Codex 五個月產出百萬行程式碼、零手寫——這場實驗真正的價值不在數字,而在它證明了『Harness 設計』是可以工程化的。拆解五個具體實踐:讓 App 對 Agent 可見、倉庫即事實來源、架構約束機械化、合併哲學重寫、後台熵管理。

Harness Engineering(三):業界共識、四大支柱與落地三階段

把 Harness Engineering 從概念和標竿案例,收斂成你今天就能開始執行的東西:Agent 的四種固定翻車姿勢、上下文的 40% 甜蜜區間、業界收斂出的四大支柱框架,以及從『下午就能做』到『兩週後全自動化』的三階段路線圖——最後點出六大業界共識和三個至今無解的難題。

深度解析

Titans:讓模型在測試時記憶(論文分析重點整理)

Google Research 的 Titans 提出一種讓模型在測試時(推論期間)記憶的架構:把很長的文本切成好幾段,用記憶把前段學到的東西帶到後段,藉此突破 transformer 的 context window 限制。想法確實不錯,但論文裡不少被稱為「memory」的東西,其實是既有做法換了名字。

概念解析

高通的端側 AI 佈局:從手機、機器人到 6G,藏在 AI 週期水面下的贏家

當前沿大模型在水面上廝殺,高通在水面下靠通訊 + 晶片 + 端側 AI 的組合,成為 Physical AI 時代邊緣裝置的核心供應商。這篇整理自高通全球副總裁徐晧在「驍友會五週年」現場的對談,拆解高通對手機、機器人、汽車、XR 眼鏡、PC 與 6G 的佈局邏輯。

研究筆記

AI 影片的動作為什麼總是怪怪的?答案不是更多資料,而是更少

用 optical flow 把『動作』從『外觀』中分離,並把它套在 AI 的內部學習訊號上,就能反查某個動作是從哪些訓練影片學來的;再用 Johnson–Lindenstrauss 投影把十億級參數壓到 512 維讓比對變得可行。最後剔除教壞模型的爛資料、用乾淨資料微調,動作品質在使用者研究中拿下 74.1% 勝率。

概念解析

Sakana AI 的神經細胞自動機:當你扮演神,規則決定誰生誰死

Sakana AI(東京)做了一個讓你扮演神的數位生態模擬器:一個會學習、會攻防的神經細胞自動機格子世界。你不控制單一生物,只調整環境規則,就能決定整個生態系是滅絕、是脆弱繁榮、還是穩定共存——展示了規則如何徹底形塑系統命運。

案例分析

Live English Tutor:用 LiveKit + Gemini Native Audio 打造即時語音 AI 英文家教

一套以即時語音為核心的 AI 英文家教系統:學生用麥克風(選配視訊/螢幕分享)跟 AI 老師 Emma 對話練習,系統即時糾錯並生成課後中文報告。技術核心是 LiveKit(Self-hosted WebRTC)+ Google Gemini 2.5 Flash Native Audio,後端 FastAPI 負責認證、課程與資料持久化。