用 Astro + Cloudflare Workers 從零建立低摩擦平台
Astro + Cloudflare 的關鍵在四個地方:adapter 的 platformProxy 要開、wrangler.jsonc 集中管理所有 bindings、env vars 和 bindings 是兩個不同系統、D1 Preview 環境要指向獨立 staging database。
工程實作、架構設計、工具介紹與踩坑紀錄。
77 篇文章代表文章
Astro + Cloudflare 的關鍵在四個地方:adapter 的 platformProxy 要開、wrangler.jsonc 集中管理所有 bindings、env vars 和 bindings 是兩個不同系統、D1 Preview 環境要指向獨立 staging database。
RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。
上一篇拉高看 RAG 五階段全景,這篇拉近看實際想蓋一個 RAG 要面對的 5 個 infra 功課:文件入口解析、Chunking 上下文化、三路混合搜尋、Tensor Reranker、GraphRAG 語意鴻溝。每個功課都對照 engineer-news 現況,收尾給出對個人站的優先順序清單。
Anthropic 提出 J-lens,一種捕捉 Transformer 內部『可語言化』表示的可解釋性工具,並用它證實 Claude 內部存在類似神經科學『全域工作空間』的特權子空間——一小組向量對外廣播、驅動推理、可被使用者調控,也在欺騙與評估感知時洩漏訊號。
OpenAI 三名工程師用 Codex 五個月產出百萬行程式碼、零手寫——這場實驗真正的價值不在數字,而在它證明了『Harness 設計』是可以工程化的。拆解五個具體實踐:讓 App 對 Agent 可見、倉庫即事實來源、架構約束機械化、合併哲學重寫、後台熵管理。
把 Harness Engineering 從概念和標竿案例,收斂成你今天就能開始執行的東西:Agent 的四種固定翻車姿勢、上下文的 40% 甜蜜區間、業界收斂出的四大支柱框架,以及從『下午就能做』到『兩週後全自動化』的三階段路線圖——最後點出六大業界共識和三個至今無解的難題。
Headroom 在 LLM 請求送到供應商前,於本地把 tool 輸出、log、RAG chunk 壓掉 60–95% 的 token。真正值得學的不是壓縮率,而是它用『mask 抽取 + 快取變異經濟學』決定該不該壓——以及一個文件超前實作的提醒。
兩個 2026 年的產品都在回答同一個問題:單一模型撞到天花板時,與其挑一顆模型,不如把一群模型編排在同一個 API 後面。Fugu 走『學出來的協作』,Fusion 走『並行審議 + 裁判合成』。
研究發現 AI Agent 之間用「湧現語言」(emergent language)比用自然語言溝通更有效率——更短、更省計算資源,但也更不透明
Loop Engineering 是把『下 Prompt 的你』換成一個系統:設計自動化的回饋迴圈,讓 Agent 在無人監督下持續、正確地工作
WWDC26 是蘋果新領導層的檢驗時刻——Tim Cook 卸任前最後一次主持,Ternus 9 月接任。蘋果端出五款自研 AFM 模型、系統編排器,以及和 Google 合建的 PCC 隱私架構;但發布會 demo 仍以生成式 AI 為主,真正的 Agentic 能力才剛起步。
三個真正有趣的顯示裝置:靠磁吸+USB-C 把 MacBook 變觸控螢幕的 Magic Screen、以 900 RPM 旋轉、需要 7,200Hz 更新率的體積顯示器,以及 Dell 52 吋 6K 超寬單螢幕。
Google Research 的 Titans 提出一種讓模型在測試時(推論期間)記憶的架構:把很長的文本切成好幾段,用記憶把前段學到的東西帶到後段,藉此突破 transformer 的 context window 限制。想法確實不錯,但論文裡不少被稱為「memory」的東西,其實是既有做法換了名字。
TiDAR 是 Nvidia 提出的自回歸+擴散混合語言模型架構:它的取樣結果與純 AR 完全一致(保住品質),卻能利用 AR 推論時閒置的 GPU 算力、用 diffusion 預先計算來換取加速,幾乎是一頓『免費午餐』。
一場「幕後如何做影片」直播的重點整理:技術 YouTuber 的選題靈感從社群與 web 生態而來,並談到日常工作習慣與用 Firebase 自建內容系統的想法。
說 Kafka「快」通常指的是它的高吞吐能力。關鍵設計之一是用 append-only log 把磁碟存取變成循序 I/O,避開隨機尋道;再加上 HDD 便宜又大容量,Kafka 得以低成本長期保留訊息。
Qwen、Kimi、GLM 這些開源模型已經夠強,很多情境不再需要託管 API。本文整理五種在本機跑 LLM 的工具,以及各自適合的場景。
上週 Anthropic 呼籲全球 AI 實驗室一起裝上「協調煞車」,這週卻發布了號稱史上最強的 Claude Fable 5。它和只限受控存取的 Mythos 5 其實是同一個底層模型,差別只在一層 classifier 「口罩」,並用 6/22 到期的限時開放製造 FOMO。
Two Minute Papers 讀完 Opus 4.8 長達 244 頁的 system card:這一版最大的賣點不在智商,而在「水管」——它不再對自己寫的程式碼說謊、不再偷懶亂猜。
一場送出 25 支手機的 giveaway 被 Reddit 貼文質疑造假。創作者在直播中逐一回應「盒子沒有 shrink-wrap、敲起來空心、外盒一片空白」三個疑點,並提醒觀眾提防假冒得獎通知的詐騙。
WWDC 2026 快速帶過各系統更新,主力放在兒少安全與新的 Apple Intelligence/Siri。新 Siri 走保守路線:對話式問答、跨裝置同步,最大賣點是能索引你 iPhone 上的個人資料;但最強的 on-device 模型只跑在 iPhone Air 與 17 Pro。
Anthropic 這週同時做了兩件互相矛盾的事:申請兆元估值 IPO,以及呼籲全球一起踩煞車暫停 AI。本文整理這個矛盾背後的三種可能結局。
Kafka 高效能的第二根支柱是 zero copy:透過 sendfile 系統呼叫,讓資料從 OS cache 直接送到網卡,省下多餘的記憶體複製與 system call。
DeepMind 的 AlphaProof Nexus 挑戰約 350 道 Erdős 開放難題、解出其中九道。真正的突破不在模型更聰明,而在外面那圈『judge + 錦標賽』的迴圈:讓不可靠的 AI 反覆嘗試、互相評分,最後由 Lean 驗證器確認出可被機器檢查的形式化證明。
Claude Code 本身只能讀檔案、跑 bash;MCP 這個開放協定讓你把 Figma、Slack 等外部工具接進來——加一台 MCP server,Claude 就拿到它暴露的全部工具,還有數千個現成的公開 server 可用。
透過新的 Ring App Store partner API 訂閱攝影機的 vehicle detection 事件,webhook 觸發後下載影片片段、跑 YOLO 偵測車輛、用像素位移換算車速,最後在 dashboard 呈現。
同一個運算在 CPU、GPU、TPU 上表現差很多,因為三種晶片針對的計算型態不同:CPU 追求彈性、GPU 追求平行吞吐量、TPU 專攻機器學習的張量運算。
人形機器人這兩年動作突飛猛進,關鍵不在 AI,而在本體硬體。本文依《硅谷101》對業內人士的訪談,拆解骨架、關節(執行器)、感測器、電氣與計算四大系統,說明為什麼「能動」和「好用」之間隔著一道量產的鴻溝。
當前沿大模型在水面上廝殺,高通在水面下靠通訊 + 晶片 + 端側 AI 的組合,成為 Physical AI 時代邊緣裝置的核心供應商。這篇整理自高通全球副總裁徐晧在「驍友會五週年」現場的對談,拆解高通對手機、機器人、汽車、XR 眼鏡、PC 與 6G 的佈局邏輯。
一支 The Code Report 影片盤點了一批「完全沒必要、卻美得莫名其妙」的開源專案:3D 旋轉老鼠游標的終端機、跑在 Tor 上的終端機電話、把上網變成 80 年代科幻恐怖片的擋廣告器、用 Rust 寫 CUDA 的 Nvidia 官方工具,還有把任何歌曲變成 Game Boy 芝麻音的合成器。
一段訪談短片提出「二階諾貝爾獎」的概念——不是 AlphaFold 團隊再得獎,而是某位用 AlphaFold 做研究的人拿下諾貝爾獎。受訪者認為,以目前超過 300 萬名使用者的規模,這件事有機會成真。
Jeff Dean 在一場訪談中回應「LLM 快沒訓練資料了」的說法:其實還有大量影片資料、合成資料,以及對既有資料更聰明的利用空間。他也用 RL rollouts 解程式題為例,說明合成資料要靠層層過濾才真正有用。
2009 年的 JavaScript 沒有標準函式庫、沒有模組、沒有類別,每個瀏覽器行為還不一樣。Jeremy Ashkenas 用 Underscore.js 補齊工具函式、再用 CoffeeScript 直接繞過語言本身的爛設計,成為讓 JavaScript 被認真對待的關鍵人物之一。
一位飛盤選手把 Whoop 5.0、Fitbit Air、Apple Watch Series 11 同時戴了快兩週,實測『便宜很多的 Fitbit Air 到底能不能取代 Whoop』。
AlphaFold 團隊回顧開發過程:當各種想法一個接一個奏效、成績直線上升時,他們沒有慶祝,反而開始懷疑自己是不是犯了機器學習最經典的錯——洩漏測試集。這篇整理這段自述,以及他們如何看待 AlphaFold 對健康與科學的真實影響。
一段訪談花絮:主持人請 Demis Hassabis 用「一句話、有時甚至一個字」回答簡單問題,結果他直呼「這好難」,被問到『Feynman 還是 Newton?』更笑說「這更難」。
一場 NBA 轉播,場館裡散佈 40~50 台攝影機,主力是 $5 萬美元的 Sony P50 搭配 Canon 122x 變焦鏡頭;所有畫面與聲音會傳到 200 碼外的六台轉播車,由團隊即時剪成一部沒有腳本的『現場電影』。
SpaceX 於 5/21 向 SEC 提交 S-1,計畫募資 750 億美元、上市當天市值上看 2 兆美元。招股書最大亮點不是星鏈,而是與 Anthropic 簽下每月 12.5 億美元、三年 450 億美元的算力合約,將取代星鏈成為最大單一收入來源;文件同時揭露 18712 枚比特幣,以及馬斯克約 85% 投票權的極端治理結構。
Demis Hassabis 在對談中談他怎麼實際使用 Gemini(腦力激盪、快速掌握陌生領域、當 sparring partner),並介紹 co-scientist 這個以 Gemini 微調而成、能生成研究假設的系統。
Google I/O 2026 的主軸是把 Gemini 塞進每一個產品,並宣告進入「agentic Gemini era」:搜尋、Gmail、Android、眼鏡全都變成 AI agent。重點發表包含 Gemini Omni、Gemini Flash 3.5、TPU 拆分為訓練/推論兩種晶片,以及改頭換面的 Antigravity IDE。
攻擊者只是對 TanStack 開了一個 fork PR 又立刻關掉,就利用 pull_request_target 的權限把惡意檔案寫進 CI 共享快取,等後續 PR 合併時劫持 npm trusted publishing token,6 分鐘投毒 84 個套件並蠕蟲式擴散到 169 個套件。
2026 年 5 月,Musk v. Altman 在 Oakland 聯邦法院進入結辯。這不是兒童成癮案,而是 Elon Musk 指控 Sam Altman 與 Greg Brockman「偷走一個慈善機構」、把開源非營利變成閉源印鈔機的世紀訴訟。
「AI 能創造更厲害的 AI」不是一個 yes/no 問題,而是一條人類逐步放手的光譜。真正的技術主軸是:訓練所依賴的 loss / reward,能被 AI 自己接手到什麼程度——而目前仍離不開人類。
NVIDIA 一個 30B 參數的開源多模態模型,主打的不是「最聰明」,而是吞吐量與成本效率——影音處理又快又便宜。它用五個設計把影像、影片、音訊的處理成本壓下來,代價是純文字推理與程式碼能力不是頂尖。
機器人的瓶頸不在模型而在資料,因為動作資料網路上不存在、必須人工採集。業界用『遙操 / 仿真 / 動捕 / 影片』四層金字塔混搭,各有品質與規模的取捨;本文以《硅谷101》走訪上海數採工廠與多家機器人公司的內容,拆解每一層的技術現況與難題。
跟著一台電腦從按下電源鍵走到 kernel 把系統建起來,理解 bootloader、privilege rings、virtual memory 與 file system 這四個關鍵階段是怎麼協作的。
從 Cursor 團隊談 Composer 1.5 的訪談整理:他們為什麼要自研模型、RL 能帶來哪些外部工具做不到的能力,以及支撐 RL 訓練所需的自建基礎設施。
一位技術 YouTuber 全程讓 AI 寫程式,做出一個純瀏覽器、不需安裝、無時間限制的一對一視訊通話平台 o2o。關鍵決策是只用 STUN、不提供 TURN,把頻寬成本轉嫁給使用者自己;而整個開發約 120 萬 token 裡,絕大多數花在斷線重連的狀態同步 bug 上。
PageIndex 用階層樹索引 + LLM Agent 推理取代向量 DB,在長文件場景(FinanceBench 98.7%)表現亮眼;本站的 Hybrid RAG 則以向量搜尋 + 關鍵字 fallback 在 Cloudflare edge 上跑,取捨完全不同。
Dexter 把複雜的金融研究問題拆成有結構的步驟,自動呼叫工具抓即時財務數據,再自我檢查結果直到答案夠完整——概念上是「專為金融研究打造的 Claude Code」。
OpenStock 是 Open Dev Society 的開源股市儀表板,用 Next.js 15、MongoDB、Finnhub 與 TradingView widgets 建成,AGPL-3.0 授權、可自架、永久免費,定位是市場情報工具而非交易平台。
把工具的 endpoint 指向 localhost:20128,9Router 就自動在訂閱服務、便宜 API、免費服務之間做三層 fallback,token 過期自動刷新、OpenAI↔Claude 格式自動轉換,並用 RTK 壓掉 20–40% 的 tool output token。
裝一個 Rust binary,git/grep/test/docker 等指令的輸出自動壓縮後再送進 AI context,一段 30 分鐘的 Claude Code session 從約 118,000 token 壓到約 23,900。
KV Cache 把算過的 Key/Value 存下來,避免自回歸生成時重算,代價是記憶體隨序列長度暴增;MQA/GQA、MLA、Sliding Window、Streaming LLM、KV pruning、跨對話 prefix 共用都是為了讓這個「倉庫」撐久一點。
Self-Attention 本質上分不出 Token 的先後順序,所以要靠位置編碼把順序補回來。這篇從最早的 Absolute Positional Embedding 講到 Sinusoidal 位置編碼,並拆解它為何能隱含相對位置資訊。
台積電從一家沒人想投資的小島晶圓廠,走到晶圓代工市佔 72%。回顧它創立時差點被黨國權貴否決、與聯電在 0.13 微米分道揚鑣、搶下蘋果訂單、被叛將反打後靠夜鷹計劃翻盤的幾場關鍵戰役。
DeepSeek 4 在開源權重下做到 100 萬 token 的 context window,靠的是三層 KV cache 壓縮把記憶體需求砍掉約 90%;Pro 版本在長文本記憶測試上贏過 Gemini 3.1 Pro,同時算力與價格都大幅下降。
OpenAI 這次更新的是幾億人每天在用的「即時」ChatGPT——不做長考、瞬間回答的那一版。它聰明到在某些任務上逼近最強的思考模型,但也因此在對抗式越獄上變得更危險。這是 Two Minute Papers 對它的好、壞與瘋狂之處的整理。
『這支手機比上一代抗摔四倍』這種標語沒有說謊,但很誤導——因為抗摔與抗刮本質上是互斥的取捨,廠商每年只是輪流強調其中一邊。而且玻璃就是玻璃,口袋裡的沙(石英)永遠比它硬。
Apple 宣布 Tim Cook 卸任、由硬體工程負責人 John Ternus 接任 CEO。這場換帥背後是一整批資深高層同時退休的世代交替,象徵 Apple 從『業務/服務導向』重新回到『產品導向』的可能轉向。
Data Lakehouse 用「單一物件儲存層 + open table format + 共享 catalog + 治理層」,把原本各自為政的資料湖與資料倉儲合併成一個共享資料層。
NVIDIA 團隊的 Sonic 用約 4200 萬參數,把人類動作影片、語音、音樂甚至文字,轉譯成人形機器人能穩定執行的全身動作;訓練昂貴但成品輕到能在手機上跑,並開源釋出。
Lyra 2.0 用『逐幀 3D 幾何快取』記住場景骨架,讓從單張照片生成的可探索世界在你回頭看時也不會崩壞;核心生成器是類似 Sora 的 diffusion transformer,而且模型與程式碼免費釋出。
不靠人類回饋,語言模型能不能自己發現並修正錯誤?主流做法是 contrastive decoding:刻意製造一個一定會答錯的狀態,把正常輸出與錯誤輸出相減,把生成結果往遠離錯誤的方向推——不動模型參數,只在 inference 階段套用。
用 optical flow 把『動作』從『外觀』中分離,並把它套在 AI 的內部學習訊號上,就能反查某個動作是從哪些訓練影片學來的;再用 Johnson–Lindenstrauss 投影把十億級參數壓到 512 維讓比對變得可行。最後剔除教壞模型的爛資料、用乾淨資料微調,動作品質在使用者研究中拿下 74.1% 勝率。
Sakana AI(東京)做了一個讓你扮演神的數位生態模擬器:一個會學習、會攻防的神經細胞自動機格子世界。你不控制單一生物,只調整環境規則,就能決定整個生態系是滅絕、是脆弱繁榮、還是穩定共存——展示了規則如何徹底形塑系統命運。
AI 推理與 Agent 把記憶體從計算瓶頸推向容量與頻寬瓶頸;HBM 因良率低反而排擠了普通 DRAM 產能,造成四十年來最嚴重的供需失衡。2026 年產能全數售罄,這次的「超級周期」有機會打破過去『撐不過兩年』的鐵律。
透過 Docker 在 GPU 機上部署 Ollama,並在 Windows 用 netsh portproxy 將 localhost:11434 轉發到 GPU 機,讓 Codex 在 Windows 上透明使用遠端 GPU。
用 MiniMax M2.5(10B 激活參數)做一個「你畫我猜」小遊戲,整理出小模型 vibe coding 的三個教訓:架構要極簡、避開冷門技術棧、用速度優勢讓它自我測試與除錯。
群核科技成為「杭州六小龍」首家完成 IPO 的公司,創始人黃曉煌押注空間智能。本文整理空間智能與世界模型、具身智能的關係,以及群核「緊貼物理世界」的技術與商業路線。
業界的資安防護往往「離資料庫越近越鬆散」,後端常直接用 admin 帳號裸連。PostgreSQL 用 role + schema + 欄位 GRANT + RLS 打造由外而內、可細到每一列(甚至每個 cell)的分層權限,把最後一道鎖留在資料庫本身。
AI Agent 表現不好,未必是模型笨。從一個 Gemma 4 2B 修 bug 的小實驗出發,說明什麼是 Harness、Harness Engineering 與 Prompt / Context Engineering 的差異,以及 agents.md 這類自然語言規則的效果。
一套以 Docker Compose 編排的微服務平台:每日自動爬取 arXiv 論文、建立 Qdrant 向量索引,透過 hybrid search + re-ranking + Ollama 完成雙語 RAG 問答,並提供 Email 訂閱與 Grafana 監控。
以股價預測為題,實作涵蓋 ETL、實驗追蹤、模型部署、漂移監控與 CI/CD 的完整 MLOps 生命週期,全部用 Docker Compose 在單機編排起來。
一個把 TTS 與 STT 整合在同一介面的自架平台:TTS 用 Microsoft Edge TTS 的 322 種語音,STT 用本地 Whisper 在純 CPU 上離線推論,結果存進 SQLite,完全免費、無需 GPU 或 API Key。
從 OpenClaw 引爆的裝機熱潮談起,拆解 Agentic Social Network 背後的技術演變:Model Router、Memory OS、協議三層架構,以及讓 Agent 走向長時陪伴、主動行動與自我進化的關鍵機制。
Astro 做靜態渲染與內容管理,Cloudflare Pages/Workers 做部署與動態 API,D1 做輕量資料儲存,Vectorize + Workers AI 做 RAG 語意搜尋,R2 放 OG 圖片和 TTS 音訊。整個 pipeline 從 YouTube 爬取到用戶搜尋,全跑在 Cloudflare 生態系內。