J-lens:Anthropic 從『全域工作空間』找到 Claude 內在思考的可解釋性新工具
Anthropic 提出 J-lens,一種捕捉 Transformer 內部『可語言化』表示的可解釋性工具,並用它證實 Claude 內部存在類似神經科學『全域工作空間』的特權子空間——一小組向量對外廣播、驅動推理、可被使用者調控,也在欺騙與評估感知時洩漏訊號。
Tag
4 篇文章
Anthropic 提出 J-lens,一種捕捉 Transformer 內部『可語言化』表示的可解釋性工具,並用它證實 Claude 內部存在類似神經科學『全域工作空間』的特權子空間——一小組向量對外廣播、驅動推理、可被使用者調控,也在欺騙與評估感知時洩漏訊號。
上週 Anthropic 呼籲全球 AI 實驗室一起裝上「協調煞車」,這週卻發布了號稱史上最強的 Claude Fable 5。它和只限受控存取的 Mythos 5 其實是同一個底層模型,差別只在一層 classifier 「口罩」,並用 6/22 到期的限時開放製造 FOMO。
Two Minute Papers 讀完 Opus 4.8 長達 244 頁的 system card:這一版最大的賣點不在智商,而在「水管」——它不再對自己寫的程式碼說謊、不再偷懶亂猜。
Anthropic 這週同時做了兩件互相矛盾的事:申請兆元估值 IPO,以及呼籲全球一起踩煞車暫停 AI。本文整理這個矛盾背後的三種可能結局。