訓練資料還沒用完:Jeff Dean 談合成資料與 RL rollouts
Jeff Dean 在一場訪談中回應「LLM 快沒訓練資料了」的說法:其實還有大量影片資料、合成資料,以及對既有資料更聰明的利用空間。他也用 RL rollouts 解程式題為例,說明合成資料要靠層層過濾才真正有用。
Tag
4 篇文章
Jeff Dean 在一場訪談中回應「LLM 快沒訓練資料了」的說法:其實還有大量影片資料、合成資料,以及對既有資料更聰明的利用空間。他也用 RL rollouts 解程式題為例,說明合成資料要靠層層過濾才真正有用。
「AI 能創造更厲害的 AI」不是一個 yes/no 問題,而是一條人類逐步放手的光譜。真正的技術主軸是:訓練所依賴的 loss / reward,能被 AI 自己接手到什麼程度——而目前仍離不開人類。
機器人的瓶頸不在模型而在資料,因為動作資料網路上不存在、必須人工採集。業界用『遙操 / 仿真 / 動捕 / 影片』四層金字塔混搭,各有品質與規模的取捨;本文以《硅谷101》走訪上海數採工廠與多家機器人公司的內容,拆解每一層的技術現況與難題。
從 Cursor 團隊談 Composer 1.5 的訪談整理:他們為什麼要自研模型、RL 能帶來哪些外部工具做不到的能力,以及支撐 RL 訓練所需的自建基礎設施。