← 首頁

Tag

#training-data

3 篇文章

概念解析

機器人的資料荒漠:四層資料金字塔,與真機資料為什麼這麼貴

機器人的瓶頸不在模型而在資料,因為動作資料網路上不存在、必須人工採集。業界用『遙操 / 仿真 / 動捕 / 影片』四層金字塔混搭,各有品質與規模的取捨;本文以《硅谷101》走訪上海數採工廠與多家機器人公司的內容,拆解每一層的技術現況與難題。

研究筆記

AI 影片的動作為什麼總是怪怪的?答案不是更多資料,而是更少

用 optical flow 把『動作』從『外觀』中分離,並把它套在 AI 的內部學習訊號上,就能反查某個動作是從哪些訓練影片學來的;再用 Johnson–Lindenstrauss 投影把十億級參數壓到 512 維讓比對變得可行。最後剔除教壞模型的爛資料、用乾淨資料微調,動作品質在使用者研究中拿下 74.1% 勝率。