CPU、GPU、TPU 有什麼不同?為什麼同一個運算跑起來差這麼多
同一個運算在 CPU、GPU、TPU 上表現差很多,因為三種晶片針對的計算型態不同:CPU 追求彈性、GPU 追求平行吞吐量、TPU 專攻機器學習的張量運算。
Tag
2 篇文章
同一個運算在 CPU、GPU、TPU 上表現差很多,因為三種晶片針對的計算型態不同:CPU 追求彈性、GPU 追求平行吞吐量、TPU 專攻機器學習的張量運算。
不靠人類回饋,語言模型能不能自己發現並修正錯誤?主流做法是 contrastive decoding:刻意製造一個一定會答錯的狀態,把正常輸出與錯誤輸出相減,把生成結果往遠離錯誤的方向推——不動模型參數,只在 inference 階段套用。