首頁 > 人物 > 科技人物與公司 > Song Han如何把AI模型變小?從Deep Compression、TinyML到AWQ與StreamingLLM
,

延伸主題

Song Han如何把AI模型變小?從Deep Compression、TinyML到AWQ與StreamingLLM

Song Han從Deep Compression、EIE與Tiny...

Song Han AI 模型壓縮、Deep Compression、TinyML、AWQ 與 StreamingLLM 意象
先講結論:Song Han 以 Deep Compression、TinyML、AWQ 與 StreamingLLM 推進模型壓縮和高效推理;真正的效率優化要同時守住模型品質、記憶體、延遲、能源與安全。

Q:Song Han 是誰?
A:他是研究模型壓縮、硬體感知機器學習與高效推理的學者,著名工作包括 Deep Compression、AWQ 與 StreamingLLM。

Q:Deep Compression 做了什麼?
A:透過剪枝、量化與 Huffman 編碼降低模型儲存與推理成本,展示壓縮可保留部分精度。

Q:AWQ 解決什麼?
A:它以 activation-aware 的方式選擇重要權重,改善大型語言模型低位元量化的品質與部署效率。

Q:StreamingLLM 為何需要特殊處理?
A:長時間串流對話會讓 KV cache 增長;保留少量 attention sink 與近期 token 可在有限記憶體下維持穩定。

Q:模型壓縮會犧牲什麼?
A:可能降低長尾、數學、多語或安全任務表現,必須按真實場景驗證,而不是只看平均 benchmark。

Q:如何公平比較量化方案?
A:固定模型、硬體、推理引擎、批次、輸入長度與精度,報告品質、p95 延遲、吞吐、記憶體與功耗。

Q:TinyML 的限制是什麼?
A:邊緣裝置受記憶體、電池、算力與更新能力限制,模型還要處理離線、隱私與故障回退。

Q:壓縮後模型如何做安全測試?
A:重新跑越獄、幻覺、偏見、隱私與工具濫用測試,因量化可能改變輸出分布。

Q:如何確認 Song Han 最新研究?
A:查看論文、MIT/研究團隊頁、開源程式與版本日期,分開記錄研究方法與可部署產品。

作者與編輯責任

本文署名作者:

|YOLO LAB 主編

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

KEEP READING

接著讀什麼?

從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。

·

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀