先講結論:Song Han 以 Deep Compression、TinyML、AWQ 與 StreamingLLM 推進模型壓縮和高效推理;真正的效率優化要同時守住模型品質、記憶體、延遲、能源與安全。
Q:Song Han 是誰?
A:他是研究模型壓縮、硬體感知機器學習與高效推理的學者,著名工作包括 Deep Compression、AWQ 與 StreamingLLM。
Q:Deep Compression 做了什麼?
A:透過剪枝、量化與 Huffman 編碼降低模型儲存與推理成本,展示壓縮可保留部分精度。
Q:AWQ 解決什麼?
A:它以 activation-aware 的方式選擇重要權重,改善大型語言模型低位元量化的品質與部署效率。
Q:StreamingLLM 為何需要特殊處理?
A:長時間串流對話會讓 KV cache 增長;保留少量 attention sink 與近期 token 可在有限記憶體下維持穩定。
Q:模型壓縮會犧牲什麼?
A:可能降低長尾、數學、多語或安全任務表現,必須按真實場景驗證,而不是只看平均 benchmark。
Q:如何公平比較量化方案?
A:固定模型、硬體、推理引擎、批次、輸入長度與精度,報告品質、p95 延遲、吞吐、記憶體與功耗。
Q:TinyML 的限制是什麼?
A:邊緣裝置受記憶體、電池、算力與更新能力限制,模型還要處理離線、隱私與故障回退。
Q:壓縮後模型如何做安全測試?
A:重新跑越獄、幻覺、偏見、隱私與工具濫用測試,因量化可能改變輸出分布。
Q:如何確認 Song Han 最新研究?
A:查看論文、MIT/研究團隊頁、開源程式與版本日期,分開記錄研究方法與可部署產品。
KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。


發表迴響