Jian Sun:深度影像理解、ShuffleNet 與高效視覺系統
Jian Sun(孫劍)的重要性,不只在於他出現在幾篇高知名度論文的作者列,更在於他長期處理一個很實際的問題:深度模型如何從研究室裡的準確率,走到真實平台的速度、記憶體、資料與產品服務。他參與的 ResNet、ShuffleNet 與 ShuffleNet V2,分別把深度網路的可訓練性、行動裝置效率與硬體實測拉到討論中心;在 Microsoft Research Asia 與 Megvii 的工作,則把電腦視覺研究連到 Azure 視覺服務、研究組織、開源框架和大規模競賽系統。理解這條路線,有助於看清楚今天 AI 與 LLM 系統為何不能只比較參數量或 FLOPs。
本文先處理人物身分與時間界線,再拆解他的幾條主要貢獻。文中會明確區分「Jian Sun 是共同作者或團隊主管」與「他個人獨立發明」;ResNet、ShuffleNet、Megvii 競賽成績與 Microsoft 產品,都不應被簡化成一個人單獨完成。
- Jian Sun 官方頁記載他曾在 Microsoft Research Asia 工作十三年,後任 MEGVII Technology Chief Scientist 與 Research Managing Director,研究興趣集中在計算攝影和深度學習影像理解。
- 他是 Deep Residual Learning for Image Recognition 的共同作者之一,這項工作讓更深的網路更容易最佳化,並以 152 層 ResNet 取得 ImageNet 與 COCO 競賽成果。
- 他也是 ShuffleNet 與 ShuffleNet V2 的共同作者,後者把真實速度、記憶體存取與平台特性放到只看 FLOPs 之外。
- 他的工程脈絡包含 Azure Computer Vision、Face APIs、CaptionBot、Kinect Identity、Megvii Research 與 MegEngine 等團隊或組織成果。
- Jian Sun 已於 2022 年 6 月 14 日因突發疾病逝世;本文討論的是他生前留下的研究與系統貢獻,不把其官方頁較早的職稱當成現況。
Jian Sun 是哪一位研究者
「Jian Sun」是常見英文姓名,不能只靠名字判定人物。本文指的是中文名孫劍、曾任 Microsoft Research Asia 研究者,後擔任 MEGVII Technology 首席科學家與 Megvii Research 負責人的電腦視覺研究者。其個人官方研究首頁列出學歷、研究興趣、出版品與產業專案;頁面最後更新於 2020 年,因此適合用來核對生前的職務與成果,不應拿來推斷 2022 年之後的工作狀態。
這個時間界線很重要。CVPR 2022 官方會議紀念資料記載,Jian Sun 是 Megvii Technology Chief Scientist 及 Megvii Research Center Dean,於 2022 年 6 月 14 日逝世。後續談到他的影響時,應使用「留下的研究與系統方法」而不是寫成仍在任或近期發表。
第一條貢獻:讓更深的網路變得可訓練
在深度學習早期,增加層數不只是把模型變大。網路越深,訓練越容易出現最佳化困難;如果每一層都要直接學完整的目標函數,深度可能反而讓訓練和泛化變得不穩定。Deep Residual Learning for Image Recognition提出的核心做法,是讓網路學習相對於輸入的 residual function,再用捷徑連接把輸入與殘差合併。
這個想法的價值不是一句「加了 skip connection」就能說完。它改變了網路深度的工程意義:深層模型可以在保留既有表示的同時,逐步學習需要修正的部分。論文報告的實驗包含最高 152 層的 ResNet,並指出其在 ImageNet 分類、ImageNet 偵測與定位、COCO 偵測與分割等任務取得第一名成果。Jian Sun 是四位共同作者之一,正確的說法是他參與了這個團隊的研究,而不是把 ResNet 寫成他的單人發明。
為什麼殘差連接會影響後來的 AI
殘差學習後來成為許多視覺、語音、生成模型與多模態架構的基本組件。它讓「更深」不再只代表更多參數,而是代表可以設計更長的變換路徑。對今天的 LLM 或視覺語言模型而言,不能直接把 ResNet 等同於 Transformer;但 residual connection 背後的系統思維仍相通:保留可用訊息,再讓新模組學習有限的修正,通常比要求每一層從零重建全部表示更容易訓練與維護。
第二條貢獻:把行動裝置效率從 FLOPs 拉回真實速度
雲端 GPU 上的模型比較,常用 FLOPs 作為計算量指標;但在手機、邊緣裝置或受限的推論環境中,FLOPs 少不一定代表跑得快。記憶體搬移、平行化程度、運算核心、框架實作與目標平台,都可能讓理論成本和實際延遲產生落差。這是 Jian Sun 參與 ShuffleNet 系列時,對 AI 工程很重要的提醒。
早期的ShuffleNet以 pointwise group convolution 和 channel shuffle 等設計,降低行動裝置上的計算與參數負擔。它關心的不是在大型伺服器上追求單一排行榜,而是如何讓影像理解模型在較小的硬體上仍可運作。這也說明為何模型架構、編譯器、記憶體與硬體必須一起設計。
到了ShuffleNet V2,團隊更直接批評只用 FLOPs 評估效率的做法。論文以目標平台上的直接速度為量測對象,將 memory access cost、平台特性與實際延遲納入架構設計,再提出一組能在速度與準確率之間取得平衡的實用準則。Jian Sun 是共同作者之一;他的貢獻脈絡應放在共同研究與工程驗證,而不是把所有設計細節歸給單一作者。
這個方法和今天的 LLM 推論有什麼關係
ShuffleNet V2 不是 LLM 論文,也不能被包裝成生成式 AI 產品。然而它提出的問題,正好能幫助讀者理解 LLM 推論:一個模型在紙面上的參數量、FLOPs 或理論吞吐量,並不等於使用者拿到的首 token 延遲、每 token 延遲、記憶體峰值或每次請求成本。量化、KV cache、批次策略、記憶體頻寬和服務框架,都是同一種「直接量測真實平台」的延伸。
第三條貢獻:把研究模型連到可使用的視覺服務
Jian Sun 官方頁列出他在 Microsoft 研究團隊參與的 AI on Cloud 工作,包括 Computer Vision APIs 與 Face APIs,也提到 CaptionBot 和 Kinect Identity。這些項目不代表他個人獨力完成一個產品,而是顯示他所在的研究團隊如何把影像辨識、臉部分析、字幕描述與身分追蹤等能力,放進使用者可以呼叫的服務或產品流程。
從研究論文到 API,中間有一長串容易被忽略的工作:資料品質、模型版本、延遲控制、錯誤處理、隱私與安全、服務穩定性,以及面對不同裝置和場景時的退化行為。這些工作未必像新架構名稱一樣容易被記住,卻是 AI 真正進入網路產品時不可少的部分。Jian Sun 的產業經歷,讓他的貢獻不只停在模型圖,而是延伸到可部署的視覺系統。
第四條貢獻:在 Megvii 建立研究與工程之間的組織
Jian Sun 官方頁記載,他在 2016 年加入 MEGVII Technology,擔任 Chief Scientist 與 Managing Director of Research,並建立 Megvii Research,涵蓋基礎與應用研究、電腦視覺、深度學習演算法、系統與資料科學。這種角色的影響不只是一篇論文,而是如何讓研究者、工程師、資料團隊和產品組織共同工作。
頁面也列出 Megvii 團隊在 COCO、Mapillary、Places 等挑戰的成果,以及 MegEngine 開源深度學習框架。讀者可以從MegEngine 官方網站與MegEngine 官方 GitHub 儲存庫理解開源框架如何把研究環境、模型訓練和部署工具變成可被其他人檢查與使用的工程入口。這些是團隊成果,本文不將競賽名次或框架維護簡化成 Jian Sun 一人完成。
他的研究路線為什麼對網路產業重要
Jian Sun 的幾個階段可以串成一條清楚的路線:先改善深層網路的訓練,再降低模型在受限平台上的成本,接著把視覺能力放進雲端 API、裝置產品與研究組織。這條路線提醒我們,AI 產業的關鍵人物不只是在論文上提出新名詞,也可能是把「可訓練、可測量、可部署、可維護」這些要求連起來的人。
對 LLM 和多模態系統而言,這種視角特別實用。模型可能在離線評測中很強,實際服務卻因為上下文過長、記憶體不足、工具呼叫延遲或成本失控而難以使用。若沿用 ShuffleNet V2 的問題意識,就會先問目標平台、直接延遲、記憶體存取和錯誤邊界,再談要不要增加參數或改用更大的模型。
從架構論文讀出系統責任
這條路線還有一個常被忽略的管理含義:架構設計者不能只在訓練完成時交付一個 checkpoint。模型要進入服務,還必須有人定義輸入格式、建立評測資料、記錄版本差異、監測延遲和錯誤率,並在硬體或流量變動時重新測量。ResNet 解決的是深度網路的最佳化問題,ShuffleNet V2 解決的是效率判斷問題;兩者共同指向同一個工程要求,也就是把模型的假設寫清楚,讓下一個團隊能在不同環境中重現結果。
這對大型生成模型尤其重要。當一個 agent 同時使用語言模型、檢索、視覺編碼器和外部工具時,瓶頸可能不在單一網路層,而在資料搬運、服務排隊、快取失效或多次重試。若沒有像 ShuffleNet V2 那樣把直接指標放在設計中心,團隊很容易用一個漂亮的離線分數掩蓋整體體驗的退化。Jian Sun 的研究與組織經驗,提醒人們應把架構、平台和產品視為同一個可驗證系統。
三個容易被誤解的地方
Jian Sun 是 ResNet 的唯一發明者嗎
不是。ResNet 論文作者包括 Kaiming He、Xiangyu Zhang、Shaoqing Ren 與 Jian Sun。比較準確的寫法是,他參與了殘差學習團隊研究;貢獻應放在共同作者與研究團隊脈絡中。
ShuffleNet V2 只是在追求更少 FLOPs 嗎
不是。論文正是指出 FLOPs 不能完整代表實際速度,並把 memory access cost 與目標平台特性納入設計。若只把它介紹成「更小的 CNN」,會漏掉它對 AI 系統量測方法的提醒。
他是在做 LLM 的研究者嗎
本文沒有把他改寫成 LLM 研究者。他最具代表性的公開貢獻集中在深度學習、電腦視覺、模型架構、視覺服務與研究工程;本文談他對 LLM 時,只能說這些系統方法提供可借鑑的思考,不能捏造他直接主導某個 LLM 或生成式產品。
讀者可以怎麼讀他的貢獻
- 先讀 ResNet 論文,理解殘差函數如何降低深度網路最佳化難度。
- 再讀 ShuffleNet 與 ShuffleNet V2,注意 group convolution、channel shuffle、記憶體成本和直接速度之間的關係。
- 接著看 Jian Sun 官方首頁列出的 Azure、Kinect、Megvii Research 與 MegEngine,將論文方法放回產品和組織環境。
- 最後用今天的推論系統重新提問:模型是否真的在目標硬體上更快?成本是否能被量測?錯誤與隱私邊界是否被處理?
官方人物圖片與資料來源
以下圖片取自 Jian Sun 個人官方研究首頁,用於辨識本文討論的孫劍。圖片不是 ResNet、ShuffleNet、Megvii 競賽或 Microsoft 產品的紀實照片;人物身分與研究脈絡另由官方頁、論文和 CVPR 紀念資料交叉核對。

延伸閱讀與來源
- Jian Sun 個人官方研究首頁:身分、研究興趣、Microsoft 與 Megvii 工作及團隊成果。
- Deep Residual Learning for Image Recognition:ResNet 共同作者與殘差學習實驗。
- ShuffleNet: An Extremely Efficient Convolutional Neural Network for Mobile Devices:行動裝置效率設計脈絡。
- ShuffleNet V2: Practical Guidelines for Efficient CNN Architecture Design:直接速度、記憶體存取與平台量測。
- CVPR 2022 官方會議資料:Jian Sun 紀念頁與生平時間界線。
- MegEngine 官方網站:Megvii 開源深度學習框架入口。
- MegEngine 官方 GitHub:框架程式碼與工程入口。
- Microsoft Azure AI Vision 官方頁:視覺能力服務化的產業背景。
- Microsoft Research Kinect 專案頁:視覺與身分辨識產品研究脈絡。
Jian Sun 留下的啟示,可以濃縮成一句話:模型的突破只有在能被訓練、能在真實平台測量、能被團隊維護並且能對使用者提供穩定能力時,才會真正改變網路產品。從 ResNet 的深度、ShuffleNet V2 的速度,到視覺 API 和開源框架,這是一條把演算法帶進系統的路線。
KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。


發表迴響