Jingdong Wang:高解析度表徵、OCRNet 與向量搜尋的視覺 AI 貢獻
如果把今天的多模態模型想成一座城市,語言模型只是其中一條主要街道,還需要視覺表徵、物件理解、向量檢索與可部署的索引系統,城市才真的能讓資料流動。Jingdong Wang(王井东)的研究正好位在這些接口上:他參與的 HRNet 保留高解析度視覺資訊,OCRNet 把物件上下文放回像素級分割,NGS 與 SPTAG 則把近鄰搜尋推向大規模向量服務。這些工作不是「他單獨發明了整個多模態 AI」,而是把共同研究成果變成可被後續系統重用的骨架。
本文介紹的是 Baidu 與 Microsoft Research Asia 研究脈絡中的 Jingdong Wang,不是其他同名的 Wang。Jingdong Wang 個人學術首頁列出他曾任 Microsoft Research Asia Senior Principal Researcher,也說明現時研究關注多模態理解與生成、diffusion model、world model、神經架構設計與大規模向量相似度搜尋。這些方向讓他適合放進 LLM 基礎設施系列,但文章會把視覺模型、檢索系統與語言模型的邊界分開說,避免把電腦視覺論文直接改寫成 LLM 發明史。
先釐清 Jingdong Wang 的位置:他不是只做一個 backbone
研究人物常被壓縮成一個熱門名詞:HRNet、Transformer 或 vector search。這種摘要方便搜尋,卻會漏掉真正重要的工程問題。影像中的人體關節、道路邊界與小物件需要空間精度;語意分割要知道一個像素屬於哪個物件;RAG 或多模態 agent 則要從大量向量中找到可用的候選。這三種問題使用的資料型態不同,但共同要求表徵既要有語意,也不能丟掉細節,還要能在合理成本下被查找與部署。
Jingdong Wang 的貢獻可以沿著三層理解。第一層是視覺表徵:HRNet 不先把所有影像壓成低解析度,再最後補回細節,而是在網路中維持多個解析度並反覆交換資訊。第二層是任務理解:OCRNet 讓像素預測參考物件區域的上下文,使分割不只看單一像素附近的局部紋理。第三層是資料基礎設施:NGS 與 SPTAG 把近鄰圖、索引建置、查詢與線上服務放進同一個工程問題。這條路線說明模型品質和資料可取得性必須一起設計。

Jingdong Wang 的三項重要貢獻
Jingdong Wang 的研究可以整理成三項彼此相連、但各自解決不同瓶頸的貢獻:以 HRNet 維持高解析度表徵,把 OCRNet 的物件上下文送回像素理解,再用鄰域圖搜尋與 SPTAG 把大規模表徵變成可查找的系統。這條路線和 Jian Sun 的高效 CNN、Bo Dai 的 agent 決策不同;Jingdong Wang 的重點是視覺表徵如何被保留、理解與檢索。
以 HRNet 讓高解析度表徵一路參與理解
HRNet 的核心不是最後才把低解析度特徵放大,而是在整個網路過程中維持高解析度分支,並與其他解析度交換資訊。Jingdong Wang 官方首頁與HRNet 原始論文支撐這項研究脈絡。對多模態 LLM 或視覺 agent,這提醒團隊保留定位、邊界與細節,不要把所有視覺證據壓成無法回溯的單一摘要。
用 OCRNet 把物件上下文帶回像素分類
OCRNet 的 object-contextual representation 先聚合同類物件的上下文,再讓像素參考「它屬於什麼物件」,把局部判斷與整體語意連起來。OCRNet 原始論文支撐這個具體貢獻。放到視覺 RAG 或多模態 agent,檢索結果不能只看局部相似區塊,也要保留物件身份、場景關係與來源位置,才能避免把正確像素配到錯誤實體。
用鄰域圖搜尋與 SPTAG 支撐大規模向量查找
Jingdong Wang 的另一條重要路線,是把向量表示送進可擴展的鄰域圖搜尋與工程系統。Microsoft SPTAG 官方程式庫提供實作入口;這讓向量搜尋不只是相似度公式,而要面對索引建置、記憶體、更新、召回、延遲與硬體。對 LLM RAG,top-k 結果仍需再做身份、時間、權限與證據驗證,不能把近鄰排名直接當成可引用事實。
因此,他的獨特位置是把高解析度表徵、物件上下文與大規模檢索連成一條視覺 AI 基礎設施路線;具體論文與產品成果仍屬共同作者和團隊工作,不應濃縮成單人發明。
HRNet:在高解析度狀態中持續學習
傳統視覺 backbone 常把影像逐步下採樣,讓特徵圖變小、計算量下降,再用 decoder 或上採樣把空間細節找回來。這種方式並非錯誤,因為低解析度能帶來較大的感受野與較低的成本;問題是某些任務在找回細節時,已經失去了定位所需的資訊。人體姿態估計要辨識手腕、腳踝等關鍵點,語意分割要貼住物件邊界,小物件偵測也不能只剩下一個模糊的 activation。
HRNet 的核心做法是從高解析度分支開始,逐步加入低解析度分支,讓不同解析度的卷積流平行運作,再反覆交換資訊。高解析度分支保留位置精度,低解析度分支提供更廣的語意與上下文;多次融合後,網路不必在最後才從低解析度猜回高解析度。HRNet 原始論文把這個設計用於人體姿態、語意分割與物件偵測,重點不是把「高解析度」當作影像放大,而是把高解析度表徵放在整段學習過程裡。
這個觀念對多模態模型仍然有啟發。視覺語言模型常先用 image encoder 把圖片變成一組 visual tokens,再交給跨模態模組或語言模型。若 encoder 只保留全局語意,模型可能知道畫面「像一個廚房」,卻分不清刀具、手指與容器的相對位置;若只保留局部細節,又可能缺乏整體場景關係。HRNet 的多解析度融合不是 LLM 的直接解法,但它提供一個可檢驗的設計問題:哪些空間訊號應該保留到後面的決策階段?
從 HRNet 到視覺基礎模型:代表性不是只看排行榜
HRNet 能成為廣泛使用的視覺骨幹,原因不只在單一資料集的分數。高解析度表示可以接到姿態估計、分割、偵測、臉部對齊與自動駕駛等任務,研究者可以把 backbone、head 與資料流程拆開重用。這種可組合性對基礎模型很重要:一個真正有影響力的中間表示,應該能被不同任務驗證,而不是只在一個封閉 demo 裡看起來有效。
也要注意共同作者與團隊歸屬。HRNet 論文由 Jingdong Wang、Ke Sun、Tianheng Cheng、Borui Jiang 等多位作者共同完成,不能把每個架構細節都寫成單人靈感。比較準確的說法是,Jingdong Wang 參與了這條高解析度視覺表徵路線,並透過論文、程式碼與後續任務建立可延伸的研究入口。人物介紹若把共同成果還原為團隊網絡,讀者反而更能理解研究如何被傳播。
OCRNet:讓像素理解參考「這是什麼物件」
語意分割的輸出看似只是一張每個像素都有類別的圖,但每個像素的判斷不能完全孤立。相鄰區域可能屬於同一個物件,也可能是背景;同一個物件在陰影、遮擋或紋理變化下,局部訊號可能不一致。OCRNet 的 object-contextual representation 先利用物件區域取得上下文,再讓像素表示與對應物件的語意互相作用。這種做法把「像素屬於哪個類別」和「這些像素共同組成什麼物件」接在一起。
對 LLM 或 vision-language agent 而言,這裡的價值不在於直接把 OCRNet 接進聊天模型,而在於它示範了粒度之間如何互相校正。模型可以同時保留局部 token 與更高層的 object token,再由任務決定要查詢哪一層。當 agent 要回答「桌上有哪些東西」或要執行視覺操作時,單純的全局 embedding 可能不夠;物件、區域、深度與座標的結構,會影響工具呼叫是否安全。
這也提醒我們不要把 segmentation 的準確率直接等同於世界理解。OCRNet 解決的是視覺表徵與像素標註問題,它不會自動產生因果推理、常識或語言對話能力。把它放入多模態系統時,還要處理資料標註、跨模態對齊、時間變化、權限與不確定性。好的介紹應該說明它提供哪一層能力,也說明它沒有承諾什麼。
向量搜尋:把表徵送進可查找的資料結構
模型把文字、圖片或程式碼轉成 embedding 之後,下一個問題不是「向量漂亮嗎」,而是「在數十億筆候選中能否找到相關資料」。暴力比較所有向量的成本會隨資料量增長,實際系統因此需要近似最近鄰搜尋、索引建置、更新策略、記憶體配置、分散式查詢與結果驗證。這些工作不如模型名稱醒目,卻決定 RAG 是否能在延遲與成本限制下運作。
Jingdong Wang 的官方首頁把 NGS 與 SPTAG 放在代表性工作中。NGS 指向以鄰居圖為基礎的近似搜尋脈絡,SPTAG 則是公開的向量索引與服務工具。這條研究線把高維向量如何建立圖、如何搜尋候選、如何在大規模資料上提供線上服務,變成可以被工程團隊檢查的元件。它不是單純把 cosine similarity 寫進一個 API,而是要同時面對索引品質、建置時間、記憶體、更新與分散式部署。
對 LLM agent,向量搜尋最常見的用法是把文件切塊、建立 embedding、查詢候選,再交給生成模型整理答案。但向量近似不代表事實已被證明。資料來源、時間、權限與版本仍要在 metadata 中保存,檢索結果還要通過去重、引用與新鮮度檢查。Jingdong Wang 的向量搜尋工作提供的是「如何把候選找回來」的基礎,不是替生成模型保證答案正確。這個界線很重要,否則搜尋服務會被誤當成事實驗證器。
SPTAG 的工程意義:研究方法必須面對服務現場
一個近鄰搜尋系統要能被使用,至少要回答幾個問題:索引建立時資料怎麼分區或連邊?查詢時如何在準確率和延遲間取捨?資料更新後,舊索引是否需要重建?多台機器如何切分與合併結果?服務故障時,系統能否退回較慢但可用的路徑?這些問題會讓演算法與平台工程互相牽制,也讓「研究上可行」和「生產環境可用」之間出現清楚差距。
SPTAG 的價值正在於把向量索引、搜尋與線上服務的接口公開,讓團隊能以自己的資料與硬體重跑測試。可重現不等於每個人都得到相同延遲,因為資料分布、硬體、索引參數和更新頻率都會改變結果;但公開的工具與文件至少讓比較不必停在宣傳句。對 AI 基礎設施來說,能測量、能替換、能追蹤退化,往往比一個漂亮但封閉的分數更有長期價值。
自監督表徵與生成模型:從辨識走向可轉移的特徵
Jingdong Wang 的後續研究也延伸到 Context Autoencoder、diffusion training、multimodal understanding 與 world models。自監督學習的核心問題是:沒有為每張資料提供昂貴的人工標籤時,模型怎樣從資料本身學到可轉移的表示?遮蔽、重建、對比或流式生成都可能提供學習訊號,但真正的評估仍要回到下游任務、資料分布轉換與失敗案例。
Context Autoencoder 類方法把上下文與可見內容的關係放進自監督訓練,讓視覺 encoder 不只記住局部像素。這種研究對多模態預訓練有間接意義:如果視覺表徵只靠標籤學習,覆蓋範圍會受標註成本限制;如果只追求重建,又可能學到與決策無關的細節。後續仍需要用姿態、分割、檢索、生成或人機互動任務測量表示是否真的有用。
生成模型與向量搜尋也不應被混成同一件事。diffusion model 主要處理如何從噪聲或條件生成資料,向量搜尋主要處理如何從索引找回候選;多模態 agent 可能同時使用兩者,但它們的目標、錯誤型態和評估方式不同。把研究路線拆開,才有辦法知道系統失敗是因為影像表示不足、搜尋召回不足、生成模型幻覺,還是工具執行環境本身有問題。
他與 LLM 的關係:不是語言模型作者,而是多模態底層的建造者
Jingdong Wang 的代表作主要來自電腦視覺、影像表示與向量搜尋,因此不應把他描述成某個大型語言模型的單一發明者。更準確的說法是,他的研究解決了 LLM 走出純文字之後會遇到的幾個底層問題:視覺訊號如何保留位置與物件結構,跨任務表徵如何被重用,龐大的 embedding corpus 如何被快速查詢,以及開源工具如何讓研究進入產品與服務。
這些能力可以接到多模態 RAG、文件影像理解、視覺問答、機器人與世界模型,但「可以接到」不代表研究已經完成整個產品。系統仍要有資料治理、權限隔離、評估集、引用鏈、延遲預算與人工覆核。若回答涉及醫療、金融或現場控制,還要將不確定性與停止條件寫入流程。Jingdong Wang 的工作讓這些系統有更好的表示和檢索零件,卻不會替團隊免除產品責任。
如何把他的成果放進一張 AI 技術地圖
可以用一個由下而上的流程讀他的貢獻。第一步是影像進入 encoder:HRNet 類架構讓高解析與低解析訊息共同學習。第二步是任務 head:OCRNet 類方法用物件上下文改善像素級理解。第三步是表示輸出:模型把影像、文字或區域轉成可比較的向量。第四步是索引與查詢:NGS/SPTAG 類系統在大型向量集合中找出候選。第五步才是跨模態模型或 LLM 將候選與指令結合,完成說明、規劃或工具呼叫。
這張圖也能幫助工程師定位錯誤。如果分割邊界錯了,問題可能在高解析表徵或資料標註;如果物件關係混亂,可能是 object context 或跨模態對齊不足;如果 RAG 找不到正確文件,可能是 chunk、embedding、索引或 metadata;如果檢索正確但答案仍錯,才需要往生成、引用與指令遵循追查。把每層責任分開,是比只盯著 LLM 最終回答更可靠的除錯方式。
容易被誤讀的三件事
第一,HRNet 的高解析度不是把輸入圖片放大,也不是所有任務都應無條件使用最高解析度;解析度、記憶體與延遲仍要按任務選擇。第二,SPTAG 的近似搜尋不是精確排序器,召回率、查詢延遲與索引成本之間需要明確的產品取捨。第三,官方首頁列出的代表性工作是共同作者與團隊成果,介紹人物時要保留作者名單與合作脈絡,不能把整個研究社群的成果集中成個人傳記。
還有一個常見混淆:Jingdong Wang(王井东)和 Jian Sun(孫劍)都曾與中國的視覺研究、Microsoft Research 或深度學習系統發生關聯,但不是同一個人。前者在本文聚焦 HRNet、OCRNet、向量搜尋與多模態表徵;後者的文章則應另行討論 ResNet、ShuffleNet 或 Megvii 的研究脈絡。人物去重不只是避免兩個 slug 相似,也要避免把不同研究者的共同作者、任職與論文互相拼接。
給今天 AI 團隊的實作啟示
若團隊正在做視覺 RAG 或多模態 agent,可以先把需求拆成幾個可量測問題:需要保留多細的空間資訊?物件和場景的上下文怎麼表示?每次查詢要從多少候選中找回幾筆?更新索引的頻率和成本是多少?當檢索結果不足或模型無法確認時,系統要如何停止?這些問題不必等待更大的模型才處理,因為它們屬於表示、索引與評估層。
更具體的做法,是在同一份評估集中記錄視覺定位、物件級理解、向量召回、生成答案與引用正確率。比較不同 encoder 時,不只看總分,也看小物件、遮擋、長尾類別與不同影像尺寸;比較向量索引時,不只看平均延遲,也看尾端延遲、更新後退化、索引記憶體與錯誤回退。這種可拆分的驗證方式,正是 HRNet、OCRNet 與 SPTAG 這些工作留給 LLM 時代的實際方法論。
官方資料與延伸查證
- Jingdong Wang 個人官方學術首頁:核對身份、研究方向、HRNet、OCRNet、NGS/SPTAG 與多模態研究脈絡。
- Jingdong Wang 官方首頁人物圖:核對本文使用的官方人物照片來源。
- Deep High-Resolution Representation Learning for Visual Recognition:核對 HRNet 的高解析分支、多解析度融合與視覺任務。
- Object-Contextual Representations for Semantic Segmentation:核對 OCRNet 的物件上下文與語意分割方法。
- Microsoft SPTAG 官方 GitHub:核對大規模向量索引、搜尋與線上服務工具。
- Microsoft Research:近鄰圖搜尋技術報告:延伸查核 NGS 與近似最近鄰搜尋的研究脈絡。
- Context Autoencoder for Self-Supervised Representation Learning:核對自監督視覺表徵與上下文重建方向。
- OpenReview:延伸查核自監督表徵與生成模型研究的公開評審資料入口。
- HRNet 官方程式碼組織:核對高解析視覺模型的公開實作入口。
- ACM:延伸查核 Jingdong Wang 的 ACM Distinguished Member 與專業社群脈絡。
本文以 Jingdong Wang 個人官方首頁、arXiv 原始論文、Microsoft Research 技術資料與 Microsoft 官方 SPTAG 程式庫整理。HRNet、OCRNet、NGS、SPTAG 與自監督研究都有共同作者和工程團隊,本文保留這個合作邊界;對 LLM 的連結是基於多模態表徵、向量檢索與系統分層的技術解讀,不宣稱上述視覺或搜尋工作等同於單獨完成一個大型語言模型。
KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。


發表迴響