Jianfeng Gao 如何用 DSSM 與 Agentic AI 把搜尋理解變成可擴展的 Copilot 基礎設施?
搜尋系統最難的地方,往往不是把更多文件放進索引,而是理解使用者用一種語言提問、文件用另一種語言描述時,兩者到底是否在談同一件事。Jianfeng Gao 的公開研究從這個問題出發,延伸到 Deep Structured Semantic Model(DSSM)、查詢理解、排序、對話、多模態互動與 agentic AI。Microsoft Research 官方人物頁列出他是 Microsoft Technical Fellow、Corporate Vice President,並整理他在 Bing、Ads、Azure AI、Office/M365 與 Copilot 相關 AI 模型方向的公開身分;DSSM 官方專案頁則說明如何把查詢與文件投影到共同語意空間。本文聚焦一個工程搜索意圖:如何把搜尋理解、檢索、工具使用與 agent 評估接成可驗證的 Copilot 基礎設施。
Jianfeng Gao 的核心問題:查詢與文件如何對齊
關鍵字搜尋擅長處理精確詞彙,卻容易被同義改寫、縮寫、跨語言和自然問句打敗。使用者可能搜尋「如何降低 Copilot 回答延遲」,文件卻寫成「context retrieval latency optimization」。如果系統只比對表面字串,真正有用的文件就可能被漏掉;如果系統只追求語意相似,又可能把主題相近但無法解決任務的內容排到前面。
Gao 的研究路線把這個問題變成可測量的表示學習任務:讓查詢和文件各自經過模型,映射到一個可比較的語意空間,再以距離或相似度估計相關性。對今天的 RAG 與 agent 來說,這不是把 DSSM 原封不動搬進產品,而是提醒團隊先定義「相關」對讀者意味著什麼,再選擇表示、召回和重排方法。
DSSM:從共同語意空間建立檢索入口
Learning Deep Structured Semantic Models for Web Search using Clickthrough Data描述一種把查詢和文件放進共同低維空間的方式,並用點擊資料學習查詢與文件的相關性。這個設計的重點不只是神經網路,而是把真實使用者行為轉成弱監督訊號:使用者輸入查詢、看到結果、點擊文件,這串互動可以幫助系統學習哪些結果更可能解決需求。
弱監督並不等於真理。點擊會受到排名位置、標題、品牌熟悉度、裝置、時間和誤點影響,因此建立現代檢索系統時,必須把點擊率和任務成功分開觀察。RAG 團隊可以同時保存召回率、有效引用率、讀者是否完成任務、人工升級率與高風險錯誤,避免模型只學會讓結果「看起來值得點」。
從語意相似度走向查詢意圖
相似度只能回答「兩段文字像不像」,不能單獨回答「這份文件能不能完成讀者任務」。客服查詢可能需要最新版本、正確權限和特定地區條款;程式查詢需要可執行範例;研究查詢需要論文假設和限制。好的 Copilot 檢索流程應把語意表示和 metadata、時間、新鮮度、權限、文件類型與任務分類一起使用。
一個可重播的查詢路由可以分成四步。第一步辨識查詢要找事實、操作步驟、比較、摘要還是執行工具。第二步用 embedding 或其他語意模型擴大候選集合。第三步用 reranker 檢查問題、文件、權限與新鮮度是否一致。第四步才讓 LLM 根據通過檢查的證據產生回答。每一步都要留下版本與輸出,才知道錯誤來自理解、召回、排序還是生成。
OWL-QN 與工程效率:大規模學習要管理成本
Gao 的官方 toolkit 頁同時列出 OWL-QN 與 DSSM。這提醒我們,模型效果和訓練效率不是兩條完全分離的路線。搜尋、廣告和 agent 系統都面對大資料量、稀疏特徵、更新頻率和延遲預算;若每次實驗都需要不可負擔的計算,團隊就無法快速驗證錯誤假設。
對 LLM 基礎設施而言,效率要被寫進設計:離線索引與線上重排要有不同的成本上限;小模型可以處理大多數低風險查詢,只有衝突或不確定案例才升級;快取要標註資料版本與失效時間;訓練資料要保存去重、品質和權限資訊。節省 token 或 GPU 時間只有在沒有把錯誤成本轉嫁給讀者時,才算真正改善。
搜尋到 Copilot:檢索是行動前的證據層
Copilot 不只是問答介面,而是可能讀取文件、呼叫工具、修改資料或執行工作。這讓搜尋品質直接連到行動安全:如果召回內容過期,agent 可能採取錯誤步驟;如果重排把權限外文件帶入上下文,可能造成資料外洩;如果生成模型把兩份相近但互相衝突的文件合併,讀者可能得到一個沒有來源的折衷答案。
因此,檢索結果進入 prompt 前應經過證據閘門。文件必須有來源、版本、權限與抓取時間;衝突資料要被標記而不是靜默合併;高風險行動要要求人工核准或第二來源;工具執行要保存參數、回傳與 rollback 路徑。LLM 可以負責整理與解釋,但不能取代來源核對和權限決策。
Agent AI:多模態互動需要可驗證的狀態
Microsoft Research 的 Agent AI 出版頁整理了多模態互動、LLM agent、知識增強和工具使用等研究。當 agent 同時理解文字、影像、網頁和環境狀態時,單一文字相似度已經不夠。系統還要知道觀察到的內容是否和當前任務對齊、視覺證據是否新鮮、工具回傳是否完整,以及下一步是否會改變外部狀態。
工程上可以把 agent 狀態拆成 observation、evidence、plan、action 和 result。每個狀態都要有時間戳、來源、模型版本和信心訊號;若 observation 和 evidence 不一致,先停在澄清或重試;若 action 會造成不可逆改變,要求更高權限;若 result 與預期不符,保留失敗現場並回到檢索或規劃步驟。這種設計比讓模型自由延長思考文字更容易測試。
從 Agentic AI 到可重播評估
Gao 的研究動態頁列出 Argos、PlugMem 等與 agent、記憶和多模態驗證相關的研究。這些工作提醒產品團隊:agent 的品質不只在最後一句答案,而在它如何使用觀察、記憶、工具與驗證器。若只保存輸出文字,就無法知道系統是找到錯資料、選錯工具,還是正確執行後被模型錯誤總結。
可重播評估至少要保存五類資料:原始查詢與使用者權限、召回候選與排序分數、送入模型的證據、工具呼叫與回傳、最後的任務結果。再把資料依查詢類型、語言、長度、新鮮度、衝突程度和風險切片,才能比較新的 embedding、reranker、prompt 或模型是否真的改善。平均成功率上升,不能掩蓋高風險切片退步。
PlugMem 與記憶:保留經驗不等於塞滿上下文
Agent 記憶常被誤解成把所有歷史對話都放回 context。歷史越多,檢索成本和雜訊越高,過期資訊也可能被模型當成當前事實。比較穩定的做法是把互動整理成可驗證的記憶單元,保存來源、適用範圍、建立時間、失效條件與信心;每次使用前重新檢查是否與現在的權限和任務相符。
記憶也應該有刪除與降級路徑。當資料過期、使用者撤回授權、來源被修正或模型版本改變,系統要能標記失效而不是繼續召回。對高風險決策,歷史記憶只能作為候選線索,不能取代最新官方文件或人工確認。好的 memory layer 讓 agent 少走重複路徑,同時保留不確定性和證據邊界。
多模態與搜尋理解的共同評估框架
Agent AI 多模態研究把 agent 放進實體或虛擬環境,強調模型需要理解視覺與上下文。把這個思路接到搜尋,可把每次任務的評估拆成三層:語意層確認查詢、文件和觀察是否對齊;證據層確認重要主張有可核對來源;行動層確認工具執行完成且沒有越權。
三層不應被壓成單一分數。語意層高分但證據層失敗,代表回答很像正確答案卻沒有支持;證據層通過但行動層失敗,代表 agent 找對文件卻沒有正確執行;行動層成功但記錄不完整,代表結果難以稽核。把失敗類型分開,修復才會有方向。
從搜尋排名到 Copilot 品質:需要校準而非自信語氣
搜尋排序分數、embedding 相似度、LLM token 機率與 agent 自我評估都不是同一種信心。它們必須用標註過的任務結果校準,才能知道某個分數範圍代表多少成功率。對低風險問答,可以用小模型和快取降低成本;對高風險或證據衝突任務,應升級模型、重新檢索或要求人工。
校準資料要和流量一起變化。索引更新、文件版本、模型升級、提示變更、語言和使用者群體都可能讓原本的門檻失效。上線後應監測錯誤漏放率、人工升級率、來源覆蓋率、工具失敗率和不同切片的任務完成率,並保留舊版路由作為對照。這些資料才能回答「變快」是否真的值得。
公開證據的邊界:共同研究不等於單人產品所有權
Microsoft Research 官方人物頁、DSSM 專案頁、搜尋論文、Agent AI 出版頁與 Jianfeng Gao 的出版清單,支持他在搜尋語意表示、自然語言、深度學習、agent 和多模態研究上的公開脈絡。這些來源可以確認研究方向、作者群和方法背景,但不能把共同作者的成果改寫成他一人獨立完成,也不能把學術研究直接宣稱為任何商業 Copilot 產品的唯一技術來源。
本文把 DSSM、檢索、agent 記憶和多模態驗證延伸成工程建議,是基於公開證據的系統推論。實際部署仍要依自己的資料、硬體、權限、法規和錯誤成本重新測量;任何「更準」、「更快」或「更省」的說法,都需要在目標流量和可重播測試中取得新證據。
為什麼 Jianfeng Gao 值得進入 AI/LLM 名人堂
LLM 基礎設施的瓶頸,不只是模型參數量,而是系統能否理解查詢、找到可用證據、選擇正確工具並把不確定性傳給下一個決策。Jianfeng Gao 的研究路線從 DSSM 的共同語意空間,連到搜尋與廣告的規模化學習,再延伸到多模態、agent、記憶與驗證。這使「搜尋」不再只是結果頁,而成為 Copilot 可靠行動前的證據層。
把他放進名人堂,代表我們重視一種可重用的基礎設施思維:先把讀者意圖轉成可測量任務,再讓表示、召回、排序、生成和工具執行各自留下證據;先管理成本、權限和失敗回復,再宣稱 agent 具有規模化能力。當 AI 從回答問題走向替人完成工作,這些可驗證的連接比單純追逐更大的模型更能決定系統是否值得信任。
延伸閱讀與核對入口
- Microsoft Research 官方人物頁:現職、研究方向與官方肖像。
- Jianfeng Gao 官方 toolkit:DSSM 與 OWL-QN 工具入口。
- DSSM 專案頁:共同語意空間、資訊檢索與排序。
- DSSM Web search 論文:點擊資料與查詢文件表示。
- Agent AI 出版頁:LLM agent、知識增強與多模態互動。
- Jianfeng Gao 出版清單:搜尋、DSSM 與近期 agent 研究。
- 研究動態與獎項:Argos、PlugMem 等研究入口。
- Microsoft Research Podcast:DSSM 與語意空間的原始說明。
- Microsoft Azure 作者頁:Microsoft 端的研究者與產品脈絡。
- Agent AI 多模態研究:環境互動與 context-aware agent。

KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。


發表迴響