Jason Weston 如何把預訓練、記憶網路與對話代理接到 LLM?從 DrQA 到自我改進系統
Jason Weston 的研究路線,串起了今日 LLM 產品常見的幾個元件:語言預訓練、記憶網路、開放域問答、對話代理、檢索與自我改進。AI at Meta 的官方人物頁列出他是 Meta 的研究科學家、NYU Visiting Research Professor,研究興趣涵蓋 reasoning、memory、perception、interaction 與 communication,並列出 Conversational AI、核心機器學習、NLP、強化學習及語音音訊等研究領域。他的官方個人頁則整理了從 NLP from scratch、Memory Networks、DrQA 到對話系統的研究脈絡。這些工作對 LLM 的啟示,不是把早期模型直接等同於今天的產品,而是把「模型如何取得外部證據、保存可用記憶、和人互動並從回饋改善」拆成可以驗證的系統問題。

從 NLP from scratch 到預訓練:先學表示,再適配任務
早期 NLP 系統常為每一個任務建立不同的特徵和分類器,詞彙、句法和任務規則彼此分離。Weston 與合作者參與的神經方法,推動把語言表示從大量手工特徵轉向可學習的向量,再用少量任務資料進行微調。這條路線後來成為預訓練加微調的常見模式:模型先在廣泛資料中學習語言規律,再針對分類、問答、對話或檢索等任務調整。
預訓練的好處不是所有任務都自動變簡單。表示可能包含資料偏見、過時事實或不符合新領域的詞義;微調資料太少時,模型可能只記住格式,沒有真正學會任務。團隊應分開測量預訓練表示、任務適配和部署資料的差異,並保留版本、來源和刪除紀錄。當一個模型回答錯誤時,問題可能在原始語料、微調資料、提示模板或檢索流程,不能只靠重新訓練一個更大的模型。
對今天的 LLM,這個歷史也提醒我們把「模型知道什麼」和「產品允許它做什麼」分開。預訓練權重不應被當成最新資料庫,提示中的規則不應取代權限控制,流暢句子也不應取代來源驗證。可靠系統需要在表示、檢索、工具和人工審核之間建立清楚邊界。
Memory Networks:把記憶從參數裡取出來
在 Transformer 普及之前,記憶網路已經提出一個重要問題:模型是否應該把所有資訊壓在隱藏狀態或參數裡?Memory Networks 讓系統有一個可讀取的外部記憶,模型可以根據問題選擇相關記憶,再把讀取結果用於回答。Learning to Transact with Memory Networks 等記憶網路研究,展示了如何把記憶存取和端到端學習放在同一個架構中。
這種想法直接連到今天的 RAG 和 agent memory。檢索系統不是把更多段落塞進 context 就算完成,它需要知道什麼時候寫入、怎樣索引、何時讀取、如何處理衝突,以及使用者如何更正或刪除記憶。若記憶沒有來源、時間、權限和版本,模型可能把舊摘要當成新事實,或在不同使用者之間發生資料洩漏。
工程上可以把每一筆長期記憶拆成事件:建立者、建立時間、來源、用途、信心、到期日和刪除狀態。模型只負責提出候選記憶,政策層決定是否寫入;讀取時也要回傳證據,讓使用者能看見為何系統使用這一項資料。記憶網路的價值正在這裡:它把「模型記得」改成一個可觀察的讀寫介面。
DrQA 與開放域問答:生成前先找到可查證文本
開放域問答的難點,是問題不會附帶一小段乾淨背景,系統必須先在大型知識庫中找到可能的證據,再從證據中抽取答案。Weston 參與的 Reading Wikipedia to Answer Open-Domain Questions(DrQA)把文件檢索和閱讀理解結合,讓模型可以從 Wikipedia 等資料中尋找候選段落,再回答問題。
DrQA 對今日 RAG 的啟示很清楚:檢索和生成是兩個不同的失敗面。檢索器可能漏掉真正相關文件,也可能帶回文字相似但不支持答案的段落;閱讀器可能找到正確句子卻抽取錯誤;生成器則可能把多個來源混成一個沒有證據的結論。評估應分別報告召回率、證據定位、答案正確性和引用完整度,而不是只看最後一句話。
在產品中,查證文本還要附帶版本、權限和時間。新聞、政策、價格和技術文件會更新,模型若只知道來源名稱而不知道版本,就可能引用已失效內容。更好的介面會把引用段落直接連到原文,顯示更新時間,並在證據互相衝突時要求使用者選擇或交給人工。這種可追蹤的 RAG 比「模型自行上網」更容易做回歸測試和責任管理。
Poly-encoders 與多句評分:效率和品質的取捨
對話和檢索系統常要比較大量候選句子。若每一次比較都把完整上下文重新編碼,成本會很高;若只用一個向量快速近似,又可能忽略句子之間的重要互動。Poly-encoder 類架構透過多個可學習的表示和較輕量的交互,試圖在速度和精度之間取得平衡。相關研究可參考 Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring。
這個取捨對 LLM 應用仍然存在。RAG 的第一階段可以用便宜的向量檢索快速篩選,第二階段再用較強的 reranker 或 LLM 讀取全文;對話記憶可以先以摘要和關鍵欄位縮小範圍,再在高風險問題上讀取原文。成本最佳化不能只看 token 數,也要看錯誤是否會造成更高的人工處理或決策風險。
評估檢索效率時,至少要同時記錄延遲、成本、召回、精確、引用覆蓋率和拒答率。某個快取策略若讓平均回應快了幾百毫秒,卻讓舊文件持續被引用,不能算真正改善。模型和資料更新後,也要重新檢查快取與索引是否仍然使用正確版本。
對話代理:從聊天回覆走向多技能互動
Weston 參與的 BlenderBot、ConvAI2 和多個對話研究,探索如何讓系統在開放域聊天、知識查詢、個人化和安全限制之間切換。Meta 的Conversational AI 研究頁整理了影像對話、知識導向對話、對話安全和多技能代理等方向。對話代理的難題不是只產生一個自然回答,而是判斷目前目標、選擇技能、保留上下文,再以使用者能理解的方式說明行動。
多技能系統很容易出現路由錯誤。使用者問「幫我查明天的航班並提醒我」,前半句需要即時查詢,後半句需要日曆或通知權限;若模型把整句當成聊天問題,可能給出過時資訊,若直接執行又可能沒有取得確認。安全的代理應先分解意圖,顯示將使用的工具和資料,對不可逆動作要求確認,並在工具失敗時保留原始錯誤。
對話記憶還要處理長期偏好和暫時任務的差別。使用者今天說「我正在旅行」,不代表永遠的個人偏好;使用者要求刪除一項記憶後,摘要、向量索引和快取都必須停止引用。模型可以協助提出記憶候選,卻不能單獨決定保存範圍和權限。這是記憶網路與對話系統共同留下的工程課題。
從回饋學習到自我改進:不要讓模型自己批准自己
對話模型可以從人類評分、偏好比較和部署回饋中調整,但回饋資料常帶有選擇偏差與噪音。使用者可能只評分最糟或最有趣的回答,模型也可能學會迎合評分格式,而不是改善真實任務。強化學習或偏好最佳化要搭配明確的安全、事實和公平性測試,不能只追求一個總分。
自我改進系統尤其要防止自我確認迴圈。模型提出答案、自己批改、再用批改結果更新,若沒有獨立資料或外部驗證,就可能把錯誤越寫越確定。比較穩健的流程是把模型生成的假設送到工具、模擬器、檢索器或人類評審,並保留原始與修正版本;只有通過外部檢查的結果,才可以進入下一輪訓練或記憶。
對 agent 團隊而言,回饋應該按錯誤類型分層:事實錯誤、推理錯誤、工具使用錯誤、語氣問題、權限違規和拒答不當。不同錯誤需要不同修復,不能用同一個 reward 代替所有產品目標。每次模型更新都要跑固定回歸集合,確認新能力沒有犧牲少數語言、少數使用者或高風險流程。
記憶、推理和互動的共同介面
Meta 官方人物頁把 Weston 的研究興趣概括為 reasoning、memory、perception、interaction 和 communication。這些詞可以組成一個很實用的 agent 介面:perception 負責取得文字、語音或影像;memory 負責保存帶來源的狀態;reasoning 負責提出候選步驟;interaction 負責呼叫工具和等待結果;communication 負責把決策和限制告訴使用者。
若所有元件都由同一個 LLM 隱式完成,團隊很難知道錯誤在哪裡。可以把每個階段寫成事件紀錄:輸入內容、來源、模型版本、工具、輸出、信心、權限和下一步。這樣即使最後答案不正確,也能重播其中一段,測試替換某個元件是否改善。可觀察性不是額外報表,而是模型能否被安全部署的前提。
對中文和多語言互動,還要保存原始語句與翻譯版本,避免摘要或翻譯抹去否定、條件和專有名詞。語音介面要記錄辨識信心和說話者切換;影像介面要保留原圖、裁切和 OCR 結果。不同模態的證據不應被壓成一個沒有來源的文字摘要。
給 LLM 產品團隊的八項實作清單
第一,為每個答案保存檢索文件、段落、版本和引用位置。第二,把記憶寫入、讀取、更新和刪除做成獨立事件,並允許使用者查看和更正。第三,分別評估檢索召回、閱讀理解、生成正確性和引用完整度。第四,對多技能代理加入意圖路由、工具權限和不可逆動作確認。
第五,對長上下文做位置干擾測試,確認模型不是只依賴最近或最相似的文字。第六,使用獨立工具或人類評審驗證自我改進結果,避免模型自評形成閉環。第七,記錄延遲、成本、錯誤類型和人工介入,而不只看平均品質分數。第八,建立多語言、少數族群和高風險任務的回歸資料,模型更新後逐項檢查。
這些清單把 Weston 的研究路線轉成現代工程語言:預訓練提供通用表示,記憶網路提供外部讀寫,DrQA 提供檢索與閱讀的分工,對話研究提供技能路由和互動邊界,回饋學習則必須接受獨立驗證。LLM 的規模可以持續增加,但系統的證據、權限和停止條件不能被省略。
公開來源與延伸閱讀
Jason Weston 的職稱、研究興趣、研究領域與出版清單,以 AI at Meta 官方人物頁為主要來源;本文使用的肖像是他的官方個人頁引用的官方人物照片。記憶網路的研究可閱讀 Learning to Transact with Memory Networks;開放域問答與檢索閱讀流程可閱讀 Reading Wikipedia to Answer Open-Domain Questions;多句評分和檢索效率可參考 Poly-encoders。Meta 的Conversational AI 研究頁補充了對話代理、影像對話與安全研究的公開脈絡。這些來源支撐人物身分、記憶、RAG、對話和多技能代理;本文不把早期研究直接宣稱為現代商業 LLM 的產品保證。
結語:讓模型記得、查證並與人一起完成任務
Jason Weston 值得進入 AI/LLM 名人堂,是因為他的研究把語言模型從單次文字預測推向更完整的系統:模型可以先學到通用表示,再讀取外部記憶,從開放資料中找證據,和人進行多技能對話,並在回饋與工具驗證下逐步改善。這些能力如果沒有來源、權限、版本和停止條件,也可能放大錯誤。當今天的 LLM 被要求成為研究助理、客服、程式代理或 AI 科學家時,最重要的問題仍然是:它記得什麼、查了什麼、做了什麼,以及人類能否在每一步看見並修正它。
把「Jason Weston如何把預訓練、記憶網路與對話代理接到LLM?從DrQA到自我改進系統」拆成可驗證的系統問題
這篇文章的主題不只是一個名詞或產品名稱,而是一套由資料、流程、資源與限制共同組成的系統。讀完主要敘述後,可以把焦點往前推一步:系統邊界在哪裡、關鍵機制如何運作、指標改善是否伴隨新的成本,以及哪些說法仍需要原始資料核對。
| 分析面向 | 要追問什麼 | 可查找的證據 |
|---|---|---|
| 系統邊界 | 本文的主題由哪些元件、角色與外部條件共同構成? | 架構圖、供應鏈、時間線與官方規格 |
| 運作機制 | 結果是由哪個流程、模型、設計或制度選擇造成? | 流程步驟、參數、介面、測試與案例 |
| 指標與代價 | 效率、速度或規模提升後,哪種成本或風險被轉移? | 功耗、延遲、可靠性、價格、勞動與環境資料 |
| 可驗證性 | 哪些結論可以重現,哪些仍只是公司說法或推測? | 原始文件、版本、第三方測試與反例 |
用這四個問題閱讀,能把技術敘事從「看起來很強」轉成可比較的證據鏈,也能看見一個系統真正改變的是什麼。
KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。


發表迴響