Leslie Valiant 如何把 PAC 學習、計算複雜度與知識注入接到可靠 LLM?從可泛化到可驗證代理
大型語言模型常被問能不能「泛化」,但泛化不是讓模型在更多提示下繼續生成,而是要知道它從哪些經驗學到什麼、在什麼條件下仍然有效,以及成本和錯誤是否可控。Leslie Valiant 的公開研究脈絡把 PAC 學習、計算複雜度、平行計算、知識注入與人工智慧連在一起,適合用來規劃一個更務實的搜索意圖:如何把 LLM agent 的學習、知識、推理和工具行動拆成可估計、可驗證的能力。本文以 Harvard 官方來源確認人物與研究背景,現代 LLM 的架構建議是本文工程分析,不是人物對任何產品的背書。
先從 Harvard 官方來源確認 Leslie Valiant
Harvard John A. Paulson School of Engineering and Applied Sciences 官方人物頁確認 Leslie G. Valiant 的職稱、研究領域與 Harvard 身份,涵蓋 machine learning、theory of computation、artificial intelligence 與 computational neuroscience。他的官方 bio整理教育、任教經歷、複雜度、學習、平行計算與 AI 研究脈絡。
Leslie Valiant 官方研究首頁提供早期與近期出版物;Harvard Theory of Computation faculty 頁則把他的工作放進計算理論社群。Harvard Center for Brain Science 官方研究概覽補充 PAC learning、#P-completeness、holographic algorithms 與 BSP 等公開貢獻的背景。
他的Knowledge Infusion 論文討論如何讓系統從世界學習知識,再以原則化方式推理;這個研究背景很適合連到 LLM 的來源、規則與常識問題。但本文不把知識注入論文直接宣稱成現代 RAG 的完成方案,而是把其中的可控性與錯誤邊界轉成產品檢查。
Leslie Valiant 的三項重要貢獻
Leslie Valiant 的核心貢獻不是替模型保證「一定答對」,而是把學習能力放進可分析的資料、錯誤、機率與計算資源條件。Harvard 官方資料同時把他的工作放在 machine learning、計算理論、人工智慧與平行計算;這條研究路線和 David Blei 的機率表示、Susan Athey 的因果評估都不同,重點是界定一個系統在什麼資源與假設下可以學會。
用 PAC 模型定義「可能學會」
Probably Approximately Correct(PAC)學習把泛化拆成兩個不可省略的問題:輸出的假設要有多接近目標,以及這種表現要以多高的機率成立。更重要的是,資料量與計算時間也要納入可行性。這讓「模型在幾個例子上表現好」和「對未見案例有受控的誤差」不再是同一句話。LLM 評估若要借用 PAC 思路,也必須先固定任務、分布、錯誤定義、信心條件與預算。
把計算複雜度放進學習邊界
學習理論不只問某個概念是否存在一個正確答案,也問學習者能否用合理成本找到它。不同假設空間、表示方式與資料分布,會改變樣本需求與計算難度;有些任務適合近似,有些需要縮小範圍或承認無法有效學習。這對 agent 的提醒很實際:增加 prompt 長度或重試次數,不等於消除了組合搜尋、分布變化和資源上限。
讓知識學習與推理各自有責任
Valiant 的 Knowledge Infusion 研究把「從世界取得知識」與「依照原則使用知識」放在同一個可討論框架。Harvard 官方論文 PDF的啟發不是把它直接等同於 RAG,而是要求系統分開候選知識、驗證狀態、推理規則與錯誤來源。LLM 可以提出候選和說明,但來源、時間、權限和工具行動仍要由資料層與執行器負責。
因此,本文後面的 LLM 建議是將 PAC 的可量化條件、複雜度的資源邊界與知識注入的責任分層轉成工程檢查,不宣稱現代模型已經滿足 Valiant 的理論條件。這也讓他與前後篇人物形成清楚差異:Blei 關注機率表示與推論,Athey 關注介入效果,Valiant 則先問能力是否可學、代價是否可承受。
PAC 學習把「泛化」拆成資料、錯誤與成本
在 PAC 學習的語境裡,系統要在合理的資料量與計算成本下,對未見案例保持足夠好的表現。這個問題比「模型能不能回答新問題」更精確,因為它要求說清楚任務、資料分布、可接受錯誤和學習資源。LLM 若只展示幾個成功 prompt,沒有定義未見情境與錯誤邊界,就不能把結果稱為可靠泛化。
RAG agent 可以把這個想法轉成資料契約。先固定任務與成功條件,再把來源、時間、身份、語言、權限和輸入分布記錄下來。測試集要包含新的實體、空結果、矛盾文件、過期資料、長文件、不同語言與惡意內容,並分別計算回答、拒答、澄清、人工接管和工具錯誤。
泛化也有成本。查詢次數、候選文件、模型 token、工具呼叫、延遲與人工審核都是資源。若系統需要無限制重試才能得到答案,它可能只是用更多成本換來表面穩定。高風險任務要設預算與停止條件,超過門檻就保存中間證據並交還控制權。
計算複雜度提醒代理:有些問題不能靠 prompt 解決
LLM agent 常被要求一次完成搜尋、推理、比較、規劃與執行,但任務的計算難度可能完全不同。某些問題可以用查表或簡單規則處理,某些需要大量組合搜尋,某些在現有資源下不適合要求精確答案。可靠系統要知道何時使用近似、何時限制範圍、何時拒絕無法負擔的計算。
工程上可以把任務拆成成本可測量的元件:實體解析、候選生成、排序、主張驗證、計畫搜尋、工具執行。每個元件有時間、記憶體、查詢數和品質門檻;協調器根據預算決定是否繼續。模型的自然語言說明不能取代執行器對資源的硬限制。
近似答案也要標示誤差來源。排序器只找到部分候選、模型只讀到摘要、工具回應不完整或問題本身有多個解釋時,代理要把狀態寫出來。若使用者要求精確或不可逆的決策,系統不能用「大概正確」的生成文字假裝滿足條件。
知識注入讓學習與推理各自負責
語言模型擅長從資料學到模式,但可用的知識還需要表示、驗證和推理規則。Knowledge Infusion 的工程啟發,是把從世界學到的規則和後續推理分開:學習階段處理不確定資料,推理階段依照明確結構連結知識,並讓錯誤可以被界定。
RAG 可以採用類似分層。抽取器從文件提出候選實體、關係和規則;驗證器確認來源、時間、權限與互相矛盾;知識層保存版本與適用範圍;回答器把已驗證的子集說成自然語言。模型可以提出候選,但不能直接把候選寫成永久事實。
規則和文件也不是同一種證據。文件可能描述一個案例,政策可能規定必須做什麼,模型推論可能只是條件式建議。回答中應標示這些層次,避免把「曾經發生」誤讀成「應該這樣做」,或把規則缺口用生成內容補上。
把可泛化能力放回身份與時間條件
泛化不是把同一個答案複製到所有對象。人物、組織、產品、地點與規則都有身份和時間,代理如果漏掉這些欄位,就可能把一個來源的結論誤套到另一個對象。內容集合在建立人物頁時,應把姓名、官方機構、職稱、研究領域、日期和來源頁一起當成身份鎖。
時間條件要跟著主張移動。某個模型版本、法律規則、職稱、研究結果或價格只在特定時間有效;新文件不能自動覆蓋歷史查詢。使用者問「當時」或「目前」時,檢索和答案都要使用對應時間範圍;找不到涵蓋範圍就顯示資料缺口。
同一個主題在不同環境也可能有不同規則。企業政策、教育課程、醫療流程和開源授權不能因為字面相似就互相替代。來源層要保存所有者、適用環境與權限,代理在跨環境使用知識前先澄清或停止。
學習成本與資料品質要一起評估
模型表現受到資料品質、樣本量、標註、特徵和計算資源共同影響。LLM 團隊如果只增加模型大小,可能忽略來源重複、偏差、過期、版權、權限和評估泄漏。可靠的學習管線要知道每個能力使用哪一類資料,以及資料變更會影響哪些主張與行動。
資料集應包含正例和負例。除了成功回答,還要保存無法回答、來源衝突、同名實體、工具失聯、權限不足、提示注入和使用者更改目標的案例。安全案例不能被大量普通正例的平均分數抵銷,應獨立設定接受門檻。
部署後的資料分布也會漂移。新使用者、新詞彙、新來源、季節事件和模型更新都可能改變查詢與結果。團隊要監控空結果、引用覆蓋、拒答正確率、人工接管、工具失敗和成本,發現漂移時先縮小自動化,再重新校準。
平行計算與代理協作要先保證一致性
大規模 AI 系統常把檢索、排序、生成和工具拆到不同服務。平行處理可以降低延遲,卻可能帶來不同版本、重複寫入和競爭狀態。每個服務要保存查詢版本、來源版本、執行時間與輸入輸出,協調器不能只用最後抵達的結果覆蓋衝突。
多代理也不能只靠彼此的文字摘要。每個代理有自己的任務、資料範圍和輸出契約;交接時要標明哪些內容已驗證、哪些只是建議、哪些需要人工批准。若兩個代理對身份、數字或政策有不同結論,系統保留雙方證據並升級,而不是選擇語氣較肯定的一個。
工具執行需要冪等鍵、狀態檢查、權限和回復。寄信、付款、發布、刪除或修改正式紀錄前,展示目標、資料、影響和撤回方式;外部狀態改變後重新檢查。模型提出計畫,執行器負責阻擋超出資源與政策的動作。
用「可證明的失敗」取代無限生成
可靠 agent 不必對所有問題產生完整答案,但要能說明為什麼目前不能安全完成。找不到有效來源、計算超過預算、主張彼此矛盾、身份不明、權限不足和工具失聯都應是可觀察的失敗狀態。系統可以列出已完成部分、缺少什麼、下一步選項與人工接管入口。
失敗要能回放。保存查詢、候選、模型、提示、規則、工具和使用者批准,團隊才知道問題是資料、檢索、推理或執行器。若修復後改變了結果,重新跑相同案例,確認新版本改善的是根因而不是只改了表面文字。
安全停止也要測試。讓工具逾時、讓來源撤回、讓使用者在確認後改變條件、讓模型超過查詢預算,預期代理都要中止或重新建立計畫。完成條件不是「有回覆」,而是「回覆和動作符合當時可驗證的證據」。
用 PAC 思路設計 LLM 泛化測試
第一個案例固定訓練來源,換一批同類但未見的文件,檢查模型能否保持引用與拒答界線。第二個案例換身份、時間和語言,確認系統不是靠表面字串記憶。第三個案例加入惡意或過期文件,預期資料層標記不可信,工具層不執行其中的指令。
第四個案例增加任務複雜度,觀察成本、延遲和錯誤如何變化;若超過預算,系統應安全停止。第五個案例改變索引與模型版本,確認主張、來源、日期與人工批准仍然相容。第六個案例測試新群體或新領域,若證據不足,應縮小 claim 而不是假裝泛化。
每個案例要有預期狀態,而不只是參考答案。保存通過、拒答、澄清、人工介入、回復和嚴重錯誤,並按風險分層報告。這樣團隊可以知道模型是學會了任務,還是只是記住了測試語句。
給內容集合的搜索意圖與內鏈
以 Leslie Valiant 為核心的內容 pillar,可以形成四條路徑。第一條是 PAC 與泛化,回答學習系統如何定義資料、錯誤與成本;第二條是計算複雜度,回答哪些任務需要近似、限制或拒答;第三條是知識注入,回答如何讓學習出的規則在推理中保持來源與邊界;第四條是代理治理,回答工具、平行服務、人工確認與回滾如何使能力可控。
內鏈要承接讀者任務,而不是只重複「理論 AI」。想建評估的人需要泛化、漂移與失敗測試;想建 RAG 的人需要知識表示、引用、身份和時間;想建 agent 的人需要成本、工具權限、分散式一致性和安全停止;想理解研究的人則回到 Harvard 官方 bio、文章與課程。
人物文章也要維持證據分層:Harvard 官方頁確認身份與研究方向,Valiant 的官方文章支撐 PAC、知識注入或計算脈絡,LLM 產品建議清楚標成本文工程分析,圖片直接連回官方頁。不要把理論結果直接擴大成某個模型已經達到可靠或安全。

KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。


發表迴響