首頁 > 人物 > 影視人物與創作者 > Susan Athey 如何把因果推論、數位經濟與資料治理接到可靠 LLM?從實驗設計到可驗證代理

延伸主題

Susan Athey 如何把因果推論、數位經濟與資料治理接到可靠 LLM?從實驗設計到可驗證代理

大型語言模型進入搜尋、廣告、醫療、公共政策和企業決策後,團隊不能只問...

Stanford GSB Susan Athey 官方人物照片

Susan Athey 如何把因果推論、數位經濟與資料治理接到可靠 LLM?從實驗設計到可驗證代理

大型語言模型進入搜尋、廣告、醫療、公共政策和企業決策後,團隊不能只問模型是否產生了更高的點擊率或更長的停留時間。真正的問題是:這個改變是否造成了結果?對誰造成?如果沒有模型或系統,結果會是什麼?資料中是否混入選擇偏差?Susan Athey 長期研究數位經濟、因果推論、機器學習與社會影響,提供一條把 LLM 評估從相關性帶向可驗證決策的路徑。

先用 Stanford 官方來源確認 Susan Athey

Stanford Graduate School of Business 的Susan Athey 官方人物頁整理她的職稱、研究方向和數位化經濟與人工智慧的交集;Stanford Economics 人物頁補充經濟學系的研究脈絡。Stanford HAI 人物頁則提供她在人本 AI 社群的背景。這些來源可確認身份與研究範圍,不代表任何 LLM 產品已經達到某種因果效果。

她的NBER 研究者頁列出數位經濟、因果推論與實證研究入口;Stanford 個人研究頁提供工作論文、課程與公開資料連結。本文用這些第一手或學術機構頁面作為人物與概念來源,接到 LLM 的部分是工程解讀,不能把研究論文直接寫成商業功能的保證。

Athey 的視角對 LLM 團隊很重要,因為模型上線後同時改變了使用者、供應商、資料來源和平台規則。觀察到一個指標上升,並不等於模型造成上升;可能是流量組成改變、介面改版、季節因素或高意圖使用者先被導入。可靠的評估需要明確的比較、時間、族群和反事實,而不是只看一條趨勢線。

Susan Athey 的三條重要貢獻

如果只把 Susan Athey 寫成「懂人工智慧的經濟學家」,會漏掉她真正的研究路線。Stanford 官方資料把她的工作放在數位化經濟、市場設計,以及機器學習與計量經濟學的交界;她研究過木材拍賣、網路搜尋、線上廣告、新聞媒體與科技的社會影響。這些案例共同指向一個問題:當市場被資料與平台重新安排,經濟學如何辨認規則、介入和結果之間的關係。

把數位市場與市場設計放進可觀察的制度脈絡

Athey 的第一條貢獻線,是把科技市場當成需要制度分析的經濟場域,而不只是資料量很大的產業。搜尋、廣告、平台和拍賣都有參與者、資訊不對稱、定價規則與回饋效果;研究不能只報告平台出現了什麼,也要問規則改變後誰受益、誰承擔成本,以及結果能否被其他市場情境重現。這讓「數位經濟」從產業標籤變成可以檢驗的市場設計問題。

讓機器學習估計「誰會受益」

她與 Guido Imbens 關於異質性因果效果的研究,區分了「預測一個人的結果」與「估計某項處置對不同人的影響」。Stanford GSB 的研究頁說明,這條方法線要找出不同子群體的處置效果差異,而不是把平均值當成每個人的效果。對經濟政策、教育介入或數位產品而言,這個區分很重要:同一個措施可能對一群人有效,對另一群人無效甚至有副作用。

把機器學習接到政策與產品評估

她的第二篇方法論整理則把機器學習、因果推論、平均處置效果、最佳政策估計與價格變動的反事實效果放在同一個討論裡。Machine Learning Methods That Economists Should Know AboutThe Impact of Machine Learning on Economics都提醒讀者:預測模型可以協助處理高維資料,但政策與產品決策仍要說明比較對象、介入方式和可接受的風險。這也是她與 LLM 的連接點;LLM 可以當成系統工具,但不能代替因果設計。

因此,本文後面的 LLM 分析是把這三條研究線轉成產品檢查問題,不是宣稱 Susan Athey 替任何模型背書。她的重要貢獻在於把數位市場的資料、機器學習的預測能力與經濟學的反事實問題接起來,並要求團隊面對不同群體、制度規則和不確定性。

相關性不是因果效果

搜尋排序、廣告投放和內容推薦通常會先把不同使用者分配到不同結果,之後再觀察點擊或購買。若高意圖使用者本來就更可能點擊,模型分數和結果的相關性就會被誤讀成因果效果。LLM agent 也可能出現同樣問題:它把複雜任務分配給最願意使用工具的人,再把完成率歸功於某個提示或模型。

因果推論要求先說清楚處置、結果、比較組和時間窗。對 LLM 產品,處置可能是新模型、新提示、檢索器、介面提醒或人工批准;結果可能是任務完成、錯誤率、引用覆蓋、人工接管或高風險事件。若這些欄位沒有事先定義,團隊很容易在看到資料後才挑一個最好看的指標。

並非每個產品改動都能做完美隨機實驗,但仍可改善設計。分層隨機、交錯上線、前後期比較、配對使用者、自然實驗和敏感度分析,都比單純把今年和去年平均值放在一起更有資訊。重要的是保存分配規則、實驗版本、未完成樣本和退出原因,讓結果能被重新檢查。

把反事實思維放進 LLM 評估

代理的每次決策都可以問一個反事實問題:如果沒有這個模型建議、工具動作或介面提示,使用者會怎麼做?回答不一定能被直接觀察,但團隊可以用合適的對照、回放或模擬建立近似。若模型讓使用者更快完成,也要檢查是否同時提高錯誤、過度信任或資料外洩,不能只把速度當成成功。

評估還要處理干擾。模型建議可能改變使用者的下一個問題,使用者的修正又會改變模型看到的資料;不同代理之間也可能共享快取、文件或工具資源。實驗設計要記錄這些互動,必要時以群組、工作階段或資源為單位分配,避免把一個代理的影響錯算到另一個身上。

反事實不是要求模型生成一個故事,而是要求資料和系統保留足夠狀態。保存當時的使用者目標、檢索結果、模型版本、工具回應、批准和外部狀態,之後才能在沙盒中重播「如果換一個候選」的結果。這些事件也能幫助團隊辨認真正造成差異的是模型、資料、政策還是介面。

資料治理決定因果分析能否成立

因果分析依賴正確的時間和身份。文件何時生效、使用者何時被分配、模型何時更新、工具何時回覆,都要使用一致的時間戳;人、組織、帳戶和工作階段也要有穩定識別。若資料把改版前後的事件混在一起,或同名使用者被合併,任何精細的統計模型都只能產生精確的錯誤。

資料還會受到選擇偏差。願意開啟代理功能的人,可能本來就更熟悉工具;願意回答問卷的人,可能對體驗特別滿意或不滿。團隊要保存未使用、拒絕、退出、無法連線和缺少權限的樣本,並說明哪些族群沒有被觀察。否則模型只在最容易成功的人身上變好,卻在長尾使用者身上變得更不可靠。

敏感資料和最小必要原則也不可忽略。模型可以在後台讀取一筆資料,不代表分析報告可以把個人欄位展示出來。資料管線要分開身份、處置、結果和權限,建立可追溯的血緣、撤回與刪除流程。當使用者要求刪除,原文、切片、向量、快取和評估資料都要重新檢查,避免舊資訊繼續影響代理。

因果推論如何改善推薦與 RAG

推薦和檢索常以「相關」為目標,但最相關的文件不一定能帶來最好的任務結果。可以把 RAG 的評估拆成檢索處置、生成回答和使用者後續行動:模型是否找到證據、回答是否正確引用、使用者是否完成工作、是否產生錯誤或不必要的動作。每層都需要清楚的結果欄位和比較方式。

不同使用者可能需要不同的證據門檻。研究者要看原始論文,客服人員要看最新政策,管理者可能需要摘要和風險列表。若只用整體平均點擊率挑檢索器,系統可能偏向容易點擊的內容,卻降低高風險任務的可信度。分層評估和成本敏感的錯誤函數,能讓團隊看見這些取捨。

當模型學會從使用者回饋改進,還要注意回饋本身可能被代理影響。使用者若被很有自信的答案引導,之後的評分就不再是獨立觀察。介面要讓引用、限制和替代方案可見,並保留原始問題和使用者修正,讓團隊能分析回饋是在修正錯誤,還是在被模型說服。

把政策與高風險行動設成可檢驗處置

付款、刪除、發布、醫療建議和法律文件等任務需要明確的處置與風險界線。模型提出方案前,執行器要核對使用者身份、資料新鮮度、目標資源、金額、收件人和撤回方式;高風險動作要展示證據並要求具體批准。批准後外部狀態改變,就重新讀取,不能沿用舊的反事實假設。

政策不應只存在於 prompt。工具 schema、權限服務、速率限制、預算、逾時和回滾機制都要在系統層實作。當模型多次重試、輸入包含提示注入、來源互相衝突或處置超過門檻時,系統應安全停止並交給人類。這些停止案例要加入評估,因為正確停下本身就是一種任務能力。

治理也要檢查不同族群的效果。模型可能對熟悉的語言、裝置或工作流程表現良好,卻讓其他使用者更常被拒絕或錯誤分類。團隊應按語言、地區、角色、權限和任務風險報告結果,並對重大差異設定調查和回滾條件,而不是用總平均遮住結構性問題。

評估模型、介面與人的互動

LLM 產品的結果不是模型單獨產生的。介面如何顯示引用、工具是否可用、使用者是否容易修正、政策是否要求批准,都會影響最後的行為。實驗應把模型版本、提示、檢索、介面、工具和人工流程一起記錄,否則看見指標變化時無法知道哪個部分造成差異。

任務評估要加入失敗和部分成功。空結果、過期文件、同名人物、工具逾時、權限不足和使用者改變目標,都應定義正確的拒答、澄清、轉人工或回復行為。高風險錯誤要使用硬停止,不應被大量低風險正確答案平均掉。每次回放保存查詢、候選、批准和外部狀態,讓分析可以重做。

線上指標要避免過度解讀。點擊率可能被誇張標題提高,停留時間可能因答案更長而增加,重新提問可能表示好奇也可能表示失敗。把行為訊號和人工判讀、任務完成、引用覆蓋、拒答品質、人工接管、成本與嚴重事件放在同一個評估框架,才能知道模型是否真的改善使用者結果。

給 LLM 團隊的落地檢查表

第一,定義處置、結果、比較組、時間窗和適用族群。第二,保存使用者目標、身份、檢索、模型、工具、批准與外部狀態。第三,分開相關性、因果效果、任務完成和副作用。第四,對高風險動作提供預覽、最小權限、版本檢查和回復。第五,把選擇偏差、退出、拒答、干擾和缺失資料納入分析。

第六,按語言、地區、角色、權限和任務風險切片結果。第七,用分層隨機、回放、敏感度分析或自然實驗取代只看前後平均。第八,測試空結果、衝突、過期、同名、提示注入和工具失聯。第九,把模型、提示、索引、介面、工具、政策和評估集一起版本化。第十,設定停用、調查、回滾和人工接管條件。

Susan Athey 的研究脈絡提醒我們,可靠 LLM 不只是回答更像人,而是要能說明改變由何而來、對誰有效、在哪些條件下失效。當團隊把因果假設、資料治理、實驗設計、引用證據和工具權限連成一條可重播流程,數位經濟的評估方法才會真正幫助代理在真實環境中負責任地工作。

Stanford GSB Susan Athey 官方人物照片
Susan Athey,Stanford 數位經濟、因果推論與人工智慧研究者 圖片來源:Stanford Graduate School of Business 官方人物頁

作者與編輯責任

本文署名作者:

|YOLO LAB 主編

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

KEEP READING

接著讀什麼?

從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀