ChatGPT Advanced Data Analysis是Code Interpreter的後續名稱。它讓使用者在對話中上傳試算表與資料檔,要求ChatGPT使用Python進行清理、計算、統計、表格和圖表分析,並根據結果持續追問。
它最適合縮短資料探索和初步分析時間,不適合把流暢結論當成自動正確。正式決策前,仍要審查欄位定義、清理方式、程式碼、統計假設和關鍵數字。
如果你正在判斷資料分析應該用 Chat 還是 Work,可先看ChatGPT Chat 與 Work 的任務差異,再決定是否需要檔案、工具與可交付成果。
重點快讀
- Code Interpreter現行名稱為Advanced Data Analysis。
- 可處理CSV、XLS、XLSX、JSON、XML、YAML、TXT、Markdown和部分PDF。
- 系統可在安全環境中撰寫和執行Python。
- 能建立表格、靜態或支援的互動式圖表。
- 資料最好具備清楚欄名、每列一筆紀錄和單一表格結構。
- 程式能執行不代表方法正確,應查看Code、Output和Assumption。
- 掃描PDF、圖片型表格和複雜版面可能無法可靠抽取數值。
- 敏感資料需先遮罩,並依帳戶方案確認保存和訓練政策。
Advanced Data Analysis可以做什麼?
| 工作 | 例子 |
|---|---|
| 資料檢查 | 列數、欄位、缺值、重複和型別 |
| 資料清理 | 日期、貨幣、類別和異常值 |
| 探索分析 | 分布、趨勢、分組和相關 |
| 統計計算 | 平均、信賴區間、回歸和檢定 |
| 視覺化 | 長條、折線、散點、分布和其他圖表 |
| 轉換 | 合併、拆分、Pivot和格式輸出 |
| 產出檔案 | 清理後CSV、Excel、圖表或報告 |
它也能處理文字和文件資料,例如從JSON整理事件、統計Log、比較兩份資料或抽取欄位。是否使用Python取決於任務和模型判斷。
資料檔案怎麼準備?
- 第一列使用清楚欄名。
- 每列代表一筆紀錄。
- 每個工作表只放相關表格。
- 避免空白列、合併儲存格和裝飾標題。
- 日期和數字使用一致格式。
- 用文字欄保存ID,避免前導零消失。
- 附上欄位字典和單位。
資料越接近機器可讀結構,分析越穩定。若檔案是提供人閱讀的報表,應先整理成一列一筆的資料表。
第一輪應先做資料剖析
請先不要下結論。
先回報:
1. 工作表、列數與欄數。
2. 每欄型別與範例。
3. 缺值、重複與異常格式。
4. 可能的主鍵和時間欄位。
5. 你對每個欄位的理解與不確定處。很多錯誤來自欄位被誤讀,例如把訂單編號當數字、把百分比讀成文字、把本地時間當UTC,或把缺值當成零。
資料清理要留下紀錄
| 清理 | 需要確認 |
|---|---|
| 刪除重複 | 用哪些欄位判斷同一筆 |
| 處理缺值 | 刪除、填補、保留Unknown或不適用 |
| 異常值 | 真實極端事件或輸入錯誤 |
| 日期 | 時區、格式和期間邊界 |
| 類別 | 同義詞、拼字和大小寫 |
| 貨幣 | 幣別、匯率和含稅狀態 |
不要讓模型靜默刪除資料。要求它建立Cleaning Log,列出每一步影響多少列,並保存原始檔和清理後版本。
如何提出分析問題?
目標:找出退貨率上升的原因。
時間:2026年1月至6月。
指標:退貨訂單/已完成訂單。
分組:產品類別、渠道、地區和新舊客。
排除:取消訂單和測試帳號。
輸出:表格、趨勢圖、前三個假設和限制。
驗收:列出分母、樣本量和原始欄位。「這份資料有什麼洞察」容易產生任意相關性。明確目標、定義、範圍和分母,能讓分析更接近業務問題。
圖表怎麼選?
| 問題 | 常用圖表 |
|---|---|
| 時間趨勢 | 折線圖 |
| 類別比較 | 長條圖 |
| 兩變數關係 | 散點圖 |
| 分布 | Histogram或Box Plot |
| 構成 | 堆疊長條,必要時才用Pie |
| 地理 | 有可靠地理欄位時使用地圖 |
- 標示單位、期間和樣本量。
- 避免截斷Y軸製造誇大。
- 類別過多時排序或分面。
- 重要數值同時提供表格。
- 圖表只顯示資料能支持的結論。
如何審查Python程式碼?
- 載入了哪個檔案和工作表。
- 如何轉換欄位型別。
- 如何處理缺值和異常。
- 分母與篩選條件。
- 分組、Join和Aggregation是否重複計數。
- 統計套件和參數。
- 圖表資料是否和表格一致。
OpenAI官方也建議,在依賴分析前審查生成的Code、Output和Assumption。重要結果應用另一種方式重算,或由熟悉資料的人複核。
統計分析常見錯誤
- 相關性被寫成因果。
- 大量嘗試後只挑顯著結果。
- 樣本不代表目標人群。
- 季節、促銷和政策等混雜因子未控制。
- 平均值掩蓋分布和群體差異。
- 把缺值當成沒有事件。
- 預測模型用到未來資料造成Leakage。
要求ChatGPT解釋假設和限制能降低風險,但不能替代統計設計和領域知識。
掃描PDF和圖片表格的限制
圖片型表格、掃描文件和複雜版面可能無法可靠抽取精確數值。當準確值重要時,優先上傳原始試算表或文字型資料;若只能使用PDF,應逐頁核對數字和表頭。
- OCR可能把小數點和負號讀錯。
- 合併欄位可能破壞列對齊。
- 頁首頁尾會混入資料。
- 圖表圖片不一定能還原原始數值。
- Enterprise等特定方案的Visual Retrieval能力可能不同。
Document AI的版面、表格和Confidence驗收可閱讀Document AI怎麼驗收?。
敏感資料怎麼處理?
- 先刪除不必要姓名、Email、電話和ID。
- 使用Pseudonym代替真實識別。
- 將Development和Production資料分開。
- 確認工作區方案、Data Controls和Retention。
- 企業資料遵守公司政策和DPA。
- 輸出檔案也可能包含敏感資訊。
OpenAI表示,API和企業產品提交的內容不會用於改善模型;Consumer服務則需查看帳戶資料控制。任何敏感資料使用前都要依當前產品條款確認。
如何建立可重現分析?
analysis_manifest:
source_file: sales-2026-06.csv
checksum: sha256...
data_dictionary: v3
cleaning_steps: cleaning-log.md
analysis_code: analysis.py
output_tables: results.xlsx
charts: charts/
prompt_version: returns-analysis-v4
reviewer: data-team
approved_at: 2026-07-23- 下載或保存生成程式碼。
- 保存原始和清理後檔案。
- 記錄Prompt、模型和日期。
- 把關鍵指標寫成測試。
- 建立固定輸出和Reviewer。
- 資料更新後重新執行,而非手動改數字。
一套可靠工作流
- 定義問題和指標。
- 準備資料字典與乾淨檔案。
- 先執行資料剖析。
- 確認清理計畫。
- 執行分析和圖表。
- 審查Code、分母和假設。
- 重算關鍵數字。
- 保存Artifact與Manifest。
- 由資料Owner核准結論。
一般數據判讀能力可閱讀《AI & Data Literacy》在談什麼?。
常見問題
Advanced Data Analysis和Code Interpreter是同一功能嗎?
Advanced Data Analysis建立在原Code Interpreter能力之上,現行官方文件將Code Interpreter列為其舊稱。
ChatGPT能分析Excel嗎?
可以處理常見XLS和XLSX檔案。結構清楚、每列一筆資料的工作表較容易得到可靠結果。
圖表生成後可以直接放報告嗎?
應先核對資料、標籤、單位和方法。正式報告還要保存來源和分析程式,以便重現。
官方資料
Advanced Data Analysis把檔案、Python、表格和圖表放進同一個對話,降低資料工作的起點門檻。可信度則來自清楚欄位、可審查程式碼、可重現Artifact和人類對方法與結論的責任。

發表迴響