首頁 > 人物 > 科技人物與公司 > François Chollet如何重新定義AI能力?從Keras、ARC-AGI到Ndea|2026研究與官方資料更新
,

延伸主題

François Chollet如何重新定義AI能力?從Keras、ARC-AGI到Ndea|2026研究與官方資料更新

截至 2026 年 8 月 14 日,從 Keras、ARC-AGI...

François Chollet Keras ARC AGI Ndea 與人工智慧能力評估意象

François Chollet如何重新定義AI能力?從Keras、ARC-AGI到Ndea|2026研究與官方資料更新

先講結論: 截至 2026 年 8 月 14 日,François Chollet 的技術路線可由 Keras、ARC-AGI、ARC Prize 與 Ndea 串起;ARC-AGI-3 延伸到互動評測,但研究方向或單一 benchmark 都不等於 AGI 已完成。

François Chollet 以什麼工作聞名? 他是 Keras creator,也提出 ARC benchmark,長期研究 abstraction、general intelligence 與 program synthesis。

Keras 解決什麼問題? Keras 以簡單 API、可組合性與 developer experience 降低深度學習模型的使用門檻;Keras 3 可切換多種 backend。

ARC 想測量什麼? ARC 關注模型在陌生問題上取得新技能的效率,將 intelligence 從單純記憶或訓練分數拉回抽象化與泛化。

skill-acquisition efficiency 是什麼? 它把學會新技能所需的經驗量與泛化能力放在一起衡量,是 Chollet 重新討論 intelligence 的核心概念之一。

ARC Prize 是什麼? 它是推動 ARC 研究的非營利開放計畫,Chollet 是共同創辦人、董事與 ARC-AGI creator。

ARC-AGI-3 有何變化? 文章整理的方向是從靜態 grid 題目延伸到沒有明確規則與目標的互動式 Agent 環境,評測邊界要以官方版本為準。

Ndea 在研究什麼? Ndea 研究以 deep learning 引導 program synthesis,試圖把學習到的表示與可執行程式結合。

ARC 分數能直接代表 AGI 嗎? 不能;benchmark 只回答特定任務與設定,還要檢查資料、版本、方法、成本與是否存在過度擬合。

想延伸研究應該先查什麼? 先讀 Keras、On the Measure of Intelligence、ARC-AGI/ARC Prize 與 Ndea 的官方資料,再區分已證實結果和研究假說。

<

p class=”wp-block-paragraph”>François Chollet 在 AI 世界留下了兩條看似距離很遠的技術路線。2015 年,他建立 Keras,把深度學習模型封裝成更容易理解與組合的高階 API;2019 年,他又提出 ARC,開始追問 AI 在陌生問題上取得新技能的效率究竟應該怎麼測量。

截至 2026 年,Chollet 仍把自己列為 Keras creator 與 project lead,同時是 Ndea、ARC Prize 的共同創辦人。他目前研究焦點集中在 abstraction、general intelligence,以及如何結合 deep learning 與 program synthesis。

  • Keras 於 2015 年推出,核心設計一直強調簡單 API、accessibility 與 developer experience。
  • Keras 3 現在可以在 TensorFlow、JAX 與 PyTorch backend 間切換。
  • 2019 年 Chollet 在〈On the Measure of Intelligence〉提出以 skill-acquisition efficiency 討論 intelligence,並推出 ARC benchmark。
  • ARC Prize 目前是非營利開放研究計畫,Chollet 是共同創辦人、董事與 ARC-AGI creator。
  • 2026 年 ARC-AGI-3 已把測試從靜態 grid 問題延伸到沒有明確規則與目標的互動式 Agent 環境。
  • Chollet 與 Mike Knoop 創辦的 Ndea 正研究以 deep learning 引導 program synthesis 的方法。

實體索引|AI 研究與能力評測實體

  • 研究者、框架與基準:François Chollet如何重新定義AI能力?從Keras、ARC-AGI到Ndea|2026研究與官方資料更新;核對 François Chollet、Keras、ARC-AGI、Ndea、論文/專案、模型能力與資料日期。
  • 原文錨點:先講結論: François Chollet 是 Keras 的主要創作者之一,也是 ARC-AGI 等抽象推理評測的倡議者;他的路線把「讓更多人使用 AI 工具」與「測量模型能否解決陌生問題」放在同一個能力框架。 François Chollet 是誰? 他是軟體工程師與 AI 研究者,以 Keras、深度學習工具與抽象推理研究受到廣泛關注。 Keras 解決什麼問題? Keras 提供較高階、可組合的神經網路 API,降低模型實驗與部署的起步門檻,也讓研究者更快比較架構。
  • 研究脈絡:把抽象能力、任務泛化、資料效率、測試基準、模型與研究方法連回 AI 評估。
  • 編輯界線:區分研究結果、基準表現、官方說法與作者推論;不同 benchmark 不直接等同通用智能。

Keras解決的第一個問題,是AI工具太難使用

2015 年的深度學習生態和今天差很多。

研究者可以使用 Theano、TensorFlow 等底層框架處理 tensor、automatic differentiation 與 GPU 計算,但建立一個完整神經網路,仍需要理解大量底層實作細節。

Keras 選擇把自己放在更高的 abstraction layer。

Chollet 當時把它形容成建立深度學習模型的「Lego blocks」:底層 tensor operation 交給 Theano、TensorFlow 等 backend,Keras 處理 model-level API。相關歷史可參考 Keras now running on TensorFlow

這個設計決定了 Keras 後來的影響力。

  • API 能不能容易記住;
  • error message 能不能被理解;
  • 常用 architecture 能不能用少量程式表達;
  • 新手能不能快速做出第一個模型;
  • 研究者能不能減少 boilerplate。

2016 年 Keras 1.0 幾乎重新改寫整個 codebase,Chollet 在公告中直接把 simplicity 與 accessibility 列為核心設計目標。相關說明可見 Introducing Keras 1.0

Functional API 所代表的 Chollet 軟體哲學

Keras 最早的 Sequential API 非常直觀:模型就是一層接一層的 stack。

但真實神經網路很快會需要多輸入、多輸出、shared layers 或非線性 topology。

Keras 1.0 因此加入 Functional API。

今天 Keras 官方仍把 Functional API 描述成建立 layer graph 的方法,可以處理非線性 topology、shared layers 與 multiple inputs/outputs。

這個設計很能代表 Chollet 的軟體方法:高階 abstraction 可以簡單,但不能因為簡單而封死複雜系統。

好的 abstraction 應該讓普通案例很容易,同時保留進階使用者向下擴張的空間。

Keras 進入 TensorFlow 的背景

Keras 最初主要使用 Theano backend。

2015 年 TensorFlow 發布後,Keras 很快加入 TensorFlow backend;Chollet 當時仍把 Keras 定位成 model-level framework,由 TensorFlow 負責底層 tensor operations。

2017 年,Keras API 進一步準備整合進 TensorFlow core。這使很多開發者後來透過 tf.keras 接觸深度學習。

但 Keras 的故事沒有停在 TensorFlow。

Keras 3 再次把 backend abstraction 拉出來,同一套 Keras workflow 現在可以選擇 TensorFlow、JAX 或 PyTorch。官方介紹可見 Keras for engineers

從 Theano → TensorFlow → multi-backend Keras 3,可以看到一個很一致的設計判斷:API 的生命週期應該比單一底層執行引擎更長。

從深度學習普及走向能力邊界研究

2019 年,Chollet 發表〈On the Measure of Intelligence〉。

這篇論文把問題從「怎麼做出更好模型」移到另一個層級:我們究竟怎麼知道一個系統更 intelligent?

Chollet 認為,只比較 AI 在特定 task 上能達到多少 skill,容易把 training data、prior knowledge 與經驗混進評估。只要可以投入足夠資料與先驗資訊,一個系統就可能在特定任務表現得非常強。

他因此把 intelligence 定義成和 skill acquisition efficiency 有關:系統使用多少 prior、多少 experience,才能取得多少新技能與 generalization。

這是 Chollet 自己提出的 intelligence framework,不代表所有 AI 研究者都接受相同定義。

但這套框架直接導向 ARC。

ARC Prize Foundation 官方團隊頁中的 François Chollet 肖像;截至 2026-08-14 用於辨識人物與 ARC Prize 脈絡,不代表研究成果或 AGI 能力
ARC Prize Foundation 官方團隊頁中的 François Chollet 肖像;截至 2026 年 8 月 14 日,圖片只用於辨識人物與 ARC Prize/ARC-AGI 公開脈絡,不代表研究成果、模型分數或 AGI 能力。圖片來源:ARC Prize Foundation 官方團隊頁

若想把 ARC-AGI 的能力測量放回現代 LLM 系統脈絡,可延伸閱讀 PagedAttention 如何改善 LLM 推論效率,比較模型能力評估與基礎設施效率是兩個不同層次的問題。

ARC-AGI 的評測對象

ARC 最初由一系列小型彩色 grid problems 組成。

每一題會提供少量 input-output examples。

系統必須找出其中的 transformation rule,再把規則應用到新的 test input。ARC Prize 對第一代 benchmark 的官方說明可見 ARC-AGI-1

例如某題可能涉及找出重複 pattern、移動物件、補出 symmetry、辨識 connected component,或根據數量改變形狀。

每一題的規則都不同。

因此系統很難只靠大量練習同一個 task format 取得分數。

Chollet 希望測量的是:面對沒有特別準備過的新問題時,系統能多有效率地建立一個新模型或規則。

ARC 刻意讓人類容易、AI 困難的設計

傳統 benchmark 經常把 human-level performance 當成終點。

ARC 的設計方向略有不同。

它先限制題目依賴的 prior knowledge,盡量只使用人類早期就熟悉的基本概念,例如 object、counting、geometry、topology 等,再要求模型從少量 examples 推出新規則。

如果人類可以在幾個 examples 後理解規則,而模型需要大量 task-specific training 或大量搜尋,兩者的 learning efficiency 就會顯示差異。

這也是 ARC-AGI 後來長期具有研究價值的原因。

ARC Prize把一篇論文變成公開研究社群

2024 年,Chollet 與 Zapier 共同創辦人 Mike Knoop 推動 ARC Prize。

ARC Prize 的方法很直接:提供獎金,要求研究者公開解法,用公開競賽增加不同技術路線探索 ARC-AGI 的機率。

2024 年 technical report 記錄,ARC-AGI private evaluation 的 state-of-the-art 從約 33% 提升到 55.5%,主要方法包含 deep-learning-guided program synthesis 與 test-time training。技術報告可見 ARC Prize 2024

這裡最值得注意的不是某一個分數。

ARC Prize 把一個 intelligence benchmark 轉成持續迭代的 open research ecosystem。

ARC-AGI-2 重新增加難度的原因

當 reasoning model 開始快速改善 ARC-AGI-1 表現後,benchmark 本身也需要更新。

2025 年推出的 ARC-AGI-2 保留原本 grid input-output 格式,但重新加入更困難、認知複雜度更高的任務。技術論文可見 ARC-AGI-2

2026 年 ARC Prize 的 ARC-AGI-2 比賽仍使用 private evaluation,而且設定了 85% accuracy 的重要獎勵門檻。競賽規則可見 ARC Prize 2026 ARC-AGI-2

這也說明 benchmark 並非固定考卷。

當模型開始適應舊題型後,測量工具本身也必須更新。

YOLO LAB 另一篇Gemini 3.1 Deep Think 分析也使用 ARC-AGI-2 作為推理模型能力驗證案例;那篇處理模型選型,這篇則把 benchmark 放回 Chollet 的 intelligence measurement 脈絡。

ARC-AGI-3 將 AI 放進無說明書環境

2026 年 3 月,ARC Prize 發布 ARC-AGI-3。

這次的變化更大。

ARC-AGI-1 與 2 至少會提供 input-output examples。

ARC-AGI-3 則變成 hundreds of interactive game-like environments,而且沒有 instructions、rules 或 stated goals。官方發布說明可見 ARC-AGI-3 Launch

Agent 必須自己:

  1. 探索環境;
  2. 判斷 action 會造成什麼結果;
  3. 建立 world model;
  4. 猜測什麼狀態才代表成功;
  5. 制定 plan;
  6. 根據失敗再修正。

ARC Prize 因此把 ARC-AGI-3 的核心能力拆成 exploration、modeling、goal-setting、planning and execution。

這讓 Chollet 原本對「skill acquisition」的問題開始直接進入 Agent 時代。

Frontier model 變強後 ARC-AGI 的意義

這個問題在 2026 年變得更有意思。

目前的 frontier model 在 ARC-AGI-1、ARC-AGI-2 上已經取得非常高的成績。ARC Prize 2026 的排行榜中,一些模型在 ARC-AGI-1 已超過 95%,ARC-AGI-2 也進入 80% 以上區間。排行榜會持續更新,因此應以 ARC Prize Leaderboard 當下資料為準。

因此 ARC-AGI benchmark 也持續往新版本移動。

例如 ARC Prize 2026 年 7 月 24 日公布的測試中,Claude Opus 5 High 在 ARC-AGI-3 為 30.16%。該數字只代表當時官方測試結果,不代表永久排行榜;來源可見 ARC Prize Claude Opus 5 Results

它真正顯示的是:靜態 reasoning benchmark 的進步速度,和陌生互動環境中的 adaptation 仍可能不同。

Chollet 對 Scaling 的實際主張

這樣描述太簡化。

Chollet 長期承認 deep learning 具有很高的實際價值;他自己建立 Keras,也持續維護 deep learning tooling。Ndea 官方同樣明確表示,研究方向會使用 deep learning 來 guide program search。

他的主要質疑集中在另一個地方:現有模型擴大 skill coverage,和系統能否高效率地自行取得全新 skill,應該分開測量。

也就是他在〈On the Measure of Intelligence〉裡區分的 skill 與 intelligence。

這個區別比一句「LLM 不會通往 AGI」更精確。

Ndea 押注 Program Synthesis 的方向

François Chollet 現在和 Mike Knoop 共同創辦 Ndea。

Ndea 的研究 thesis 是把 deep learning 與 program synthesis 結合。官方說明可見 Ndea About

Program synthesis 的基本問題可以寫成:給系統少量 examples 或 constraints,讓它搜尋一個能解釋資料的 program。

這和一般 neural network 直接在 continuous parameter space 做 gradient optimization 很不同。

Ndea 希望使用 deep learning 提供 search guidance,縮小 program space,再利用離散 program 所具備的結構取得更強 generalization。公司目前把正在建立的方向稱為 Symbolic Learning。官方研究主張可見 Ndea

這仍是一條正在研究的路線。

它目前最值得寫成的是:Chollet 選擇押注什麼研究假說。

還不能寫成 program synthesis 已經解決 AGI。

How to Beat ARC-AGI by Combining Deep Learning and Program Synthesis。影片來源:ARC Prize。

Keras與ARC-AGI其實有一個共同點

Keras 和 ARC-AGI 看起來處理完全不同的問題。

Keras 處理 software API。

ARC-AGI 處理 intelligence evaluation。

但 Chollet 在兩個專案中採用的思考方式很接近:先找出真正重要的 abstraction,再把不必要複雜度拿掉。

Keras 問:建立 neural network 時,開發者真正需要操作哪些概念?

ARC 問:比較兩個 intelligence system 時,我們真正需要測量什麼?

前者把 implementation complexity 壓到 API 下方。

後者試圖把 training data、task-specific skill 等因素從 intelligence measurement 中拆開。

這可能是理解 François Chollet 最有價值的角度。

François Chollet 與 Geoffrey Hinton 的研究位置

YOLO LAB 已有 Geoffrey Hinton 與深度學習復興的研究史文章。

Hinton 所代表的主線更接近:representation learning → neural networks → deep learning resurgence

Chollet 的位置則可以寫成:developer abstraction → deep learning accessibility → intelligence measurement → generalization research

兩者都深受 neural network 進步影響,但處理的問題不同。

如果讀者希望理解深度學習本身如何重新成為 AI 主流,可以先閱讀 Hinton 研究史;Chollet 這篇則回答工具普及之後,研究者如何重新追問 intelligence 邊界。

François Chollet 在2026年的技術位置:研究、社群與公司脈絡

2026 年 AI 已經進入 reasoning model、Coding Agent 與長任務 Agent 時代。

模型可以寫程式、搜尋網路、使用工具、長時間推理、自動修改檔案,並通過大量專業 benchmark。

因此「模型還會什麼」已經不足以描述全部進展。

下一個問題逐漸變成:模型遇到沒有被事先整理成 training distribution 的新環境時,能多快形成新的有效行為?

ARC-AGI-3 正在把這個問題具體化成 interactive benchmark。

而 Ndea 又把同樣問題帶回 learning algorithm 本身。

這使 François Chollet 的研究位置在 2026 年反而更加清楚:他長期研究的核心一直是 abstraction 與 generalization efficiency

Keras 解決人如何高效率抽象 AI 系統。

ARC-AGI 與 Ndea 則追問機器能不能自己做到類似的事情。

若要延伸理解今天 reasoning model 如何透過 reward 與驗證器學習,可閱讀 YOLO LAB 的RLVR、驗證器與 Reward Hacking 解析

François Chollet的常見問題

François Chollet的公開角色

François Chollet 是 Keras creator、AI researcher,目前是 Ndea 與 ARC Prize 共同創辦人。他的研究興趣包括 abstraction、general intelligence、program synthesis 與 AI democratization。本人資料可見 François Chollet 個人網站

Keras與François Chollet的關係

是。Keras 官方引用格式直接列 Chollet, François and others,Chollet 個人頁也列自己為 Keras creator 與 project lead。

ARC-AGI的評測對象

ARC-AGI 是 Chollet 2019 年提出的 benchmark,用少量 examples 與新任務測試系統的 abstraction、generalization 與 skill-acquisition efficiency。

François Chollet對深度學習的研究立場

不適合這樣描述。他建立並持續維護 Keras,Ndea 也明確計畫使用 deep learning 來 guide program synthesis。他主要質疑的是,只根據既定任務 skill 與規模擴張是否足以測量 general intelligence。

Ndea的研究方向

Ndea 是 François Chollet 與 Mike Knoop 共同創辦的 AI research lab,目前研究 program synthesis 與 deep learning 的結合,並把正在建立的方法稱為 Symbolic Learning。

ARC-AGI-3與前代評測的差異

ARC-AGI-1、2 主要是靜態 input-output reasoning problems;ARC-AGI-3 改為 interactive environments,Agent 必須自己探索、建立模型、設定目標與執行計畫。

資料來源

François Chollet 的技術線可以濃縮成:Keras → Deep Learning Accessibility → ARC-AGI → ARC Prize → Ndea。

它記錄了一個少見的人物軌跡:先讓更多工程師能建立深度學習模型,再把研究焦點轉向「什麼樣的學習能力,才應被視為更一般化的 intelligence」。

先把 François Chollet、Keras、ARC-AGI 和 Ndea 拆成不同實體

談 François Chollet 時,最容易把一位研究者、一個深度學習框架、一套抽象推理 benchmark、一個競賽組織、一家公司和幾篇論文壓成「他重新定義了 AI」。實際上至少有七個實體:Chollet 是研究者、作者或產品創業者;Keras 是可組合、訓練與部署神經網路的軟體框架;ARC-AGI 是用抽象網格任務觀察泛化與樣本效率的 benchmark 家族;ARC Prize 是舉辦競賽、整理資料與推動研究的組織;Ndea 是後來的公司與研究/產品環境;論文是提出定義、方法或實驗結果的研究 artifact;leaderboard 與競賽結果則是特定時間、規則和提交環境下的測量快照。若不先拆開,Keras 的工程普及會被誤寫成 ARC-AGI 的推理證據,競賽名次又被誤寫成某個人的全部研究成果。
本段直接核對François Chollet 個人網站Keras 官方入口Keras Functional API 指南ARC Prize 組織說明ARC-AGI-1 說明ARC-AGI-2 競賽頁Ndea 公司說明與三份Keras 研究ARC-AGI 相關研究後續方法研究。這些來源支持人物、框架、benchmark、競賽、公司與論文的不同定位;它們不單獨支持某個 benchmark 分數等於一般智力、Keras 使用者都採用 Chollet 的研究方法,或 Ndea 的產品成果可以回溯成一個人的個人功勞。

原創編輯圖:François Chollet 從 Keras 框架、ARC-AGI benchmark 到 ARC Prize、研究論文、Ndea 與能力判讀的實體關聯
YOLO LAB original editorial diagram. The entity route from François Chollet and Keras to ARC-AGI benchmark tasks, ARC Prize evaluation, research evidence, Ndea, and capability claims. Not an official Keras, ARC Prize, or Ndea diagram.

人物實體:研究者、作者、創業者與框架維護者不是同一個角色

人物頁要先回答一個人正在以哪個角色說話。Chollet 的公開材料可能同時涉及 Keras 的工程設計、ARC-AGI 的能力觀點、研究論文、競賽活動和 Ndea 的公司方向;每一種角色都有不同證據門檻。個人網站可以協助定位作品與公開身份,論文可以支持特定方法或實驗,公司頁可以支持組織的自我描述,但不能用公司公告替代 benchmark 結果,也不能用一段演講替代完整研究方法。
可以建立一份 contribution ledger:年份、角色、產出類型、共同作者或團隊、直接證據、後續採用者,以及能否把結果歸因於個人。Keras 的工程影響往往是大量維護者、貢獻者、使用者、硬體與開源生態共同形成;ARC-AGI 的設計也會受任務製作者、評測規則、資料治理與提交者影響。把這些集體實體保留下來,人物文章才不會從「重要參與者」跳成「唯一創造者」。
時間線尤其重要。Keras 的早期發布、後來的 API 變化、ARC-AGI-1 與後續版本、競賽規則、研究論文和 Ndea 公司頁不一定屬於同一個時期。文章若把今天的公司身份套回早期框架設計,或把後來的 benchmark 成果倒推成早期工程選擇的必然結果,就跨過了未驗證的因果節點。

Keras 實體:框架的可用性和推理能力是兩種主張

Keras 的核心實體是軟體框架:它提供模型組合、層、訓練流程、資料管線、保存與部署等工程介面。Functional API 的價值在於用可組合的圖表達多輸入、多輸出、共享層與非線性連接;這能讓工程師建立和檢查神經網路結構,卻不會自動讓模型理解抽象規則,也不會替使用者決定資料品質、loss、評估方法或部署風險。
評估 Keras 時要拆開四個欄位:API 是否容易表達架構、訓練是否穩定、模型在指定資料上的表現,以及軟體在部署環境的維護成本。前兩個屬於工具與工程證據,第三個屬於模型和資料證據,第四個則需要 runtime、硬體、版本與團隊流程。Keras 很受歡迎,不代表使用 Keras 的模型就具有更強的抽象推理;反過來,某個 ARC 系統用 Keras 實作,也不代表框架本身完成了 ARC 任務。
框架版本也是實體。文章應記錄 Keras 版本、後端、Python/硬體環境、模型保存格式、訓練設定與評估程式;升級時檢查隨機性、算子、梯度、序列化、資料輸入和推理結果。若只展示一段可以執行的 API code,不能把它寫成跨環境可重現、可部署或可取得相同 benchmark 分數的保證。

ARC-AGI 實體:benchmark 測量的是特定任務與規則下的能力

ARC-AGI 的任務通常以少量示例要求系統找出抽象變換,再把規則套用到新的網格。它的研究價值在於挑戰樣本效率、組合泛化、程序歸納和對新規則的適應;但 benchmark 仍是一個被設計、切分、評分和提交的測量工具。分數回答的是「在這組任務、這個資料切分、這個時間與資源限制下,系統完成了多少」,不是「系統已經具有一般人類智能」的完整答案。
閱讀 ARC 分數時,至少要記錄任務版本、訓練/測試邊界、是否有資料污染或公開解答風險、推理時間、硬體、外部工具、是否人工選題、提交次數、計分規則與錯誤類型。相同名稱的 ARC-AGI-1、ARC-AGI-2 或其他競賽,不應在沒有對齊規則時直接比較。競賽頁、論文、leaderboard 和參賽者報告各自提供不同粒度的證據,不能只摘最高分。
benchmark artifact 也包含任務本身。網格大小、顏色、示例數、規則複雜度、答案表示、評分器和 hidden test 都會影響結果;如果評估程式對邊界條件處理不同,分數就不再是同一個測量。研究文章要把 solver、prompt、搜索策略、程式合成、人工介入和 timeout 交代清楚,讀者才知道高分來自哪一種能力組合。

能力實體:抽象推理、程式合成與記憶擬合不能只用一個分數代替

「重新定義 AI 能力」是一個研究主張,不是一個可直接套用的產品標籤。抽象推理可能包含從示例歸納規則、將規則組合到新情境、在少量資料下學習、檢查自己的錯誤,以及把解法轉成可執行程序;這些能力可以互相相關,卻不必然同步。系統在 ARC 任務上表現良好,仍可能在長期規劃、自然語言互動、現實感知、可靠性、成本和安全邊界上有不同結果。
要把能力主張寫得可靠,應建立 claim matrix:主張、任務、輸入資料、模型或 solver、資源上限、測量指標、對照組、失敗案例和可重現文件。對一個能產生程式的系統,要分辨它是找到短規則、搜尋大量候選、記住訓練分布、使用外部工具,還是由人員選擇與修正結果。不同路徑可能得到相同答案,但代表不同的泛化證據。
負面結果尤其重要。保存錯誤網格、錯誤規則、超時案例、近似答案、過度擬合與對顏色或位置的脆弱性,才能知道系統的能力邊界。只展示突破 benchmark 的成功樣本,會讓讀者忽略任務分布、選題策略與失敗成本;只展示失敗,也不能證明方法沒有研究價值。完整報告要同時保留成功與失敗的 artifact。

ARC Prize 實體:競賽組織、資料治理與 leaderboard 不是研究結論

ARC Prize 的角色可能包括競賽主辦、任務與規則管理、社群資源、獎項和結果展示。這些活動能推動研究與公開比較,但競賽結果本身是一個制度化的測量快照。讀者要看規則版本、參賽資格、提交期限、可用工具、評分方式、是否允許外部資料和 leaderboard 更新時間。若頁面在後來改版,文章中的歷史數字也應保留抓取日期,而不是把今天的排名寫成永遠不變。
競賽排名與科學證據的關係也要分層。排行榜可以告訴讀者誰在某一規則下取得較高成績;論文和技術報告才較能解釋方法、消融、對照組、錯誤、限制與重現方式;產品頁則可能只描述能力方向。把三種資料放在同一欄,會讓「名次」「研究支持」「商業就緒」看起來像同一個結論,實際上它們是不同 claim。

Ndea 實體:公司定位和研究 benchmark 要保持時間距離

Ndea 的公司頁可以支持組織如何描述自己的使命、研究或產品方向,但公司自我描述不是獨立的 benchmark 結果,也不是對外營收、客戶、模型品質或部署規模的完整證明。若文章提到 Ndea,應列出頁面日期、公司主體、公開職責與可查研究,避免把「正在研究」寫成「已經解決」。
公司、開源框架和競賽組織的關係也要分開:Keras 是軟體生態;ARC Prize 是評測與競賽環境;Ndea 是公司;Chollet 是個人。它們可能共享人物、研究概念或公開連結,但共享關鍵字不代表所有權、資金、產品、研究結論或團隊責任相同。文章若要說某個研究方向對公司有影響,需要直接公司公告、論文署名、產品文件或其他可核對 evidence。

重現性實體:分數要和資料、程式、環境一起保存

ARC 類 benchmark 的重現性不只是一個 leaderboard URL。研究者需要保存任務版本、輸入輸出格式、solver 程式、模型 checkpoint、prompt 或搜索設定、硬體、時間限制、外部工具、隨機 seed、評分器版本與失敗輸出。若任務或規則後來更新,舊分數仍可有歷史價值,但不能在沒有標註的情況下和新版本分數直接排成一條排名。
資料污染也要成為獨立欄位。公開任務、社群討論、訓練語料、參賽者 write-up、樣本解答和 API 紀錄都可能影響系統是否事先見過某種規則。看見一個高分時,讀者應問資料是否保密、測試是否真正 hidden、提交前是否有人手動調參、模型是否使用外部搜尋,以及評估期間是否允許反覆試錯。沒有這些資訊,最安全的說法是「在該評測條件下觀察到某結果」,而不是「系統學會了通用推理」。
研究團隊也應保存一組未公開或延後公開的檢查案例,用來測試 overfitting、固定模板、顏色偏見、位置偏見、尺寸改變、規則組合和近似但不同的變換。這些 negative controls 能協助分辨系統是在理解抽象關係,還是在利用表面統計。benchmark 的設計和結果解讀因此是兩個相互依賴但不能混為一談的實體。
重跑時若結果下降,也不必立刻判定方法失效。可能是版本、任務切分、評分器、硬體、時間上限、搜尋策略或資料可見性不同;相反地,結果上升也不代表能力突然普遍化。研究報告應把差異拆成可檢查的變更,並保留原始輸出、錯誤案例和設定檔,讓後續讀者能追蹤是哪一個因素改變了測量。這種紀錄同時保護研究者與讀者,避免把不可比的結果包裝成進步,也讓後續研究能重現相同條件與錯誤邊界,並檢查能力是否真的跨任務泛化,而非只在單一排行榜上變高。
每個公開 claim 也應附上評估日期、提交者、資源上限與規則版本;沒有這些欄位,讀者無法判斷結果是歷史紀錄、目前狀態還是一次性的示範。時間戳不是裝飾,而是 benchmark 證據的一部分。

把 Chollet—Keras—ARC-AGI 關係轉成讀者可用的檢查表

讀者可以問八件事:第一,這句話描述的是人物、框架、benchmark、競賽、公司還是論文?第二,分數來自哪個版本、任務切分和資源限制?第三,solver 使用神經網路、程式搜索、外部工具或人工介入?第四,Keras 在這裡是工程框架還是研究結論?第五,成功與失敗案例是否都保存?第六,leaderboard、論文和公司頁各自支持哪一種主張?第七,Ndea 的現在描述是否被誤套到早期研究?第八,結果能否在同一環境中重跑,或至少清楚標出不可重現的部分?
內容內鏈也應沿著共享實體走:Keras 工程文連到 Functional API、部署和版本治理;Chollet 人物文連到 ARC-AGI 的研究與能力定義;ARC Prize 文連到規則、資料、競賽與 leaderboard;Ndea 文連到公司公開資料和時間線。若另一篇文章只有泛稱「AI 推理」而沒有共享人物、框架、任務或證據,不能只因關鍵字相似就硬接。

來源邊界與結論

本次追加直接核對 François Chollet 個人網站、Keras 官方頁、Functional API 指南、ARC Prize、ARC-AGI-1、ARC-AGI-2、Ndea 公司頁與三份研究論文。它們共同支持人物、軟體框架、benchmark、競賽、公司和研究 artifact 的不同定位;它們不單獨支持 benchmark 高分等於一般智能、Keras 使用等於抽象推理、leaderboard 永久有效,或 Ndea 的公司主張已被獨立驗證。
Chollet 的研究與工程影響,應放在框架可用性、模型能力定義、抽象任務、樣本效率、競賽治理、研究方法與公司實體的交叉處理解。把人、工具、任務、規則、分數、論文和公司各自放回正確層次,讀者才能知道一個結果證明了什麼、沒有證明什麼,以及下一個需要重跑或查核的問題,而不把一個名字或一個分數誤當成完整 AI 能力結論。
本段來源:François CholletKerasKeras Functional APIARC PrizeARC-AGI-1ARC-AGI-2NdeaKeras 研究ARC-AGI 研究後續方法研究。本文未把人物、框架、benchmark、競賽、公司或 leaderboard 混為單一能力或商業結論。

把「François Chollet如何重新定義AI能力?從Keras、ARC-AGI到Ndea|2026研究與官方資料更新」拆成可驗證的系統問題

這篇文章的主題不只是一個名詞或產品名稱,而是一套由資料、流程、資源與限制共同組成的系統。讀完主要敘述後,可以把焦點往前推一步:系統邊界在哪裡、關鍵機制如何運作、指標改善是否伴隨新的成本,以及哪些說法仍需要原始資料核對。

分析面向 要追問什麼 可查找的證據
系統邊界 本文的主題由哪些元件、角色與外部條件共同構成? 架構圖、供應鏈、時間線與官方規格
運作機制 結果是由哪個流程、模型、設計或制度選擇造成? 流程步驟、參數、介面、測試與案例
指標與代價 效率、速度或規模提升後,哪種成本或風險被轉移? 功耗、延遲、可靠性、價格、勞動與環境資料
可驗證性 哪些結論可以重現,哪些仍只是公司說法或推測? 原始文件、版本、第三方測試與反例

用這四個問題閱讀,能把技術敘事從「看起來很強」轉成可比較的證據鏈,也能看見一個系統真正改變的是什麼。

增量分析:AI 能力不能只用熟悉題庫的分數衡量,還要看能否在少量例子中抽象新規則

François Chollet 對 Keras 與 ARC-AGI 的脈絡,讓人工智慧評估重新面對「會做過的題」和「理解新規則」的差別。模型在大量資料上取得高分,可能仍不擅長從少量示例辨識抽象關係、組合新概念或適應陌生任務;評測設計因此本身就是對智能定義的選擇。

ARC 類測試也有邊界:題目規模、先驗知識、工具、成本、評分者與任務生成方式都會影響結果。Ndea 或其他產品能力若要被比較,應先確認官方定義、版本、可用資料與重現環境,不把宣傳詞直接當作科學結論。好的評估要說清楚模型做對了什麼、在哪裡失敗,以及新任務是否真的新。

作者與編輯責任

本文署名作者:

|YOLO LAB 主編

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

KEEP READING

接著讀什麼?

從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。

·

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀