首頁 > 人物 > 科技人物與公司 > Thomas Wolf 如何把 Transformer 變成 AI 基礎設施?Hugging Face 與 BigScience

延伸主題

Thomas Wolf 如何把 Transformer 變成 AI 基礎設施?Hugging Face 與 BigScience

Thomas Wolf 沒有發明 Transformer,卻參與把 ...

Thomas Wolf穿深綠色毛衣坐在室內,手指輕觸臉頰,畫面標示 Thomas Wolf

Thomas Wolf 如何把 Transformer 變成 AI 基礎設施?Hugging Face 與 BigScience

先講結論:Thomas Wolf 的影響力,不只是 Transformers 程式庫,而是把模型介面、Model Hub、BigScience 與多語言研究連成開放 AI 基礎設施。BLOOM 等成果來自大型共同體,應把個人、平台與研究團隊的角色分開。

一句話說,Wolf 的核心貢獻是讓研究者能以相近工具載入、訓練、分享與評估不同 Transformer 模型。

Transformers API 降低實驗門檻,但資料、權重、硬體、版本與授權仍決定可重現性。

BigScience 的多語言協作把資料、語言代表性、算力與治理帶到同一個研究問題。

BLOOM 是共同研究成果,不能寫成單一作者或單一公司獨立完成。

多語言模型要評估語言覆蓋、資料品質、文化偏差、毒性與不同語境的錯誤成本。

開源平台提升分享與審查,也需要模型卡、資料卡、版本、漏洞與權利治理。

研究 Wolf 時要區分程式庫、Hugging Face 平台、BigScience 社群與個別模型。

引用下載量、模型數或 Benchmark 時,應標示版本與查核日期。

總結來說,Wolf 的案例展示開放軟體如何把論文模型變成可共同維護的 AI 基礎設施。

<

p class=”wp-block-paragraph”>Thomas Wolf 沒有發明 Transformer,也不是 BERT 或 GPT 的作者,但如果要理解這些模型為什麼能快速從論文進入全球開發者的電腦,他是一個重要人物。Wolf 與 Hugging Face 團隊參與建立的 Transformers,把不同研究機構發布的預訓練模型整理進一套可重用軟體介面,降低研究成果被複製、微調與部署的門檻。

他的另一項重要工作 BigScience,則進一步把開放的概念從「程式碼」延伸到大型模型研究本身。這個超過千名研究者參與的協作計畫最終建立多語言資料集 ROOTS,並訓練 176B 參數的 BLOOM。截至 2026 年,Thomas Wolf 仍是 Hugging Face 共同創辦人兼 Chief Science Officer。

  • Thomas Wolf 是 Hugging Face 共同創辦人兼 Chief Science Officer。
  • 2019 年 Transformers 論文把不同 Transformer 模型整理進統一 API,Thomas Wolf 是第一作者。
  • Transformers 的軟體歷史可追到早期 pytorch-pretrained-bert,之後演進為 pytorch-transformers 與今天的 Transformers。
  • Thomas Wolf 是 BigScience 的 initiator 與 senior chair;BigScience 集結超過 1,000 名研究者。
  • BigScience 最終產出 176B 參數 BLOOM,以及用來訓練它的 ROOTS 多語言資料集。

文章實體化:Thomas Wolf 與 Hugging Face AI 基礎設施

Thomas Wolf 的工作把 Transformer 從研究論文接到開發者真正使用的基礎設施:Hugging Face 提供模型、資料集、tokenizer、文件與社群協作接口,BigScience 則把多國研究者、資料治理與大模型實驗組織起來。AI 基礎設施因此不只是一個 API,而是模型生命週期的公共工作層。

  • Hugging Face:理解模型庫、資料集、tokenizer 與推論工具如何降低研究到產品的距離。
  • Transformer 生態:看模型權重、版本、評估與部署如何需要共同格式。
  • BigScience:聚焦跨國協作、資料治理、研究透明度與大模型公共資源。

本文以「Thomas Wolf、Hugging Face、Transformer、BigScience、模型、資料集與開源協作」為主線,補回人物、組織、作品、技術節點、產業場景與它們之間的因果關係,讓讀者能從具名實體一路追到實際流程、文化語境與影響。

Thomas Wolf真正改變的,是論文與開發者之間的距離

2017 年 Transformer 架構發表後,AI 研究快速進入一段模型爆發期。

Google 發布 BERT,OpenAI 發展 GPT 系列,其他研究團隊陸續提出 RoBERTa、XLNet、DistilBERT 等不同模型。每一篇研究都可能有自己的 repository、模型類別、checkpoint 格式、tokenizer 與使用方法。

對研究者來說,這代表新的問題。

讀懂論文是一件事,讓模型真正跑起來又是另一件事。

如果每一個新模型都要重新讀原始碼、重寫 preprocessing、重新處理 checkpoint,論文即使公開,實際使用成本仍然很高。

Thomas Wolf 與 Hugging Face 團隊的影響,就是在這個斷層中建立軟體層。

Transformers最初為什麼會從BERT開始

Hugging Face Transformers 的早期版本名為 pytorch-pretrained-bert

這個名稱直接反映當時的問題:BERT 已經展示很強的 NLP transfer learning 能力,但使用者仍需要一套可靠的 PyTorch 實作,把模型架構、預訓練權重與 tokenizer 整合起來。

之後套件支援的模型開始超過 BERT,因此名稱先改成 pytorch-transformers,再演變成今天的 transformers。Hugging Face 舊版文件至今仍保存從 pytorch-pretrained-bert 遷移到 Transformers 的紀錄。

這個改名很重要。

它代表 Hugging Face 不再只替單一模型提供方便的 implementation,而是試圖建立一個更通用的模型軟體介面。

一個統一API為什麼會改變AI研究速度

2019 年發表的〈HuggingFace’s Transformers: State-of-the-art Natural Language Processing〉把軟體設計目標寫得很清楚。

Transformers 要提供經過工程整理的 Transformer architectures,使用統一 API;同時再結合社群可取得的 pretrained models。

這件事看起來像單純改善 developer experience,實際上卻會改變研究傳播速度。

假設一名研究者今天想比較 BERT 與 GPT-2。

  • 找兩個不同 repository;
  • 建立不同 dependency;
  • 理解不同 checkpoint 格式;
  • 重寫 tokenizer;
  • 自己處理 inference;
  • 再想辦法統一 evaluation。

有了 Transformers,許多差異被壓到同一套 abstraction 底下。

研究者可以把更多時間放在「模型做了什麼」,而不是「怎麼讓程式先跑起來」。

from_pretrained()為什麼是AI軟體史的重要介面

今天使用 Transformers 時,一個非常普通的動作是從 Hub 載入預訓練模型。

Transformers 文件目前仍以 PreTrainedModel.from_pretrained 作為下載並載入模型權重與設定的核心介面之一。

從軟體設計角度看,這個概念非常重要。

論文裡的模型不再只是 architecture definition。

它逐漸變成一個可以被下載的軟體物件:architecture + configuration + tokenizer + weights。

也就是說,研究成果開始具備 package 的特性。

今天的 AI 開發者習慣看到模型名稱就直接載入、fine-tune 或推理,這在 2018 年以前並不是同樣自然的工作方式。

Transformers後來已經超出NLP

Transformers 最初的核心場景是自然語言處理,但今天 Hugging Face 官方 repository 已把它定位為涵蓋 text、vision、audio 與 multimodal models 的 model-definition framework。

這個演進再次說明 Thomas Wolf 與 Hugging Face 團隊最重要的判斷之一:真正值得建立的並非某個模型專用 library,而是一個能跟著模型研究一起擴張的 abstraction。

模型會換。

BERT 可以被新的 encoder 取代,GPT-2 可以被更大的 decoder model 取代。

只要軟體介面仍能吸收下一批模型,整個開發者生態就可以繼續存在。

Hugging Face真正形成的是模型的軟體供應鏈

Transformers 解決的是「怎麼執行模型」。

Hugging Face Hub 後來又把問題往上一層推:模型要放在哪裡、怎麼被找到、怎麼共享?

今天開發者使用 Hugging Face 時,通常不是單獨使用 Transformers。

實際工作流更接近:Hub 找模型 → Transformers 載入 → Datasets 準備資料 → fine-tune → 上傳新 checkpoint → 其他人再次使用。

因此 Hugging Face 後來形成的價值,是把 AI 研究結果逐漸整理成一套軟體供應鏈;若要理解供應鏈在遭遇自主 Agent 攻擊時的風險,可延伸閱讀Hugging Face 安全事件解析

Thomas Wolf 的人物價值也應該放在這裡理解。

他的影響並非來自一個單獨 benchmark,而是參與建立讓大量模型可以流通的介面與文化。

BigScience為什麼是下一個轉折

建立開源 library 後,Thomas Wolf 又參與另一個更大的問題:

如果模型程式碼可以開放,大型模型的研究過程本身能不能也開放?

這就是 BigScience。

Hugging Face 官方資料把 Wolf 稱為 BigScience 的 initiator 與 senior chair;BigScience 社群則記錄,這個研究協作曾集結超過 1,000 名來自全球的研究者。

當時大型語言模型的算力需求正在快速增加。

一般大學實驗室很難獨自訓練百億、千億參數模型。

於是 BigScience 採用另一種方法:把原本集中在單一企業內完成的大模型計畫,拆成跨機構、跨國家的協作研究。

BLOOM做的並非只是再訓練一個GPT

BigScience 最知名成果是 BLOOM。

BLOOM 是 176B 參數的開放存取多語言語言模型;訓練資料則來自 ROOTS,一個約 1.6TB 的多語言資料集合。

模型大小本身並不是 BigScience 最值得理解的地方。

BigScience 同時讓不同團隊研究:

  • 資料來源;
  • 語言代表性;
  • 訓練架構;
  • distributed training;
  • 模型評估;
  • ethics;
  • licensing;
  • governance。

因此 BLOOM 可以被視為一次實驗:大型模型是否可以像大型科學合作計畫一樣,被不同機構共同建立?

這和 Hugging Face 早期 Transformers 的軟體哲學其實非常一致。

Transformers 把模型 implementation 從單一研究團隊帶給所有開發者。

BigScience 則試圖把模型研究流程也向更大的社群開放。

開源AI到2026年已經變成獨立生態

Hugging Face 2026 年發布的開源 AI 生態報告顯示,2025 年平台規模已達約 1,300 萬使用者、超過 200 萬個公開模型,以及超過 50 萬個公開資料集。

這不能被寫成 Thomas Wolf 一個人的成就。

Hugging Face 是大型公司,平台內容來自全球研究者、企業與開發者。

但這組數字能說明一件事:

十年前「讓研究模型更容易被其他人使用」看起來只是工程便利性;到了今天,它已經形成一個獨立的 AI 生產體系。

現在研究者發布模型時,模型權重、model card、dataset、demo 與 evaluation 很可能會一起出現在 Hub。

開源模型也不再只是大公司 frontier model 的低成本替代品,而是形成自己的研究、部署與衍生模型文化。Hugging Face 2026 年的觀察指出,使用者正在大量建立 fine-tuned models、adapters、benchmarks 與 applications。

Thomas Wolf和Clément Delangue有什麼不同

理解 Hugging Face 時,很容易把三位共同創辦人的角色混在一起。

Thomas Wolf 最適合從研究與開源技術生態理解。

他的官方職位是 Chief Science Officer,Transformers 論文與 BigScience 又提供兩個很清楚的技術節點。

Clément Delangue 則更適合作為另一篇文章,處理:Hugging Face 如何從聊天機器人新創變成 AI 平台公司,以及開源社群如何轉換成商業模式。

兩篇拆開後,搜尋意圖會比寫成一篇「Hugging Face 創辦人介紹」更完整。

Thomas Wolf沒有發明Transformer,為什麼仍然重要

AI 技術史很容易只記得提出 architecture 的研究者。

Transformer 有 Ashish Vaswani 等原始作者。

BERT 有 Google AI 團隊。

GPT 有 OpenAI 的多位研究者。

但軟體產業還需要另一種人物:把不同人的發明整理成其他人真的能使用的系統。

Thomas Wolf 的代表性就在這裡。

Transformers 並沒有重新發明 attention。

它降低了 attention-based models 被重複使用的摩擦。

BigScience 也沒有發明大型語言模型。

它測試了另一種建立大型語言模型的方法:開放協作。

這兩件事共同構成 Thomas Wolf 在 AI 軟體史中的位置。

為什麼2026年仍值得理解Thomas Wolf

2026 年最熱門的 AI 關鍵字已經變成 reasoning、agent、multimodal、robotics 與 AI for science。

但這些領域仍然需要同一套基本條件:模型必須能被取得、執行、比較、修改與再次分享。

Hugging Face 2026 年的開源生態報告也顯示,開源社群正在從純文字與圖片模型向 robotics、AI for science 與 agents 延伸。

因此 Thomas Wolf 的歷史價值並沒有停在 BERT 時代。

他的研究與工程路線代表 AI 發展中較少被媒體強調的一層:模型能力決定AI能做到什麼;軟體基礎設施決定多少人真的能使用這些能力。

Thomas Wolf常見問題

Thomas Wolf是誰?

Thomas Wolf 是 Hugging Face 共同創辦人兼 Chief Science Officer,也是 Transformers 論文第一作者及 BigScience 的發起者與 senior chair。

Thomas Wolf發明了Transformer嗎?

沒有。Transformer 架構來自 2017 年〈Attention Is All You Need〉的 Google 研究團隊。Wolf 的重要工作之一,是參與把 Transformer-based models 整理進 Hugging Face Transformers 統一軟體介面。

Hugging Face Transformers是什麼?

Transformers 是一套開源 machine learning library,以統一 API 提供大量 pretrained Transformer architectures 與 checkpoints,現在已涵蓋文字、視覺、語音與多模態模型。

BigScience是什麼?

BigScience 是大型開放協作研究計畫,曾集結超過 1,000 名研究者,共同研究大型語言模型的資料、訓練、倫理與治理問題。

BLOOM和Thomas Wolf有什麼關係?

BLOOM 是 BigScience 的主要模型成果之一;Thomas Wolf 是 BigScience 發起者與 senior chair,也是 BLOOM 論文的共同作者之一。

Hugging Face現在有多大?

Hugging Face 在 2026 年公布的資料指出,2025 年平台約有 1,300 萬使用者、超過 200 萬個公開模型與超過 50 萬個公開資料集。

資料來源

Thomas Wolf 的技術史可以濃縮成一條很清楚的路徑:BERT implementation → Transformers → pretrained model ecosystem → BigScience → BLOOM → open AI infrastructure。

他最值得被記住的地方,是把「可以閱讀的 AI 研究」推進成「可以直接執行、修改與再次分享的 AI 軟體」。

以下圖片取自 Hugging Face 官方 Thomas Wolf 個人頁,補充本文對 Transformer、Hugging Face 與 BigScience 的介紹;這是官方 profile 素材,不把它當成模型架構或資料集流程的示意圖。

Hugging Face 官方 Thomas Wolf 圖片
Hugging Face 官方 Thomas Wolf 圖片;圖片來源:Hugging Face 官方個人頁。 圖片來源:Hugging Face 官方 Thomas Wolf 圖片

若想從 Hugging Face Transformers 回到 Transformer 架構的研究起點,可接著閱讀 Ashish Vaswani、Transformer 與 Essential AI

若想比較 Thomas Wolf 建構 Transformers 基礎設施與 Hugging Face 平台創辦團隊的分工,可延伸閱讀 Clement Delangue、Hugging Face 與開放模型協作平台

把「Thomas Wolf 如何把 Transformer 變成 AI 基礎設施?Hugging Face 與 BigScience」拆成可驗證的系統問題

這篇文章的主題不只是一個名詞或產品名稱,而是一套由資料、流程、資源與限制共同組成的系統。讀完主要敘述後,可以把焦點往前推一步:系統邊界在哪裡、關鍵機制如何運作、指標改善是否伴隨新的成本,以及哪些說法仍需要原始資料核對。

分析面向要追問什麼可查找的證據
系統邊界本文的主題由哪些元件、角色與外部條件共同構成?架構圖、供應鏈、時間線與官方規格
運作機制結果是由哪個流程、模型、設計或制度選擇造成?流程步驟、參數、介面、測試與案例
指標與代價效率、速度或規模提升後,哪種成本或風險被轉移?功耗、延遲、可靠性、價格、勞動與環境資料
可驗證性哪些結論可以重現,哪些仍只是公司說法或推測?原始文件、版本、第三方測試與反例

用這四個問題閱讀,能把技術敘事從「看起來很強」轉成可比較的證據鏈,也能看見一個系統真正改變的是什麼。

作者與編輯責任

本文署名作者:

|YOLO LAB 主編

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

KEEP READING

接著讀什麼?

從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀