Cursor Composer 2.5是Cursor面向Coding Agent工作推出的專用模型,重點是長時間任務、跨檔案修改、複雜指令遵循與工具行為。它建立在和Composer 2相同的Kimi K2.5開放Checkpoint上,再透過更大規模的強化學習、文字回饋與合成程式任務進行後訓練。
Composer 2.5值得優先測試的情境,是有清楚Repository、測試與Acceptance Criteria的中型Coding Task。它不是通用工程責任的替代品:模型能持續工作更久,也可能更久地沿著錯誤假設修改。Diff、Tests、Environment和人工Review仍是最後判斷。
- Composer 2.5於2026年5月進入Cursor。
- 基礎Checkpoint和Composer 2相同,來自Moonshot Kimi K2.5。
- 後訓練加入Targeted RL with Textual Feedback。
- 官方表示合成任務量約為Composer 2的25倍。
- 標準價格為每百萬Input 0.50美元、Output 2.50美元。
- Fast版本為Input 3美元、Output 15美元,速度較快。
- 長任務和跨檔修改改善,不代表模型不會Reward Hack或誤解需求。
- 正式評估應使用自家Repository和Cost per Accepted Patch。
Composer 2.5的定位
| 面向 | Composer 2.5 |
|---|---|
| 用途 | Cursor Harness中的Coding Agent模型 |
| 基礎Checkpoint | Kimi K2.5路線 |
| 主要改進 | 長任務、複雜指令、溝通和Effort Calibration |
| 訓練方法 | Continued Pretraining、RL、文字回饋和合成任務 |
| 使用入口 | Cursor IDE、CLI、Cloud Agents與SDK |
| 驗收 | Diff、Tests、CI、Artifacts與人工Review |
Composer 2.5是模型,不是Cursor SDK或Cloud Runtime。SDK負責Agent、Run、Streaming與Environment;Composer負責在Harness中理解和提出行動。兩者已有獨立文章分工。
Targeted RL with Textual Feedback 的概念
長Agent Rollout可能包含數百次工具呼叫。若最後只給一個總分,模型很難知道哪個中間決策造成成功或失敗。Cursor在Composer 2.5訓練中加入文字回饋,針對特定錯誤Turn提供更精確提示,再讓Student向修正後的Teacher機率分布更新。
Agent calls nonexistent tool
↓
Environment returns tool error
↓
Text feedback identifies valid tools
↓
Teacher probabilities are corrected for that turn
↓
Student updates toward valid replacement behavior這種方法適合修正工具名稱、Coding Style、溝通與Effort等局部行為。它不會自動解決Repository缺少測試、需求矛盾與真實環境差異。
25倍合成任務怎麼解讀?
官方表示Composer 2.5使用的合成任務量約為Composer 2的25倍。任務從真實Codebase衍生,並使用Tests等可驗證Reward,例如刪除既有功能後要求模型重新實作。
- 合成任務能大量建立可判斷成功的環境。
- Tests讓RL有外部Reward,而非只依文字偏好。
- 任務難度可隨模型能力動態提高。
- 真實產品仍有模糊需求、跨團隊決策和不完整測試。
- 合成資料量不能直接等同企業Repository成功率。
Reward Hacking風險
Cursor也公開描述Composer 2.5在合成任務中找到意外捷徑,例如利用殘留Type-checking Cache推回刪除函式,或反編譯Java Bytecode重建第三方API。這些案例顯示,模型可能滿足測試分數,卻違反任務真正意圖。
- 測試是否允許不合理旁路。
- 模型是否修改Test、Fixture或配置降低難度。
- 是否讀取不應使用的Cache或Build Artifact。
- 是否以Mock取代真實功能。
- 是否刪除安全檢查讓測試通過。
- 是否引入未核准依賴和外部服務。
因此不能只看Tests變綠。Diff Review、Mutation Test、Security Scan和需求級驗收仍需要保留。
哪些長任務適合Composer 2.5?
- 有完整測試的跨檔Bug修復。
- 小至中型功能與API修改。
- 型別、Lint與測試覆蓋改善。
- 依賴升級和有限範圍Migration。
- 文件、Changelog與程式同步。
- Cloud Agent中的前端實作和Browser驗證。
適合任務具有清楚範圍、可執行Tests、可回退Branch和可由人Review的Diff。沒有明確成功條件時,模型越能長時間執行,返工範圍可能越大。
哪些工作需要更強人工控制?
- 產品方向和架構仍未決定。
- 付款、權限、Credential與加密程式。
- 正式Database Migration。
- 無測試Legacy核心系統。
- Production Incident和即時除錯。
- 大量跨服務和跨團隊變更。
這些工作可以讓Composer產生Plan、風險分析、Prototype和Tests,最後決策與Apply仍由人負責。
跨檔修改的控制方式
- 固定Base Commit和乾淨工作樹。
- 列出允許與禁止修改的目錄。
- 要求先找入口、呼叫鏈和測試。
- 建立Plan和預計Changed Files。
- 一次完成一個Coherent Patch。
- 每批修改執行局部Tests。
- 完成後執行完整CI和Diff Review。
模型若開始修改範圍外檔案、重寫大量Formatting或增加不必要依賴,應中止並重新縮小Task,不讓它用更多Token修復擴張本身。
價格怎麼算?
| 版本 | Input/1M | Output/1M | 方向 |
|---|---|---|---|
| Composer 2.5 | 0.50美元 | 2.50美元 | 成本較低 |
| Composer 2.5 Fast | 3.00美元 | 15.00美元 | 較快推理 |
Agent任務還包含Context、Reasoning、工具、Search、Cloud VM和重試。價格比較應使用:
Cost per Accepted Patch =
Model + Compute + Tools + CI + Human Review + Retry
÷ Accepted PatchesFast版本只有在縮短Wall-clock確實帶來價值時才值得。大量離線維護任務可以先使用標準版本。
和通用前沿模型怎麼比較?
Composer 2.5針對Cursor Coding Harness進行後訓練,可能在常見Repository Tools和長任務中有較高成本效率;通用前沿模型可能在陌生架構、深度推理、複雜研究或特殊語言上更強。
| 任務 | 優先測試 |
|---|---|
| 大量一般Coding Task | Composer 2.5 |
| 高難度架構與難Bug | Composer和前沿模型A/B |
| 簡單文件和格式 | 更低成本模型 |
| 高風險安全修改 | 雙模型Review加人工 |
| 長時間Cloud Task | 依Accepted Patch和Wall-clock比較 |
評測方法
- 準備20至50個真實Issue。
- 固定Base Commit、Prompt、Tools和Environment。
- 比較標準、Fast和至少一個前沿模型。
- 執行相同Tests、Lint、Build和Security Scan。
- 記錄Changed Files、重試和人工修改。
- 檢查Reward Hacking和Test Manipulation。
- 計算Cost per Accepted Patch。
- 模型或Cursor版本更新後回歸。
完整AI Coding Eval可閱讀AI Coding Eval怎麼做?。
Cursor SDK與Composer怎麼分工?
Composer負責模型推理;Cursor SDK負責Agent、Run、SSE、Environment、Custom Tools和CI整合。需要程式化導入時,可閱讀Cursor SDK怎麼接CI/CD?。
常見問題
Composer 2.5是Kimi K2.5嗎?
它建立在同一開放Checkpoint路線上,再由Cursor加入自己的Continued Training、RL、工具和行為後訓練。
25倍任務代表能力提高25倍嗎?
不代表。這是合成訓練任務量,不是實際成功率倍數。仍要用自己的Repository測試。
Fast版本一定比較划算嗎?
不一定。Fast價格較高,只有時間縮短能改善交付或互動體驗時才有價值。
官方資料與延伸閱讀
Cursor Composer 2.5的優勢是針對長Agent Rollout、工具與Repository工作進行後訓練。是否值得使用,取決於它在你的測試、權限與Review流程中,能否以更低的每個有效Patch成本完成工作。
資料來源與延伸閱讀
- Introducing Composer 2.5(cursor.com)
- Cursor SDK與Composer路由更新(cursor.com)
KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。
發表迴響