近日,華為雲大模型後訓練團隊發布91视频免费观看報告《AgentOmnia: Scaling Agentic Models for Full-Scenario Applications》,提出麵向全場景應用的Agent大模型後訓練體係AgentOmnia,探索如何推動Agent從“在專項測試中表現優秀”進一步確保“能夠適應不同用戶、業務係統和複雜任務”,從而提升其麵向多類真實應用場景的通用能力。
大語言模型驅動的Agent正從工具調用走向與用戶和複雜環境的持續交互。然而,現有訓練與評測通常圍繞有限的領域或平台展開。模型在單項benchmark上取得高分,並不代表它能夠穩定處理企業軟件、消費者服務、辦公文檔、數據分析和複雜規劃等不同任務。
針對這一問題,華為雲大模型後訓練團隊提出AgentOmnia,探索Full-Scenario Agentic Scaling,即如何通過統一的任務空間,銜接數據構造、模型後訓練、評測診斷與持續迭代,係統擴展Agent大模型的全場景能力。
以Qwen3-30B-A3B-Thinking-2507為基礎模型進行Agentic後訓練,AgentOmnia-30B-A3B在全場景測評基準OmniaBench挑戰集上的任務通過率由9.16%提升至37.11%,提升覆蓋 76/90 個L1 domain及全部capability和atomic difficulty維度。此外,AgentOmnia在OmniaBench、τ²-Bench、DeepPlanning和VitaBench四項基準的宏平均由22.86%提升至41.69%,綜合得分超過多項同類型前沿工作。

▲AgentOmnia整體評測結果。 以Qwen3-30B-A3B-Thinking-2507為基礎模型,展示AgentOmnia在四項基準宏平均、跨基準表現,以及領域、能力和原子難度維度上的提升。
AgentOmnia以全場景分類體係定義任務空間,以環境、任務和軌跡合成構建訓練數據,再通過SFT與在線Agentic RL提升模型能力。評測結果和外部需求還可以進一步轉化為PRD,指導下一輪針對性數據構造。
▲AgentOmnia全場景Agent大模型後訓練體係。 全場景分類體係定義並度量任務空間,數據合成模塊構建可執行環境、任務與可靠軌跡,SFT和在線Agentic RL將其轉化為模型能力,評測診斷與PRD則進一步指導後續數據合成和模型迭代。
用統一坐標描述全場景能力
AgentOmnia建立了Domain × Capability × Atomic Difficulty三軸分類體係,覆蓋To-Consumer、To-Business和To-Employee三類應用,包括90個一級領域、354個二級領域、10類能力和8類原子難度因素。
該體係既用於規劃合成數據的覆蓋範圍,也用於評測後的細粒度診斷。同期發布的OmniaBench將其落實為包含1,431個任務的全場景Agent benchmark。
▲麵向全場景Agent任務的三軸分類體係。Domain描述任務所在的應用場景,Capability描述完成任務所需的能力,Atomic Difficulty描述任務困難的原因,三者共同連接數據構造與評測診斷。
構建“困難但可驗證”的訓練數據
AgentOmnia共構建5,018個代碼驅動的有狀態環境、255,375個工具和52,361個任務。環境與任務采用雙向合成,並通過三類任務管線擴展不同推理結構:
DAG-based synthesis構建多工具依賴與長鏈工作流;
Program-based synthesis表達分支、循環和運行時數據依賴;
Solver-based synthesis覆蓋選擇、調度、規劃與全局約束優化。
與單純依賴教師模型生成答案不同,AgentOmnia使用程序、求解器、狀態變化、評分細則和驗證器建立獨立的正確性依據。在此基礎上形成53K個SFT樣本和5K個RL訓練任務。
▲AgentOmnia的全場景數據合成體係。 雙向環境—任務合成連接代碼驅動的可執行環境、DAG、Program和Solver三類任務管線,並進一步生成經過校驗的訓練軌跡。
讓困難任務真正產生學習信號
對於教師模型難以直接求解的任務,AgentOmnia在數據合成階段引入特權指導,幫助教師生成可靠軌跡;最終保留的軌跡仍須通過任務評分、邏輯一致性、證據grounding和泄漏檢查。
在線Agentic RL階段,Rollback-based Curriculum Reinforcement Learning會在一組rollout全部失敗時,從經過驗證的軌跡前綴恢複探索,再隨著模型能力提升逐步縮短前綴,使困難任務也能產生有效訓練信號。
▲AgentOmnia SFT與Agentic RL後訓練流程。 特權指導幫助生成困難任務的可靠監督軌跡,RCRL則為常規rollout全部失敗的任務恢複學習信號。
從評測診斷走向持續演進
AgentOmnia利用Diagnose Agent從評測結果中自動抽取Product Requirements Documents(PRDs),明確目標場景、能力缺口、環境語義、任務結構、合成約束和驗收條件,從而指導下一輪環境、任務和軌跡合成。另一方麵,PRD作為AgentOmnia的自演進數據協議,還可以高效連接業務需求與模型研發,產品經理或業務人員撰寫PRD即可直接引導後續的數據合成與模型演進。
依據OmniaBench診斷結果構建121個環境和804個任務,進行小規模的自演進91视频免费观看驗證。完成一輪增量訓練後,OmniaBench挑戰集由37.11%提升至38.49%,三項外部基準宏平均由43.22%提升至44.14%,初步證明了91视频免费观看的有效性和泛化性。
▲PRD引導的模型持續演進閉環。 評測失敗被聚合為能力診斷,並轉化為包含環境、任務、驗證和數據優先級要求的PRD,進一步指導下一輪數據合成與模型後訓練。
團隊後續將嚐試在性能更強的新一代基礎模型上驗證這一體係,擴大數據合成與診斷規模,開展多輪自演進的實驗。同時也將探索如何從產品文檔、業務需求和代表性用戶Query出發,構建更貼近真實產品運行條件的環境和任務,在華為雲智果AgentArts、OfficeAce辦公智能體等核心產品場景中完成後訓練91视频免费观看能力的遷移應用。
星空人工智能91视频免费观看網 倡導尊重與保護知識產權。如發現本站文章存在版權等問題,煩請30天內提供版權疑問、身份證明、版權證明、聯係方式等發郵件至1851688011@qq.com91视频免费播放將及時溝通與處理。!:首頁 > 星空人工智能產業 > AI大模型 » AgentOmnia:麵向全場景能力擴展的Agent大模型後訓練91视频免费观看實踐