摩尔线程大模型 URPO框架入选国际顶级学术会议 AAAI 2026

IP属地中国·北京 IT之家 时间：2025-11-14 02:08:31

IT之家 11 月 13 日消息，摩尔线程提出的新一代大语言模型对齐框架 —— URPO 统一奖励与策略优化，相关研究论文近日被人工智能领域的国际顶级学术会议 AAAI 2026 收录，为简化大模型训练流程、突破模型性能上限提供了全新的技术路径。

▲ 图源：摩尔线程官方公众号 | URPO 统一奖励与策略优化框架
据介绍，在题为《URPO:A Unified Reward & Policy Optimization Framework for Large Language Models》的论文中，摩尔线程 AI 研究团队提出了 URPO 统一奖励与策略优化框架，将“指令遵循”（选手）和“奖励评判”（裁判）两大角色融合于单一模型中，并在统一训练阶段实现同步优化。URPO 从以下三方面攻克技术挑战：
数据格式统一：将异构的偏好数据、可验证推理数据和开放式指令数据，统一重构为适用于 GRPO 训练的信号格式。自我奖励循环：针对开放式指令，模型生成多个候选回答后，自主调用其“裁判”角色进行评分，并将结果作为 GRPO 训练的奖励信号，形成一个高效的自我改进循环。协同进化机制：通过在同一批次中混合处理三类数据，模型的生成能力与评判能力得以协同进化。生成能力提升带动评判更精准，而精准评判进一步引导生成质量跃升，从而突破静态奖励模型的性能瓶颈。
实验结果显示，基于 Qwen2.5-7B 模型，URPO 框架超越依赖独立奖励模型的传统基线：在 AlpacaEval 指令跟随榜单上，得分从 42.24 提升至 44.84；在综合推理能力测试中，平均分从 32.66 提升至 35.66。作为训练的“副产品”，该模型内部自然涌现出的评判能力在 RewardBench 奖励模型评测中取得 85.15 的高分，表现优于其替代的专用奖励模型（83.55 分）。
IT之家从摩尔线程官方获悉，目前，URPO 已在摩尔线程自研计算卡上实现稳定高效运行。同时，摩尔线程已完成 VERL 等主流强化学习框架的深度适配

免责声明：本网信息来自于互联网，目的在于传递更多信息，并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益，请及时联系我们，本站将会在24小时内处理完毕。

同类资讯

企业级Agent落地生产困境何解？评估先行成破局关键密码

高德问店上线：AI赋能商户，一站式解决选址经营难题获用户好评

AI产品开箱即用腾讯智能体集中亮相WAIC

阿里云王坚：对AI理解科学的想象，还局限在人类写出来的知识里

字节两员离职大将，单挑老东家？

阿维塔07L开启预售：全系标配华为ADS 5与896线激光雷达，24.99万元起

全站最新

企业级Agent落地生产困境何解？评估先行成破局关键密码

高德问店上线：AI赋能商户，一站式解决选址经营难题获用户好评

AI产品开箱即用腾讯智能体集中亮相WAIC

阿里云王坚：对AI理解科学的想象，还局限在人类写出来的知识里

热门推荐

企业级Agent落地生产困境何解？评估先行成破局关键密码

高德问店上线：AI赋能商户，一站式解决选址经营难题获用户好评

AI产品开箱即用腾讯智能体集中亮相WAIC

阿里云王坚：对AI理解科学的想象，还局限在人类写出来的知识里

英矽智能创始人：中国让人工智能惠及全球更多国家

字节两员离职大将，单挑老东家？

阿维塔07L开启预售：全系标配华为ADS 5与896线激光雷达，24.99万元起

对话|大晓机器人董事长王晓刚：商业化落地路径采取先To B后To C

大盘回撤银行股逆势抗跌，分红创新高后行情延续性几何？

紫银转债迎最后交易日，未转股比例高达99.99%，青农转债接棒大考

飞天茅台i茅台零售价涨至1639元/瓶，1L规格同步上调

安克充电宝首批获新国标认证，26年全线新品同步跟进

磐石·科学基础大模型2.0发布——通专“双轮驱动”，探索科研新范式

中国工程院院士、阿里云创始人王坚：AI的下一场革命，关键在“科学数据”

金融城小燃哥｜AI 支付要来了，你准备好了吗？