当前位置: 首页 » 资讯 » 科技头条 » 正文

小米大模型MiMo-V2-Pro & Omni & TTS 全球发布

IP属地 中国·北京 北京商报 时间:2026-03-19 10:03:59

北京商报讯(记者 陶凤 王天逸)3月19日,小米大模型(Xiaomi MiMo)团队发文,正式发布MiMo-V2-Pro & Omni & TTS 三款大模型。

据悉,Xiaomi MiMo-V2-Pro是小米面向 Agent 时代的旗舰基座模型,专为现实世界中高强度的 Agent 工作场景而打造。它拥有超过1T的总参数量(42B激活参数),采用创新的混合注意力架构,并支持1M超长上下文长度。在强大的模型基座上,小米在更为广泛的 Agent 场景中持续 Scaling 算力,进一步拓展了智能的动作空间,实现了从 Coding 到 Claw 的重要泛化。在全球权威大模型综合智能排行榜 Artificial Analysis 上,MiMo-V2-Pro 位列全球第八,国内第二。

MiMo-V2-Omni 是小米面向 Agent 时代的全模态基座模型,专为现实世界中复杂的多模态交互与执行场景而生。小米从底层构建了融合文本、视觉、语音的全模态基座,并以统一架构将"感知"与"行动"深度绑定。这不仅打破了传统模型"重理解、轻执行"的局限,更让模型原生具备了多模态感知、工具调用、函数执行及 GUI 操作能力。MiMo-V2-Omni 可无缝接入各种 Agent 框架,实现了从理解到操控的跨越,大幅降低了全模态 Agent 的落地门槛。

Xiaomi MiMo-V2-TTS 是小米自主研发的语音合成大模型。它基于自研 Audio Tokenizer 和多码本语音-文本联合建模架构,经过上亿小时语音数据的大规模预训练与多维度强化学习,实现了高度可控的多粒度语音风格控制。MiMo-V2-TTS 支持从整体风格定调到局部情绪表达的精准调节,能在同一句话内完成语气转折和情感递变;真实还原人类说话的自然韵律;在唱歌时,也能准确表达音高和节奏,自然且富有表现力。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。