测试文章颜色
2026-06-24
Xiaomi MiMo-V2.5 简介
2026年4月27日,我们正式发布 并开源Xiaomi MiMo-V2.5,在 Agent 能力和全模态理解方面迈出了一大步。凭借音频、视频、图片、文字能力,Xiaomi MiMo-V2.5 能够无缝跨模态推理,在 Agent 性能上超越 MiMo-V2-Pro,并支持最高 100 万 token 上下文窗口。
Xiaomi MiMo-V2.5 是一个 310B 参数的稀疏 MoE 模型(激活参数 15B),在 48T token 上训练。其语言骨干继承自 MiMo-V2-Flash 的混合滑动窗口注意力架构,并配备了专用的视觉和音频编码器(均为自研预训练),通过轻量级投影器(projector)连接。
Xiaomi MiMo-V2.5 架构
训练经历五个阶段:文本预训练,在多样化语料上构建 LLM 骨干;投影器预热,对齐音频和视觉投影器与语言模型;大规模多模态预训练,在高质量跨模态数据上训练;监督微调和 Agent 后训练,上下文窗口从 32K 渐进扩展至 256K 再到 100 万;最后是 RL 和 MOPD,进一步增强感知、推理和 Agent 能力。
这些阶段共同产出了一个能看、能听、能对所感知内容行动的模型——一个理解万物并完成任务的模型。
业界领先的 Agent 能力
在对真实部署最重要的 Agent 基准测试中,Xiaomi MiMo-V2.5 交付了业界领先的性能:
在我们的内部 MiMo Coding Bench 中,Xiaomi MiMo-V2.5 在日常编码任务上表现强劲,缩小了与前沿模型的差距,以一半成本达到了与 Xiaomi MiMo-V2.5-Pro 相当的水平。
在 Claw-Eval(日常 Agent 任务基准)上,Xiaomi MiMo-V2.5 在通用子集上达到 62.3,处于性能与效率的绝佳平衡点。
这些结果凸显了 Xiaomi MiMo-V2.5 的独特之处:顶尖 Agent 能力与高 token 效率兼得。
更敏锐的感知,更长程的任务
Xiaomi MiMo-V2.5 提供更敏锐的感知能力,实现精确视觉推理、复杂图表分析和深度全模态理解,原生支持最高 100 万 token 上下文。
在图像、视频和全模态 Agent 任务中,Xiaomi MiMo-V2.5 与前沿闭源模型持平——视频与 Gemini 3 Pro相当,多模态 Agent与 Claude Sonnet 4.6相当,在图像和文档理解方面保持更佳的竞争力,一个模型即可覆盖全部需求
开源
Xiaomi MiMo-V2.5 系列现已完全开源。权重、分词器和完整模型卡可在 Hugging Face 上获取。
Xiaomi MiMo-V2.5-Base:
XiaomiMiMo/MiMo-V2.5-Base · Hugging Face
Xiaomi MiMo-V2.5:
XiaomiMiMo/MiMo-V2.5 · Hugging Face
下一步
Xiaomi MiMo-V2.5 将前沿 Agent 能力和原生全模态感知能力带入同一个模型,让两者可以达到生产级的性价比。我们已经在训练下一代模型,将带来更深推理、更紧密工具集成和更丰富的真实世界基础。同时,请访问 AI Studio 或开放平台进行试用——我们期待看到你的创造。
Xiaomi MiMo-V2.5 简介
2026年4月27日,我们正式发布 并开源Xiaomi MiMo-V2.5,在 Agent 能力和全模态理解方面迈出了一大步。凭借音频、视频、图片、文字能力,Xiaomi MiMo-V2.5 能够无缝跨模态推理,在 Agent 性能上超越 MiMo-V2-Pro,并支持最高 100 万 token 上下文窗口。
Xiaomi MiMo-V2.5 是一个 310B 参数的稀疏 MoE 模型(激活参数 15B),在 48T token 上训练。其语言骨干继承自 MiMo-V2-Flash 的混合滑动窗口注意力架构,并配备了专用的视觉和音频编码器(均为自研预训练),通过轻量级投影器(projector)连接。
Xiaomi MiMo-V2.5 架构
训练经历五个阶段:文本预训练,在多样化语料上构建 LLM 骨干;投影器预热,对齐音频和视觉投影器与语言模型;大规模多模态预训练,在高质量跨模态数据上训练;监督微调和 Agent 后训练,上下文窗口从 32K 渐进扩展至 256K 再到 100 万;最后是 RL 和 MOPD,进一步增强感知、推理和 Agent 能力。
这些阶段共同产出了一个能看、能听、能对所感知内容行动的模型——一个理解万物并完成任务的模型。
业界领先的 Agent 能力
在对真实部署最重要的 Agent 基准测试中,Xiaomi MiMo-V2.5 交付了业界领先的性能:
在我们的内部 MiMo Coding Bench 中,Xiaomi MiMo-V2.5 在日常编码任务上表现强劲,缩小了与前沿模型的差距,以一半成本达到了与 Xiaomi MiMo-V2.5-Pro 相当的水平。
在 Claw-Eval(日常 Agent 任务基准)上,Xiaomi MiMo-V2.5 在通用子集上达到 62.3,处于性能与效率的绝佳平衡点。
这些结果凸显了 Xiaomi MiMo-V2.5 的独特之处:顶尖 Agent 能力与高 token 效率兼得。
更敏锐的感知,更长程的任务
Xiaomi MiMo-V2.5 提供更敏锐的感知能力,实现精确视觉推理、复杂图表分析和深度全模态理解,原生支持最高 100 万 token 上下文。
在图像、视频和全模态 Agent 任务中,Xiaomi MiMo-V2.5 与前沿闭源模型持平——视频与 Gemini 3 Pro相当,多模态 Agent与 Claude Sonnet 4.6相当,在图像和文档理解方面保持更佳的竞争力,一个模型即可覆盖全部需求
开源
Xiaomi MiMo-V2.5 系列现已完全开源。权重、分词器和完整模型卡可在 Hugging Face 上获取。
Xiaomi MiMo-V2.5-Base:
XiaomiMiMo/MiMo-V2.5-Base · Hugging Face
Xiaomi MiMo-V2.5:
XiaomiMiMo/MiMo-V2.5 · Hugging Face
下一步
Xiaomi MiMo-V2.5 将前沿 Agent 能力和原生全模态感知能力带入同一个模型,让两者可以达到生产级的性价比。我们已经在训练下一代模型,将带来更深推理、更紧密工具集成和更丰富的真实世界基础。同时,请访问 AI Studio 或开放平台进行试用——我们期待看到你的创造。