Minimax 大模型
Minimax 上海稀宇科技有限公司,总部位于上海市徐汇区模速空间的大模型人工智能公司。
总结
公司推出的产品 有MiniMaxM2.1、Hailuo2.3、Speech2.6和Music2.0等
全系列大模型
- (1)LLM
- MiniMax M3
- MiniMax M2.7
- MiniMax M2.5
- (2)VIDEO
- MiniMax H3
- (3)SPEECH & MUSICSPEECH & MUSIC
- MiniMax Speech 2.8
- MiniMax Music 3.0
我先搜索 MiniMax 各模型的发布时间,确保时间线准确。按发布时间整理如下:
| 时间 | 模型 | 类别 | 核心特点 |
|---|---|---|---|
| 2022 | abab 1–4 | 文本 | 早期多代语言模型,支撑 Glow 产品上线 |
| 2023-08 | abab 5 | 文本 | 基础对话模型 |
| 2023 | abab 5.5 | 文本 | 16,384 token 上下文 |
| 2023-11 | Speech-01 | 语音 | 首款语音合成模型 |
| 2024-01 | abab 6 | 文本(MoE) | 万亿参数,对标 GPT-4 |
| 2024-04 | abab 6.5 | 文本(MoE) | 万亿参数,200K 上下文 |
| 2024-08-31 | Hailuo-01(Video-01) | 视频 | 首个视频生成模型 |
| 2024 | Music-01 | 音乐 | 首款音乐生成模型 |
| 2025-01-15 | MiniMax-01(Text-01 / VL-01) | 文本/多模态 | 开源,线性注意力,4560亿参数/459亿激活,400万 Token 上下文 |
| 2025-02-11 | Image-01 | 图像 | 文生图,支持多种尺寸 |
| 2025-02 | T2V-01-Director / I2V-01-Director | 视频 | 导演版视频生成 |
| 2025-04 | Speech-02 | 语音 | 超拟人、个性化、多情感 |
| 2025-06-16 | MiniMax-M1 | 文本(推理) | 80K 思维链 × 1M 输入,开源 MoE,主打推理深度 |
| 2025-06 | Hailuo 02 | 视频 | 第二代视频模型 |
| 2025-09-11 | Music-1.5 | 音乐 | 音乐生成升级 |
| 2025-10-27 | MiniMax-M2 | 文本(MoE) | 230B 总参/10B 激活,编码与 Agent,MIT 协议,效果/价格/速度平衡 |
| 2025-10 | Hailuo 2.3 | 视频 | 视频模型迭代 |
| 2025-Q4 | M2.1 / M2-her | 文本 | M2 系列迭代(108 天完成 M2→M2.5 三代演进) |
| 2026-02 | M2.5 | 文本 | 生产力场景全球领先 |
| 2026-02 | Music2.5+ | 音乐 | 乐器解锁,突破风格边界 |
| 2026-03-18 | M2.7 | 文本/Agent | Agent 旗舰,首次实现模型自我进化,可承担 30%–50% 研发工作量 |
| 2026-04 | Music-2.6 | 音乐 | 封面重生、低音重定义 |
| 2026-06-01 | M3 | 文本/多模态 | 最新 M 系列,agentic reasoning、tool use、coding、多模态聊天、长上下文 |
| 2026-07-16 | Music-3.0 | 音乐 | 新一代音乐生成能力 |
| 2026-07-31 | MiniMax H3 | 视频/多模态 | 新一代多模态生成模型,开源,全球下载 2400 万+,衍生 300+ 模型 |
团队
闫俊杰
产品
AI 原生应用(C端产品)
- MiniMax(原海螺AI):聚焦文本理解和生成,提供长文对话、搜索及内容创作等功能。
- 海螺视频(Hailuo AI Video):主打视频生成能力,可根据文字或图片描述自动生成高质量视频故事。
- 星野:国内领先的AI虚拟伴侣与智能体(Agent)应用,支持用户定制原创角色或分身夥伴。
- Talkie:星野的海外版本,是主打全球市场的AI虚拟人物聊天和社交应用。
- MiniMax Audio / Music:提供语音合成、音乐创作、音色设计等音频处理功
【2026-06-01】M3
目标
- 解决更复杂的 Agent 任务
【2026-06-01】MiniMax M3:前沿 Coding 能力,1M上下文,原生多模态,一个模型全给你
MiniMax M3 在编程和智能体等专业任务上达到了前沿的能力。用了全新注意力架构 MSA (MiniMax Sparse Attention ),最高支持 1M 超长上下文。
一个原生多模态模型,支持图片和视频的输入,并能操作电脑桌面。
MSA
复杂Agent任务最大挑战就包括 context scaling。要实现真正的改变,必须从最底层的注意力机制入手,避开全注意力机制计算复杂度平方级增长的“先天缺陷”。
MSA 是简洁且易于扩展的全新稀疏注意力架构,给 M3 带来了 1M 的上下文窗口,并让 context 真正成为又一个可被 scale 的维度。
稀疏注意力机制普遍通过增加初筛阶段来避免复杂度爆炸问题。
与 DSA 和 MoBA 等方案相比,MSA 可以更精确为 KV 分块,实现更高的有效上下文覆盖。
同时,还在算子层直接优化,采用以 KV 块为外层来聚合命中 query 的 KV outer gather Q。每块只读一次、访存连续,在 M3 的 head 配比下计算访存比显著优于通行方法,比开源的 Flash-Sparse-Attention、flash-moba 快 4 倍以上。
100 万上下文下,M3 每 token 计算量仅为上代模型的 1/20。
- prefilling 阶段,我们实现了超过 9 倍的加速倍率
- decoding 阶段有超过 15 倍的加速优势。
而且在多个对照实验中,MSA 的绝大部分能力与全注意力打平。

H3
【2026-7-31】H3 实时视频生成模型
通用全模态生成系统:
- 输入是文本、图像、参考视频、参考音频的任意组合;
- 输出是最高 2K 分辨率、最长 15 秒、带原生立体声音频的视频。
通用多模态生成模型 H3 统一理解跨文本、图像、视频和音频的上下文,生成带原生立体声的视频,最高支持 2K 分辨率、时长可达 15 秒,在指令遵循、文字与品牌标识的准确渲染,以及视频到视频(V2V)的运动迁移方面表现出色,面向广告、品牌、电商、产品设计、UI/UX、游戏等场景。
核心特色概述:
- 全模态上下文理解:文本、图像、视频、音频统一编码,进入同一个 Transformer;
- 原生音视频联合生成:视频和音频不是后拼接的,而是在模型内部同时预测;
- 上下文内 2K 重新生成:不是传统超分,而是把低分辨率结果和原始上下文一起重新喂给模型,让它重新画一遍 2K;
- 系统级分层设计:Context-IR 负责理解输入,Base 负责生成,Regenerate-2K 负责放大。
凭借 H3-VAE、H3-Omni Transformer、In-Context Regeneration 等技术,H3 在 2K 分辨率下每秒价格不到主流模型的三分之一,768p 下不到主流模型 720p 的一半。
模型结构
结构
- H3-Context-IR 多模态输入理解与上下文中间表示生成,未开源,提供 API
- H3-Base 基于上下文表示联合生成 768p 视频与立体声音频,已开源
- H3-Regenerate-2K 在原始上下文指导下重新生成 2K 视频,未开源

支付宝打赏
微信打赏