鹤啸九天 自律更自由,平凡不平庸 Less is More

Minimax 大模型

2026-09-01
阅读量

Notes(温馨提示):

  1. ★ 首次阅读建议浏览:导航指南, 或划到本页末尾, 或直接点击跳转, 查看全站导航图
  2. 右上角工具条搜索文章,右下角二维码关注微信公众号(鹤啸九天),底栏分享、赞赏、评论
  3. ★ 转载请注明文章来源,知识点积累起来不容易,水滴石穿,绳锯木断,谢谢理解
  4. ★ 如有疑问,邮件讨论,欢迎贡献优质资料


Minimax 大模型

Minimax 上海稀宇科技有限公司,总部位于上海市徐汇区模速空间的大模型人工智能公司。

总结

公司推出的产品 有MiniMaxM2.1、Hailuo2.3、Speech2.6和Music2.0等

全系列大模型

  • (1)LLM
    • MiniMax M3
    • MiniMax M2.7
    • MiniMax M2.5
  • (2)VIDEO
    • MiniMax H3
  • (3)SPEECH & MUSICSPEECH & MUSIC
    • MiniMax Speech 2.8
    • MiniMax Music 3.0

我先搜索 MiniMax 各模型的发布时间,确保时间线准确。按发布时间整理如下:

时间 模型 类别 核心特点
2022 abab 1–4 文本 早期多代语言模型,支撑 Glow 产品上线
2023-08 abab 5 文本 基础对话模型
2023 abab 5.5 文本 16,384 token 上下文
2023-11 Speech-01 语音 首款语音合成模型
2024-01 abab 6 文本(MoE) 万亿参数,对标 GPT-4
2024-04 abab 6.5 文本(MoE) 万亿参数,200K 上下文
2024-08-31 Hailuo-01(Video-01) 视频 首个视频生成模型
2024 Music-01 音乐 首款音乐生成模型
2025-01-15 MiniMax-01(Text-01 / VL-01) 文本/多模态 开源,线性注意力,4560亿参数/459亿激活,400万 Token 上下文
2025-02-11 Image-01 图像 文生图,支持多种尺寸
2025-02 T2V-01-Director / I2V-01-Director 视频 导演版视频生成
2025-04 Speech-02 语音 超拟人、个性化、多情感
2025-06-16 MiniMax-M1 文本(推理) 80K 思维链 × 1M 输入,开源 MoE,主打推理深度
2025-06 Hailuo 02 视频 第二代视频模型
2025-09-11 Music-1.5 音乐 音乐生成升级
2025-10-27 MiniMax-M2 文本(MoE) 230B 总参/10B 激活,编码与 Agent,MIT 协议,效果/价格/速度平衡
2025-10 Hailuo 2.3 视频 视频模型迭代
2025-Q4 M2.1 / M2-her 文本 M2 系列迭代(108 天完成 M2→M2.5 三代演进)
2026-02 M2.5 文本 生产力场景全球领先
2026-02 Music2.5+ 音乐 乐器解锁,突破风格边界
2026-03-18 M2.7 文本/Agent Agent 旗舰,首次实现模型自我进化,可承担 30%–50% 研发工作量
2026-04 Music-2.6 音乐 封面重生、低音重定义
2026-06-01 M3 文本/多模态 最新 M 系列,agentic reasoning、tool use、coding、多模态聊天、长上下文
2026-07-16 Music-3.0 音乐 新一代音乐生成能力
2026-07-31 MiniMax H3 视频/多模态 新一代多模态生成模型,开源,全球下载 2400 万+,衍生 300+ 模型

团队

闫俊杰

产品

AI 原生应用(C端产品)

  • MiniMax(原海螺AI):聚焦文本理解和生成,提供长文对话、搜索及内容创作等功能。
  • 海螺视频(Hailuo AI Video):主打视频生成能力,可根据文字或图片描述自动生成高质量视频故事。
  • 星野:国内领先的AI虚拟伴侣与智能体(Agent)应用,支持用户定制原创角色或分身夥伴。
  • Talkie:星野的海外版本,是主打全球市场的AI虚拟人物聊天和社交应用。
  • MiniMax Audio / Music:提供语音合成、音乐创作、音色设计等音频处理功

【2026-06-01】M3

目标

  • 解决更复杂的 Agent 任务

【2026-06-01】MiniMax M3:前沿 Coding 能力,1M上下文,原生多模态,一个模型全给你

MiniMax M3 在编程和智能体等专业任务上达到了前沿的能力。用了全新注意力架构 MSA (MiniMax Sparse Attention ),最高支持 1M 超长上下文。

一个原生多模态模型,支持图片和视频的输入,并能操作电脑桌面。

MSA

复杂Agent任务最大挑战就包括 context scaling。要实现真正的改变,必须从最底层的注意力机制入手,避开全注意力机制计算复杂度平方级增长的“先天缺陷”。

MSA 是简洁且易于扩展的全新稀疏注意力架构,给 M3 带来了 1M 的上下文窗口,并让 context 真正成为又一个可被 scale 的维度。

稀疏注意力机制普遍通过增加初筛阶段来避免复杂度爆炸问题。

与 DSA 和 MoBA 等方案相比,MSA 可以更精确为 KV 分块,实现更高的有效上下文覆盖。

同时,还在算子层直接优化,采用以 KV 块为外层来聚合命中 query 的 KV outer gather Q。每块只读一次、访存连续,在 M3 的 head 配比下计算访存比显著优于通行方法,比开源的 Flash-Sparse-Attention、flash-moba 快 4 倍以上。

100 万上下文下,M3 每 token 计算量仅为上代模型的 1/20。

  • prefilling 阶段,我们实现了超过 9 倍的加速倍率
  • decoding 阶段有超过 15 倍的加速优势。

而且在多个对照实验中,MSA 的绝大部分能力与全注意力打平。

H3

【2026-7-31】H3 实时视频生成模型

通用全模态生成系统:

  • 输入是文本、图像、参考视频、参考音频的任意组合;
  • 输出是最高 2K 分辨率、最长 15 秒、带原生立体声音频的视频。

通用多模态生成模型 H3 统一理解跨文本、图像、视频和音频的上下文,生成带原生立体声的视频,最高支持 2K 分辨率、时长可达 15 秒,在指令遵循、文字与品牌标识的准确渲染,以及视频到视频(V2V)的运动迁移方面表现出色,面向广告、品牌、电商、产品设计、UI/UX、游戏等场景。

核心特色概述:

  • 全模态上下文理解:文本、图像、视频、音频统一编码,进入同一个 Transformer;
  • 原生音视频联合生成:视频和音频不是后拼接的,而是在模型内部同时预测;
  • 上下文内 2K 重新生成:不是传统超分,而是把低分辨率结果和原始上下文一起重新喂给模型,让它重新画一遍 2K;
  • 系统级分层设计:Context-IR 负责理解输入,Base 负责生成,Regenerate-2K 负责放大。

凭借 H3-VAE、H3-Omni Transformer、In-Context Regeneration 等技术,H3 在 2K 分辨率下每秒价格不到主流模型的三分之一,768p 下不到主流模型 720p 的一半。

模型结构

结构

  • H3-Context-IR 多模态输入理解与上下文中间表示生成,未开源,提供 API
  • H3-Base 基于上下文表示联合生成 768p 视频与立体声音频,已开源
  • H3-Regenerate-2K 在原始上下文指导下重新生成 2K 视频,未开源

详见:MiniMax H3 解析(初版)

结束


支付宝打赏 微信打赏

~ 海内存知已,天涯若比邻 ~

Share

Similar Posts

Related Posts

标题:Graph Engineering 图工程

摘要:新兴概念,Graph Engineering

站内可视化导航

文章可视化导读:鼠标划过图形块时,如果出现蓝色光环, 点击即可跳转到对应主题

Comments

--disqus--

    My Moment ( 微信公众号 )
    欢迎关注鹤啸九天