《AI HOT 速览:MiniMax M3、推理加速与企业 AI 基础设施》
AI HOT 汇总 MiniMax M3、推理加速、模型工具和行业动态,适合快速追踪 AI 产品与基础设施更新。
🧠 agentic reading|1️⃣ 精准输入
导语
这期 AI HOT 是一组 AI 产品、模型、基础设施和行业动态的密集快报。它的主线不是单个模型发布,而是 AI 应用层正在同时经历三件事:开源模型继续变强,推理与工具链快速提速,企业应用与资本市场开始围绕智能体基础设施重组。
1. 模型与推理:从 MiniMax M3 到高速编码模型
MiniMax 开源了 M3 模型权重:总参数 428B、激活参数 23B,并同步发布 MSA(MiniMax Sparse Attention)论文,用稀疏注意力降低长上下文计算成本。M3 的特殊性在于,它从预训练阶段就进行文本、图像等多模态交错混合训练。发布两周后,M3 在 Artificial Analysis 综合智能指数和 GDPval-AA 中获得开源模型第一,在 Code Arena WebDev 进入帕累托最优序列,并在 Vals.AI 榜单居国产模型首位。输出速度已从约 30 TPS 提升到约 80 TPS,计划再提升 30%-40%,Token Plan 后台也新增调用量看板。
Z Lab、Modal 与 SGLang 团队则发布 DFlash 投机解码模型和 SGLang 默认 Spec V2 引擎。DFlash 采用块扩散和 KV 注入并行生成 draft token,在 Qwen 3.5 397B-A17B(BF16)与 HumanEval 场景中,并发 1 时吞吐达到基线 4.3 倍。它说明推理优化正在从“换模型”进入“模型周边执行引擎”的竞争。
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。