《AI HOT 0624:单卡视频生成、智能体工具与招聘评估争议》
本期 AI HOT 汇总多模态模型、智能体工具、企业动作和招聘评估争议,适合快速追踪 AI 产品与治理的当天变化。
🧠 agentic reading|1️⃣ 精准输入
导语
这一期 AI HOT 是当天 AI 技术、产品、开源生态、企业动作和治理风险的汇编。它的主线不是某一个模型发布,而是 AI 正同时向三个方向推进:多模态生成变得更快更可部署,智能体和开发工具进入生产力场景,评估、招聘和开源合规暴露新的治理问题。
1. 多模态生成和交互模型继续提速
1.1 视频、语音和音频生成
- Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏方案训练。它在单张 NVIDIA GeForce RTX 5090 上,端到端生成 5 秒 480P 视频只需 1.8 秒,并已开源模型、代码和博客。
- 网易有道推出“子曰 4.0”语音合成引擎 Confucius4-TTS,声称支持 14 种语言跨语种无口音语音克隆,且无需参考文本。用户只需 3 秒音频即可完成零样本音色克隆,音色相似度超过 85%,任务准确度达到 97%;模型采用语义大模型、SSL 预训练特征、ECAPA-TDNN 说话人编码器和 Flow Matching 框架,并以 Apache 协议开源 54GB 本地部署资源包。
- 火山引擎发布豆包音频生成模型 1.0,支持文本和音频参考生成目标音频。单条提示词可编排多角色对白、情绪语气、背景音乐和环境氛围,支持 0 样本多模态输入、一声多角、音色与风格解耦控制,一次可生成 2 分钟音频,并在多次延长中保持音色统一。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。