2026年9月19日:阿里巴巴发布全模态大模型 Qwen3.8-Omni-Flash:主打原生音视频 Agent 能力与极致成本优势
【阿里巴巴千问 官方发布】 阿里巴巴 AI 团队正式发布首款围绕自主代理(Agent)能力构建的全模态大模型——Qwen3.8-Omni-Flash。该模型实现了原生音视频理解、逻辑推理与自动化工具调用的深层融合,可自主执行“理解内容—规划任务—调用工具—交付成果”的全流程工作流。
核心技术突破与应用场景
1、高效音视频协同与长流程自动化
具备强大的跨模态联合推理能力,能在长流程作业中精准协调外部工具,实现自动化 Vlog 视频剪辑、短视频多语种翻译,以及长篇电影摘要生成等复杂工作流。
2、具备 Agent 感知的 100 万 Token 长上下文
模型打破传统静态解读模式,支持对长视频进行主动探索与关键时刻定位。在 OmniVideoBench 测试中,其 Token 使用量较传统静态理解技术显著降低 51.8%,大幅提升长内容处理效率。
基准性能与商业化成本优势
1、基准性能大幅跃升
在音视频综合处理能力上直逼业界顶尖的 Gemini 3.8 Flash;在专注于 Agent 综合能力的 WildClawBench-MM 与 UniClawBench 基准测试中,平均性能大幅提升 19.5 分。
2、视频输入成本下挫约 89%
相较于前代 Qwen3.5-Omni-Plus,新模型的视频输入成本实现大幅降本,降幅达 89%,大幅降低了企业端部署长篇音视频理解与复杂 Agent 工作流的商业化门槛。
开源生态与开发者支持
为加速全模态 AI 应用的落地与生态构建,阿里巴巴同步开源了 Qwen-MM-Plugins(多模态插件生态)与 Qwen-Live Harness(实时互动测试框架),协助全球开发者与企业快速搭设基于 Omni 架构的商业级应用。
产业视角
Qwen3.8-Omni-Flash 的推出,标志着大模型竞争正从单纯的“多模态感知”加速迈入“自主执行与工具协同(Agentic Workflow)”的新阶段。通过近 90% 的成本压降与长视频 Token 消耗优化,该模型将为影视创作、跨国媒体翻译、音视频监控分析及自动化内容生成等垂直领域提供具备高投资回报率(ROI)的落地解决方案。