核心事件速递
阿里通义团队于今日正式推出新一代原生全模态大模型 Qwen3.8-Omni-Flash。该版本在定位上发生明显转变:从前代强调的‘理解全模态内容’,转向‘规划任务、调用工具并完成创作’的端到端执行能力。核心硬信息如下:
- 发布时间:2026年9月18日
- 新版本号:Qwen3.8-Omni-Flash
- 模型特性:原生全模态(支持文本、图像、音频、视频等多模态输入)
- 核心能力升级:强化任务规划(Task Planning)、工具调用(Tool Use)及创作生成
- API定价:每小时音频输入价格显著下调(对比上一代Qwen3.5-Omni-Plus)
- 可用性:已在阿里云开放接口
- 权重开放:未提及模型权重是否开源,暂不可私有化部署
定位转变:从“耳聪目明”到“办事得力”
本次发布的slogan——“耳聪目明,办事得力”,精准点明了版本演进逻辑。此前 Omni 模型强调“耳聪目明”,即高效解析多模态信号;而“办事得力”成为此次主线:模型不仅看懂听懂,更要能规划多步骤任务流程、自主调用外部工具,并输出可执行的创作成果。
这一转向与行业趋势高度一致:大模型从能力展示迈入生产力验证阶段。通义团队在产品设计中着重点出工具调用链路的完整性,暗示其在办公自动化、智能配送调度、代码辅助生成等需要“动作闭环”的场景中寻求落地突破口。
关键参数对比
与上一代 Qwen3.5-Omni-Plus 相比,Qwen3.8-Omni-Flash 在定价上释放强烈信号。
| 模型版本 | 音频输入定价(每小时) | 核心能力侧重 |
|---|---|---|
| Qwen3.5-Omni-Plus | 未公开 | 全模态内容理解与生成 |
| Qwen3.8-Omni-Flash | 大幅下调 | 任务规划 + 工具调用 + 创作完成 |
值得注意的是,尽管slogan提及“耳聪目明”,但本次涨价信息仅针对音频输入,图像与视频输入的计价方式未在摘要中披露,价格调整方向明确,但幅度与结构尚不透明。这为潜在使用者预埋了成本评估空间。
落地建议
适合立即尝试的用户:
- 已构建工具调用框架(如自定义API、RPA插件、代码执行环境)的企业开发者,可测试模型在复杂工作流中的任务分解与执行协调能力;
- 对多模态内容做智能摘要、报告自动生成的团队,可评估新版在“理解→规划→生成”链路中的延迟与一致性表现。
建议再观望的用户:
- 对模型推理速度、长期调用稳定性有严苛要求的生产系统,建议等待社区实测反馈及性能Benchmark;
- 预算敏感的中小团队,应等待官方提供具体定价明细后再决策——当前仅知“下调”,未公布精确数值。
写在最后
Omni模型的进化已进入第二阶段:理解不再是终点,交付完整动作闭环才是价值检验标准。当“能干活”取代“能看懂”成为卖点,大模型正从技术奇观回归工具理性。
写在最后:通义此次押注“干活”能力,或将重塑企业级Agent的评估标尺——未来模型选型,将更看重组件集成度而非单一能力峰值。
