Qwen3.8-Omni-Flash 发布:多模态输入与百万上下文
阿里云上线 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入,最高提供 1M 上下文,可通过 Chat Completions 或 Responses 接入函数调用与联网检索,适合多媒体分析、会...
阿里云文档显示,Qwen3.8-Omni-Flash 已支持文本、图像、音频和视频输入,最高上下文达到 1M token。输出目前为文本,这意味着开发者可以把音视频内容转成可供后续文本管线处理的结构化结果。
模型可通过 Chat Completions 或 Responses 两种接口接入,并支持函数调用与联网检索。两种接口并行提供,可能降低已有系统的迁移成本,也让偏好 Responses 范式的团队不必改回旧接口。函数调用和联网检索适合构建代理类应用,但工具调用的延迟和结果可靠性仍需在实际场景中评估。
官方给出的典型用途包括多媒体分析、会议纪要、字幕生成和多模态代理流程。这类场景通常需要同时理解长视频、音频和文档内容,1M 上下文能容纳较长的多模态输入序列,减少切分带来的语义损失。
需要注意的是,该模型生成能力限定在文本,不能直接生成图像或音频。若产品需要多模态输出,仍需在文本结果之上接其他生成模型或模板管线。
目前文档未披露参数规模、训练数据、许可证、部署区域、定价、音视频长度限制等细节。在实际接入前,团队需要确认这些服务边界是否符合自己的业务约束。
