Clef-omni 支持音视频的多模态决策模型
Cloudflare 推出 Clef-omni,首次在开放权重决策模型中支持文本、图像、音频与视频统一输入,并输出 schema 约束的评分结果;同步下调 Clef-flash 价格并优化 Workers AI 推...
Clef-omni 是 Cloudflare 发布的开放权重多模态决策模型,明确支持音视频输入,可在单次调用中联合处理文本、图像、音频与视频四种模态。其输出为受 JSON Schema 约束的结构化评分,直接对应预定义选项,适用于自动化分类与动作判断类工程任务。
该模型设计面向工作流集成,统一输入接口降低多源数据预处理复杂度,结构化输出则省去后解析步骤,便于嵌入 CI/CD、内容审核或边缘路由等确定性流程。
配套的 Clef-flash 服务同步降价,Workers AI 平台也对 Clef 系列模型推理进行了底层优化。二者叠加有望降低边缘侧轻量决策节点的部署成本与响应延迟。
需注意:托管服务(如 Flash)的上下文长度限制变更,与模型自身多模态能力属于不同维度,工程落地时应分别评估和解耦。
目前未公开 Clef-omni 是否支持流式音视频输入,亦未披露权重格式、量化方案及具体许可证类型,实际接入前需确认适配细节。