多模态决策大模型迎来开源新突破!Cloudflare 正式发布 Clef-omni,全面支持音视频原生输入

   发布时间:2026-10-10 16:02 作者:CHINAZ

Cloudflare 近期正式发布了全新开放权重决策模型 Clef-omni。该模型在原有 Clef 系列的基础上实现了重大升级,不仅原生支持文本与图像,更首次新增了对音频和完整视频输入的直接处理能力。目前,其模型权重已在 Hugging Face 平台全面开源。

在技术实现与功能特性方面,Clef-omni 彻底改变了传统的处理链路。此前版本的 Clef 在面对视频输入时,往往需要先将视频按时间轴拆解为连续的静态图像再进行处理;而全新的 Clef-omni 则直接支持 wav、mp3、mp4和 webm 等主流音视频格式。这意味着开发者无需再单独搭建复杂的语音转写及音视频拆分管道,只需通过单次 API 调用即可实现文本、图像、音频和视频的统一处理。

从性能与基准测试表现来看,该模型基于 Qwen3-Omni-30B-A3B-Instruct 底座架构构建,完整保留了其核心理解能力。作为一款专注于结构化决策任务的专用模型,它不输出常规的冗长文本。在官方公布的实测数据中,纯文本请求的中位响应时间约为130毫秒,图像请求约为150毫秒;而处理一段带有声音、时长达21秒的视频,也仅需约1.5秒即可高效完成评分。

伴随着新模型的登场,Cloudflare 还对旗下其他产品线进行了价格调整与优化。其中,Clef-flash 的输入价格迎来了约58% 的大幅下调,从原本每百万输入 Token0.09美元降至0.038美元,托管版的上下文窗口则同步由64k 调整为24k。整体来看,随着 Clef-omni 的开源以及多模态处理能力的补齐,正为全球开发者构建复杂的智能工作流和自动化决策系统提供更高效、更具性价比的底层支撑。

 
 
更多>同类内容
全站最新
热门内容
 
智快科技微信账号
微信群

微信扫一扫
加微信拉群
电动汽车群
科技数码群