欢迎访问乐酷家

多模态决策大模型迎来开源新突破!Cloudflare 正式发布 Clef-omni,全面支持音视频原生输入

金融科技 2026-10-11 uidhs168

Cloudflare 近期正式发布了全新开放权重决策模型 Clef-omni。该模型在原有 Clef 系列的基础上实现了重大升级,不仅原生支持文本与图像,更首次新增了对音频和完整视频输入的直接处理能力。目前,其模型权重已在 Hugging Face 平台全面开源。

在技术实现与功能特性方面,Clef-omni 彻底改变了传统的处理链路。此前版本的 Clef 在面对视频输入时,往往需要先将视频按时间轴拆解为连续的静态图像再进行处理;而全新的 Clef-omni 则直接支持 wav、mp3、mp4和 webm 等主流音视频格式。这意味着开发者无需再单独搭建复杂的语音转写及音视频拆分管道,只需通过单次 API 调用即可实现文本、图像、音频和视频的统一处理。

从性能与基准测试表现来看,该模型基于 Qwen3-Omni-30B-A3B-Instruct 底座架构构建,完整保留了其核心理解能力。作为一款专注于结构化决策任务的专用模型,它不输出常规的冗长文本。在官方公布的实测数据中,纯文本请求的中位响应时间约为130毫秒,图像请求约为150毫秒;而处理一段带有声音、时长达21秒的视频,也仅需约1.5秒即可高效完成评分。

伴随着新模型的登场,Cloudflare 还对旗下其他产品线进行了价格调整与优化。其中,Clef-flash 的输入价格迎来了约58% 的大幅下调,从原本每百万输入 Token0.09美元降至0.038美元,托管版的上下文窗口则同步由64k 调整为24k。整体来看,随着 Clef-omni 的开源以及多模态处理能力的补齐,正为全球开发者构建复杂的智能工作流和自动化决策系统提供更高效、更具性价比的底层支撑。

(来源:ITBear)
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

Copyright © 2099 乐酷家 |中华人民共和国增值电信业务经营许可证号:苏B2-20221286

苏ICP备2022030477号-14 |——:合作/投稿联系微信:nvshen2168

|—— TXT地图 | 网站地图 |