欢迎访问乐酷家

DeepSeek峰谷涨价折射行业痛点,曦望:急需推理算力原生架构

热点资讯 2026-07-05 uidhs168

近日 DeepSeek 官宣 V4 正式版将实施峰谷定价,国内工作日 9:00-12:00、14:00-18:00 核心工作时段 API 调用价格直接翻倍。这套对标水电的分时定价,平抑日间算力峰值看似是资源调配的市场化手段,却暴露出整个 AI 产业最尖锐的底层矛盾 —— 算力综合成本居高不下,已经成为制约 AI 规模化落地、中小开发者生存、产业普惠发展的最大枷锁。

短期分时调价只是缓解供需失衡的权宜之计,行业真正的破局方向,是从硬件、算法、服务、产业生态多维度系统性压降算力成本

一、峰谷涨价是 “治标方案”,根源是算力供给成本长期高企

一方面依靠芯片效率和架构改进,Token生产成本在快速下行,另一方面,大模型服务价格却在不断上涨。如此矛盾现象,激起行业热议。

国产GPU 芯片曦望Sunrise 在接受媒体采访时曾对这种现象做出解释,现在不是成本在定价,是供需在定价。需求涨得比成本降得更快:尤其 Agent 起来之后,一个任务烧的 Token 是过去的几十倍,需求是指数级的;而算力、电力、数据中心这些供给端是线性的、还得排队建。供给追不上需求的时候,定价权就从成本转到了供应手里。

DeepSeek的这套峰谷定价方案也侧面印证,智能体时代需要新的推理算力架构的紧迫性。”每瓦 Token 吞吐量”成为企业最关注的核心指标。谁能以最低成本持续生产最多高质量 Token,谁就能在竞争中占得先机。

二、算力成本高企,正在全方位阻碍 AI 产业普及

当前 AI 算力成本由多重刚性成本叠加形成, 推理算力负载、大模型高 Token 消耗、电力能耗、共同推高使用门槛,带来三重行业困境:

中小企业落地 AI 成本门槛过高 多数 SaaS、线下服务、小微企业没有自建算力集群能力,完全依赖公有 API。日间翻倍的调用成本,会让智能客服、文档处理、内容生成这类轻量化 AI 工具失去性价比,大量传统企业数字化转型意愿受挫,AI 只能停留在大厂、大型互联网企业,难以下沉千行百业。创新试错成本抬高,抑制技术迭代活力 模型微调、数据集测试、多版本功能验证都需要高频次批量调用,多数研发工作集中在日间办公时段。算力涨价后,独立开发者、高校科研团队、初创企业的试错预算大幅缩水,中小创新主体的研发空间被挤压,行业创新生态单一化。AI商业化陷入两难循环 一边是持续攀升的硬件与运维成本,长期低价会持续亏损,无力投入下一代模型、国产算力适配研发;另一边是贸然涨价流失用户,丢失市场份额。这种两难循环的根源,就是缺少规模化、可持续的算力降本路径,只能依靠价格调节需求被动续命。

长远来看,AI 产业的终极目标是通用智能普及,算力应当如同水电煤一样成为低成本普惠基础设施。单纯依靠分时涨价平衡收支,只是短期缓冲,唯有系统性降低算力综合成本,才能同时兼顾厂商盈利、企业落地、开发者创新三方需求。

三、多维发力系统性降本,才是行业长期最优解

解决算力成本难题,不能停留在需求端价格调控,必须从硬件底层、算法优化、精细化服务、产业协同四大维度同步推进,实现供给侧算力成本的实质性下降:

硬件端:打造推理时代的原生算力架构,优化算力能效,降低Token成本

智能体普及时代,对 GPU 要求与过去不同:更低延迟、更大长上下文承载、更低单位功耗,以及更高效的多模态并发处理能力。现有推理架构力不从心。作为国内第一家 All-in 推理的 GPU 芯片公司——曦望 认为,能扛住高频调用的低延迟、能支撑长上下文的稳定性、能持续下降的单位 Token 成本。这是评价Agent 时代推理架构的三个硬指标。但现有通用 GPU 无法同时满足这三大要求。市面上多数通用 GPU为“训推一体”, 面向训练优化,推理实际算力利用率往往远低于峰值。曦望认为,Agent 时代急需推理算力原生架构。曦望的做法是砍掉所有训练能力,重新设计芯片和系统,将节省出的晶体管与功耗预算集中投向推理。

算法端:模型轻量化、缓存与调度技术削减 Token 消耗

厂商可通过模型架构优化(MoE 混合专家、小参数量轻量化版本)、上下文缓存、量化压缩等技术,同等效果下大幅减少算力消耗。

服务端:改变旧有流量模式,按场景、按价值收费。

一些高价值任务,如编程、医疗、法律分析,用户追求高准确率和低延迟,这类服务对价格不敏感。另一些需求,例如聊天、摘要、创意草稿,用户极度价格敏感,对错误容忍度高。按照现有的Token流量收费的模式,无法体现不同服务的价值差别。曦望在接受媒体采访时曾讲述道,高价值任务的客户很愿意为“每一个 Token 跑得多便宜、多稳”付钱。这背后其实是对算力需求精细化的需求。曦望认为作为算力提供方,需要让不同质量的算力服务找到真正需要它的场景。

曦望对未来趋势的判断是,国内大模型很可能成为公共基础设施,Token 价格整体还是会持续变便宜。最终让算力实现普惠,就像手机流量一样,让原来跑不起的应用都能跑起来了。

产业端:构建算力共享、开源协同生态摊薄成本

推动算力共享平台、企业私有算力混合云模式,避免每家企业重复采购闲置 GPU;完善开源大模型生态,企业可本地部署开源模型减少 API 依赖;行业共建算力调度公共平台,统一调配跨厂商闲置算力,提升整体集群利用率,用规模化摊薄单位算力成本。

四、结语:分时调价是过渡,算力普惠才是产业终局

DeepSeek 高峰价格翻倍,是算力供需失衡下的阶段性商业选择,却清晰传递出行业信号:算力成本瓶颈已经制约产业发展速度。短期分时定价可以缓解厂商经营压力、改善服务稳定性,但无法解决算力昂贵的底层矛盾。

AI 产业想要健康长久发展,不能永远在 “低价内卷亏损” 和 “高峰涨价挤压用户” 之间摇摆。全行业需要形成共识,把系统性降低算力综合成本作为核心发展主线:研发原生架构以适合智能体时代的推理算力需求、算法技术优化降消耗、场景化商业服务、生态资源共享摊薄成本。

唯有算力成本持续下行,大模型才能真正走进中小企业、赋能千行百业,实现技术普惠与产业商业化双向共赢。

The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

Copyright © 2099 乐酷家 |中华人民共和国增值电信业务经营许可证号:苏B2-20221286

苏ICP备2022030477号-14 |——:合作/投稿联系微信:nvshen2168

|—— TXT地图 | 网站地图 |