DeepSeek峰谷涨价折射行业痛点,曦望:急需推理算力原生架构
近日 DeepSeek 官宣 V4 正式版将实施峰谷定价,国内工作日 9:00-12:00、14:00-18:00 核心工作时段 API 调用价格直接翻倍。这套对标水电的分时定价,平抑日间算力峰值看似是资源调配的市场化手段,却暴露出整个 AI 产业最尖锐的底层矛盾 —— 算力综合成本居高不下,已经成为制约 AI 规模化落地、中小开发者生存、产业普惠发展的最大枷锁。
短期分时调价只是缓解供需失衡的权宜之计,行业真正的破局方向,是从硬件、算法、服务、产业生态多维度系统性压降算力成本。
一、峰谷涨价是 “治标方案”,根源是算力供给成本长期高企
一方面依靠芯片效率和架构改进,Token生产成本在快速下行,另一方面,大模型服务价格却在不断上涨。如此矛盾现象,激起行业热议。
国产GPU 芯片曦望Sunrise 在接受媒体采访时曾对这种现象做出解释,现在不是成本在定价,是供需在定价。需求涨得比成本降得更快:尤其 Agent 起来之后,一个任务烧的 Token 是过去的几十倍,需求是指数级的;而算力、电力、数据中心这些供给端是线性的、还得排队建。供给追不上需求的时候,定价权就从成本转到了供应手里。
DeepSeek的这套峰谷定价方案也侧面印证,智能体时代需要新的推理算力架构的紧迫性。”每瓦 Token 吞吐量”成为企业最关注的核心指标。谁能以最低成本持续生产最多高质量 Token,谁就能在竞争中占得先机。
二、算力成本高企,正在全方位阻碍 AI 产业普及
当前 AI 算力成本由多重刚性成本叠加形成, 推理算力负载、大模型高 Token 消耗、电力能耗、共同推高使用门槛,带来三重行业困境:
中小企业落地 AI 成本门槛过高 多数 SaaS、线下服务、小微企业没有自建算力集群能力,完全依赖公有 API。日间翻倍的调用成本,会让智能客服、文档处理、内容生成这类轻量化 AI 工具失去性价比,大量传统企业数字化转型意愿受挫,AI 只能停留在大厂、大型互联网企业,难以下沉千行百业。创新试错成本抬高,抑制技术迭代活力 模型微调、数据集测试、多版本功能验证都需要高频次批量调用,多数研发工作集中在日间办公时段。算力涨价后,独立开发者、高校科研团队、初创企业的试错预算大幅缩水,中小创新主体的研发空间被挤压,行业创新生态单一化。AI商业化陷入两难循环 一边是持续攀升的硬件与运维成本,长期低价会持续亏损,无力投入下一代模型、国产算力适配研发;另一边是贸然涨价流失用户,丢失市场份额。这种两难循环的根源,就是缺少规模化、可持续的算力降本路径,只能依靠价格调节需求被动续命。
长远来看,AI 产业的终极目标是通用智能普及,算力应当如同水电煤一样成为低成本普惠基础设施。单纯依靠分时涨价平衡收支,只是短期缓冲,唯有系统性降低算力综合成本,才能同时兼顾厂商盈利、企业落地、开发者创新三方需求。
三、多维发力系统性降本,才是行业长期最优解
解决算力成本难题,不能停留在需求端价格调控,必须从硬件底层、算法优化、精细化服务、产业协同四大维度同步推进,实现供给侧算力成本的实质性下降:
硬件端:打造推理时代的原生算力架构,优化算力能效,降低Token成本
智能体普及时代,对 GPU 要求与过去不同:更低延迟、更大长上下文承载、更低单位功耗,以及更高效的多模态并发处理能力。现有推理架构力不从心。作为国内第一家 All-in 推理的 GPU 芯片公司——曦望 认为,能扛住高频调用的低延迟、能支撑长上下文的稳定性、能持续下降的单位 Token 成本。这是评价Agent 时代推理架构的三个硬指标。但现有通用 GPU 无法同时满足这三大要求。市面上多数通用 GPU为“训推一体”, 面向训练优化,推理实际算力利用率往往远低于峰值。曦望认为,Agent 时代急需推理算力原生架构。曦望的做法是砍掉所有训练能力,重新设计芯片和系统,将节省出的晶体管与功耗预算集中投向推理。
算法端:模型轻量化、缓存与调度技术削减 Token 消耗
厂商可通过模型架构优化(MoE 混合专家、小参数量轻量化版本)、上下文缓存、量化压缩等技术,同等效果下大幅减少算力消耗。
服务端:改变旧有流量模式,按场景、按价值收费。
一些高价值任务,如编程、医疗、法律分析,用户追求高准确率和低延迟,这类服务对价格不敏感。另一些需求,例如聊天、摘要、创意草稿,用户极度价格敏感,对错误容忍度高。按照现有的Token流量收费的模式,无法体现不同服务的价值差别。曦望在接受媒体采访时曾讲述道,高价值任务的客户很愿意为“每一个 Token 跑得多便宜、多稳”付钱。这背后其实是对算力需求精细化的需求。曦望认为,作为算力提供方,需要让不同质量的算力服务找到真正需要它的场景。
但曦望对未来趋势的判断是,国内大模型很可能成为公共基础设施,Token 价格整体还是会持续变便宜。最终让算力实现普惠,就像手机流量一样,让原来跑不起的应用都能跑起来了。
产业端:构建算力共享、开源协同生态摊薄成本
推动算力共享平台、企业私有算力混合云模式,避免每家企业重复采购闲置 GPU;完善开源大模型生态,企业可本地部署开源模型减少 API 依赖;行业共建算力调度公共平台,统一调配跨厂商闲置算力,提升整体集群利用率,用规模化摊薄单位算力成本。
四、结语:分时调价是过渡,算力普惠才是产业终局
DeepSeek 高峰价格翻倍,是算力供需失衡下的阶段性商业选择,却清晰传递出行业信号:算力成本瓶颈已经制约产业发展速度。短期分时定价可以缓解厂商经营压力、改善服务稳定性,但无法解决算力昂贵的底层矛盾。
AI 产业想要健康长久发展,不能永远在 “低价内卷亏损” 和 “高峰涨价挤压用户” 之间摇摆。全行业需要形成共识,把系统性降低算力综合成本作为核心发展主线:研发原生架构以适合智能体时代的推理算力需求、算法技术优化降消耗、场景化商业服务、生态资源共享摊薄成本。
唯有算力成本持续下行,大模型才能真正走进中小企业、赋能千行百业,实现技术普惠与产业商业化双向共赢。