DeepSeek新Flash把KV缓存砍到1/4
刚看到DeepSeek-V4.1-Flash上线API,第一反应是这波打的不是参数牌,而是成本牌。552B的MoE,但输入只激活8B、输出16B,非对称架构把「想得多」和「算得省」拆开做,benchmark还压过了自家旗舰V4-Pro。对做agent的人来说,真正扎心的是KV cache:HBM只要上一代的1/4,SSD存储1/8。缓存命中费一直是agent账单里最不透明的一块,长上下文多轮调用堆起来,很多时候比推理本身还贵。这次压缩直接砍在这条成本线上,等于把「能不能跑得起」的问题往前推了一大步。
我的判断是,这更像一次面向应用层的降维:模型能力追平旗舰,但把部署和调用成本打下来,中小团队做多模态agent的门槛会明显降低。原生视觉理解加上API直接切deepseek-flash就能用,迁移成本几乎为零,老的V4-Flash和V4-Flash-Vision-Exp已经退役,兼容路由只是过渡。接下来值得盯的是实际吞吐和缓存命中率在真实负载下能不能兑现宣传数字,毕竟benchmark好看和账单好看是两回事。如果兑现了,国内做agent的成本结构可能要重新算一遍。
我的判断是,这更像一次面向应用层的降维:模型能力追平旗舰,但把部署和调用成本打下来,中小团队做多模态agent的门槛会明显降低。原生视觉理解加上API直接切deepseek-flash就能用,迁移成本几乎为零,老的V4-Flash和V4-Flash-Vision-Exp已经退役,兼容路由只是过渡。接下来值得盯的是实际吞吐和缓存命中率在真实负载下能不能兑现宣传数字,毕竟benchmark好看和账单好看是两回事。如果兑现了,国内做agent的成本结构可能要重新算一遍。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼