GPT-6 Astra 极速版上线,推理提速八倍
OpenAI 刚放出的 GPT-6 Astra Ultrafast 已经在 API 和 ChatGPT Work、Codex 里开放了,跑在英伟达 Blackwell 上。官方给的说法是最多比标准模式快 8 倍的 token 生成速度,这个数字放在聊天场景里感知有限,但放到 agent 工作流里就是另一回事了。
我自己做 coding agent 最头疼的就是 edit-test-debug 这个循环,模型每写一段代码就要调工具、跑测试、看结果再决定下一步,中间每次往返都在等 token。生成速度翻几倍之后,整个循环的体感会明显不一样,尤其是那些需要连续几十次工具调用的任务。这次提速主要靠 OpenAI 针对 Blackwell 架构做的推理优化,不是简单堆卡。OpenAI 的推理负责人 Philippe Tillet 提到,英伟达在工具链和文档上的投入让他们能把模型调得特别擅长给 Blackwell 和 Rubin 写高性能 kernel。这句话其实挺关键,说明模型和硬件之间已经形成了互相优化的飞轮。对开发者来说,值得关注的点有几个:
- 响应速度提升直接缩短 agent 的工具调用间隔,交互类应用会更跟手
- 快的不只是单次生成,而是整个工作流里反复出现的等待被压缩
- 目前 Ultrafast 只在 API 和部分 ChatGPT 计划里可用,成本还没看到明确说法我的判断是,推理速度正在从「体验优化」变成「能力边界」。当 agent 可以在一分钟内完成过去要十分钟的迭代,很多以前因为太慢而不成立的产品形态就变得可行了。接下来要看的是价格能不能跟上,以及 Rubin 架构落地后这套优化还能再榨出多少空间。
我自己做 coding agent 最头疼的就是 edit-test-debug 这个循环,模型每写一段代码就要调工具、跑测试、看结果再决定下一步,中间每次往返都在等 token。生成速度翻几倍之后,整个循环的体感会明显不一样,尤其是那些需要连续几十次工具调用的任务。这次提速主要靠 OpenAI 针对 Blackwell 架构做的推理优化,不是简单堆卡。OpenAI 的推理负责人 Philippe Tillet 提到,英伟达在工具链和文档上的投入让他们能把模型调得特别擅长给 Blackwell 和 Rubin 写高性能 kernel。这句话其实挺关键,说明模型和硬件之间已经形成了互相优化的飞轮。对开发者来说,值得关注的点有几个:
- 响应速度提升直接缩短 agent 的工具调用间隔,交互类应用会更跟手
- 快的不只是单次生成,而是整个工作流里反复出现的等待被压缩
- 目前 Ultrafast 只在 API 和部分 ChatGPT 计划里可用,成本还没看到明确说法我的判断是,推理速度正在从「体验优化」变成「能力边界」。当 agent 可以在一分钟内完成过去要十分钟的迭代,很多以前因为太慢而不成立的产品形态就变得可行了。接下来要看的是价格能不能跟上,以及 Rubin 架构落地后这套优化还能再榨出多少空间。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼