OpenAI 部署 GPT-5.6 优化模型自身推理性能,端到端服务成本最多降低 20%
最新 7 月 30 日消息,OpenAI 公司昨日(7 月 29 日)发布博文,宣布通过 GPT-5.6 Sol 模型,来优化 GPT-5.6 系列模型本身 AI 推理链路,端到端服务成本最多降低 20%。
OpenAI 于 7 月 9 日推出其最强 AI 模型 GPT-5.6 系列,在后续的架构优化过程中,官方团队利用 GPT-5.6 Sol 模型来优化自身运行效率,降低计算成本、提高 GPU 利用效率。
OpenAI 公司称,系统会按地域、可用容量和加速器类型分配请求;集群内部还会参考负载、上下文长度、缓存可用性等因素分发任务。GPT‑5.6 Sol 通过 Codex 分析生产流量、识别负载失衡来源、测试路由策略并调整启发式规则。
在模型前向传播环节,GPT‑5.6 Sol 识别可预计算、可避免或可并行的工作,并通过 Codex 自主改写和优化生产环境中的 GPU 内核。最新附上相关截图如下:

团队让 GPT-5.6 Sol 模型学习 Triton 和 Gluon 两种编程语言,让模型据此优化推理引擎内核,使生产环境 GPU 内核带来的端到端服务成本最多降低 20%。

OpenAI 还使用开源工具 FpSan(浮点数清理器)验证 GPT‑5.6 Sol 编写内核的正确性。
OpenAI 还让 GPT-5.6 Sol 优化推测性解码(speculative decoding)。这项推理加速技术由较小的草稿模型预测下一个 token,再由主模型验证或修正预测结果。OpenAI 在 2026 年 7 月 29 日的公开帖文中称,改进后 token 生成效率提升超过 15%。
《OpenAI 部署 GPT-5.6 优化模型自身推理性能,端到端服务成本最多降低 20%》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
OpenAI 计划向 10 万名科学家免费开放 GPT-5.6 系列 AI 模型等资源
OpenAI 今天(7 月 30 日)在 X 平台发布推文,宣布启动 ChatGPT for Academic Researchers 计划,将会向 10 万名科研人员免费开放 ChatGPT 高级功能。... -
分析师:航司采取动态 AI 定价,廉价机票捡漏机会或越来越少
达美、维珍等航司正加速引入 AI 定价技术,实时分析数十项因素调整票价,旨在最大化每趟航班收入。此举可能导致热门航线低价座位减少,但淡季或非热门航线票价可能更便宜。AI 定价究竟是让乘客受益还是承担更高成本,目前尚无定论。... -
Meta 扎克伯格:五年后,全球数十亿人将有专属的个人 AI 智能体
扎克伯格在财报电话会议上大胆预测:“无论把时间范围设定为五年还是其他期限,我都认为,未来没有数十亿人使用个人智能体的可能性极低。个人智能体能够理解你的目标,全天候为你工作,帮助你在任何看重的领域实现目标。”... -
谷歌推出 Lyria 3.5 音乐生成 AI 模型:提升旋律编排、人声表现更细腻
谷歌昨日(7 月 29 日)发布博文,宣布正在 Google Flow Music 中推出 Lyria 3.5 音乐生成 AI 模型,提升音乐性、歌词和人声质量等,让用户创作出更丰富的音乐作品。... -
OpenAI 总裁布罗克曼承认新 ChatGPT AI 桌面应用“有点乱”,目标打造“零标签”
昨日(7 月 29 日)接受《华尔街日报》科技专栏作家乔安娜 · 斯特恩(Joanna Stern)采访时,OpenAI 联合创始人兼总裁格雷格 · 布罗克曼(Greg Brockman)承认新版 ChatGPT 桌面版“有点乱”。...












