AWS OpenAI 模型评测|从每 Token 价格转向每个正确结果的真实成本
开源基准把准确率、重试、Agent 轮次与交付物质量纳入成本;官方同时要求在自己的任务和区域重跑。
本文核心看点
AWS 于 9 月 11 日发布一套开源评测方法,比较 Amazon Bedrock 上的 GPT‑5.6 Luna、Terra、Sol 与 OpenAI API 上的 GPT‑5.4 mini、nano。它不只看每百万 Token 价格,而是测量每个正确答案、通过的多轮研究结果和合格专业交付物的成本。文章公开了样本量、评分器、配置与局限,并强调 Bedrock 模型关闭推理、API 基线使用默认设置,因此结果不是模型固有能力排名。团队应在自己的 50 至 100 个任务上重跑,并同时核算失败、返工、轮次与延迟。
直接回答
AWS 于 9 月 11 日发布一套开源评测方法,比较 Amazon Bedrock 上的 GPT‑5.6 Luna、Terra、Sol 与 OpenAI API 上的 GPT‑5.4 mini、nano。它不只看每百万 Token 价格,而是测量每个正确答案、通过的多轮研究结果和合格专业交付物的成本。文章公开了样本量、评分器、配置与局限,并强调 Bedrock 模型关闭推理、API 基线使用默认设置,因此结果不是模型固有能力排名。团队应在自己的 50 至 100 个任务上重跑,并同时核算失败、返工、轮次与延迟。
事实来源
AWS 的开源 harness 通过同一 Responses API 客户端比较五个模型,覆盖单次准确率、多轮网页研究轨迹和按评分标准验收的专业交付物。
文章说明样本量为 48 至 198 项;Bedrock 上的 GPT‑5.6 模型关闭推理,而 OpenAI API 基线使用默认设置,因此比较反映实际配置而非固有能力。
方法把全部成功与失败尝试的支出除以成功数,并记录 Agent 轮次、累积输入 Token、延迟、评分提示哈希和带时间戳的结果文件。
核心变化
- 成本单位从 Token 单价转为满足质量门槛的结果
- Agent 轮次和重复发送的上下文进入总账
- 失败尝试、审核和返工不再被排除在模型选择之外
- 模型、区域、价格与评测配置被固化为可复现实验
对普通 AI 用户的影响
同一个 Token 单价可能对应完全不同的成功率和轮次,因此低价模型未必带来最低业务成本。该方法也提醒团队,不应把供应商样本中的小差距当作确定结论:任务分布、推理设置、区域延迟、价格时点和评分器都会改变排名。采购或迁移前应先定义什么算成功,再用真实失败和人工返工计算完整成本。
给团队的操作清单
- 选取 50 至 100 个有标准答案或明确评分标准的真实任务,并冻结数据集与通过门槛。
- 对每个候选记录模型快照、供应端、区域、推理设置、价格时点、最大输出和工具版本。
- 同时计算成功率、每个成功结果成本、Agent 轮次、尾延迟、人工审核与返工时间。
- 保存原始响应、评分依据和失败类别,在价格、模型或任务分布变化后按同一协议重跑。
AI 前沿资讯与趋势解读、AI 软件应用与模型工具、AI 技能教程与验证方法、AI 账号服务与权限说明
FAQ
为什么每 Token 价格不足以选模型?
因为错误率、输出长度和 Agent 轮次会放大总成本;生产工作购买的是合格结果,而不是孤立的 Token。
这篇 AWS 评测能直接决定所有团队的模型选择吗?
不能。作者明确要求在自己的任务上重跑,并披露样本量、配置差异和时点限制。
不同平台的结果是否等同于模型固有能力比较?
不是。文章说明 Bedrock 模型关闭推理、API 基线使用默认设置,结果反映被测试的实际部署配置。
总结
真正可执行的模型成本评测先定义合格结果,再把失败、轮次、延迟与返工全部记账;供应商基准提供方法和起点,最终选择必须由自己的任务证据决定。
本文由 AI 辅助撰写;发布前由 ENHE AI 自动化审计核对官方来源、双语字段、图片权利、页面安全与历史去重。
这对普通用户意味着什么?
同一个 Token 单价可能对应完全不同的成功率和轮次,因此低价模型未必带来最低业务成本。该方法也提醒团队,不应把供应商样本中的小差距当作确定结论:任务分布、推理设置、区域延迟、价格时点和评分器都会改变排名。采购或迁移前应先定义什么算成功,再用真实失败和人工返工计算完整成本。
你可能会用到这些工具
相关教程
相关工具/教程
你可以从下面的 ENHE AI 栏目继续把资讯信号转成工具选择、账号服务判断或实操学习路径。
相关阅读
OpenAI Agents API 公测|把 Codex 运行 Harness 与托管沙箱交给 API
OpenAI 于 9 月 10 日发布 Agents API public beta,把支撑 Codex 的运行 harness 和基础设施开放给开发者。一次 API 调用可定义任务、模型、工具和环境,并可选择 OpenAI 托管沙箱、自有基础设施或生态合作方环境或集成。官方说明 API 支持 MCP、函数、网页搜索、上下文自动压缩和多 Agent 并行;目前向所有开发者开放,按模型 token 与工具使用计费,正式上线前仍会快速迭代。
语音 Agent 上线验收清单|VAD、噪声、打断、转写、工具与失败交接逐项测试
语音 Agent 的上线验收不能只测一段安静环境中的成功对话。应把语音活动检测的开始和结束阈值、背景噪声与静音、用户中途打断、转写证据与更正、工具调用前后的播报、超时和失败后的状态恢复逐项纳入用例。OpenAI Realtime API 参考文档提供实时会话、音频输入输出、转写和服务端语音活动检测等接口能力;本文将其整理为通用验收清单,不代表某个产品版本的发布说明或性能保证。
AWS 将 AgentCore 评测接入 GitHub Actions:AI Agent 回归开始成为合并前质量门禁
AWS 于 9 月 8 日发布将 Amazon Bedrock AgentCore Evaluations 接入 GitHub Actions 的参考流程。该流水线在开发环境部署代理与受 OAuth 保护的 MCP 服务,运行代表性提示词,读取 OpenTelemetry 轨迹并按正确性、目标达成和工具选择等维度评分;低于阈值时阻断 PR。文章同时给出存量轨迹、测试用户和机器身份三种认证思路。团队采用前应验证角色边界、样本覆盖、评分稳定性、费用与失败回滚。
OpenAI 称“自动化研究实习生”目标已达成:研究提速仍保留人工决策边界
OpenAI 于 9 月 6 日公开内部研究自动化进展,称已达到去年设定的“自动化研究实习生”目标。研究人员更频繁地并行使用编码代理,提交代码和运行实验的速度提高;但官方同时强调,人仍负责确定优先级、判断结果以及决定扩展、暂停或部署,安全与对齐能力必须同步增长。
OpenAI 推出 Daybreak 前线防御计划,拟投入 10 亿美元降低关键行业 AI 防御门槛
OpenAI 于 9 月 3 日公布 Daybreak for Frontline Defenders,计划投入 10 亿美元,为资源有限的网络防御团队提供访问补贴、培训、技术支持和伙伴计划。优先覆盖供水、电力、地方政府、社区银行、非营利组织及开源维护者,支持遗留代码审查、可疑活动分析、漏洞发现和修复验证。公告还介绍了与 MS-ISAC 的公共部门和供水系统试点,以及由企业产品和合作服务组成的 Defense Network。它传递的信号是:前沿模型的安全价值不只在模型本身,也在授权、监控和持续运
OpenAI为前沿模型保留零数据留存:Private Safety Processing进入预览
OpenAI于2026年8月19日宣布,为符合资格的API客户继续提供零数据留存,并预览Private Safety Processing。该方案尝试在不让OpenAI人员读取底层提示词与回复的前提下,跨相关交互识别风险模式。客户内容可留在客户控制的基础设施中,未来也计划支持由客户密钥加密的OpenAI托管存储。普通API团队应先确认自身项目是否获批ZDR、哪些数据仍受法定义务或审计日志规则影响,再决定敏感工作流是否上线。


