Claude Opus 5 发布比 Fable 5 强仅一半价格原创 尹John 尹John AGI Hunt2026年7月25日 02:45北京刚刚Claude Opus 5 终于发布了Opus 5 发布我 Claude 里的默认模型也已经悄悄换成了 Opus 5default opus 5官方给它的定位是“ Opus 5 是一个周到且主动的模型以一半的价格提供接近 Fable 5 的前沿智能。措辞上说的是「接近」但从跑分表看就会发现其实在大多数项目上Opus 5 已经把 Fable 5 反超了。01半价前沿API 定价是每百万token 输入 5 美元、输出 25 美元和上一代 Opus 4.8 完全一致但只有 Fable 510 / 50 美元的一半。我们知道Fable 5 是 A 社 6 月 9 日发布的最强公开模型也是史上最贵的通用模型同一底座的 Mythos 5 则只向 Project Glasswing 的少数合作伙伴开放。所以这次的 Opus 5 就是一个半价的新模型多数跑分反而压过了自家最贵的旗舰……可用性上所有付费套餐和 Claude API 今天直接可用模型 ID 是claude-opus-5。Claude Max 的默认模型已经切了过去Pro 用户能用到的最强模型也是它。上下文窗口是1M token另外还提供一个 Fast 模式速度约为默认的 2.5 倍价格也翻倍……。02反超 Fable 5先看官方给的这张总表十几个项目里Opus 5 拿下了绝大多数Opus 5 基准总表Agentic 终端编码Frontier-Bench v0.1拿到43.3%Fable 5 是 33.7%Opus 4.8 只有 21.1%一代直接翻了一倍还多。知识工作GDPval-AA v21861同样压过 Fable 5 的 1747。Agentic 搜索BrowseComp90.8%电脑操作OSWorld 2.070.6%业务流程AutomationBench26.0%全都是第一。SWE-bench Verified 也刷到了96.0%。不过在 DeepSWE 上 GPT-5.6 Sol 仍以 72.7% 领先法律和健康两项还是 Fable 5 和 Mythos 5 更强无工具版的 Humanitys Last Exam 上Fable 5 也还以 56.5% 对 56.3% 守住了一丝的领先。而且这表里还有个小乌龙是FrontierCode 一项Opus 5 的 53.4% 被涂成了领先的高亮色可旁边 Fable 5 明明是 53.5%……这图不会是让 Opus 5 自己做的吧0330.2% 的 ARC-AGI-3ARC-AGI-3 的成绩方面ARC-AGI-3 成本对比要知道该基准测的是模型解决从没见过的新题的能力靠背题是刷不上去的。Opus 5 拿到了30.2%而第二名 GPT-5.6 Sol 只有 7.8%Opus 4.8 更是只有 1.5%。04更省 tokenAnthropic 这次反复强调的另一个点是效率在相近甚至更低的单任务成本下跑赢其他模型。Frontier-Bench 成本曲线几组官方数据如下• Frontier-Bench 上成绩是 Opus 4.8 的两倍多单任务成本反而更低• CursorBench 3.2 上开最高 Effort 档时距离 Fable 5 的峰值成绩不到 0.5%单任务成本只有一半• OSWorld 2.0 上只用 Fable 5 三分之一出头的成本就超过了后者的最佳成绩• AutomationBench 上相同成本下任务通过率约是第二名的 1.5 倍哪怕开最低 Effort 档完成的任务也比其他所有模型都多注Effort 是可调节的思考强度档位档位越高模型想得越多也越贵OSWorld 成本曲线Anthropic 官方人员 Alex Albert 表示团队在跨领域的 token 效率上投入了大量工作而他自己在很多编码任务上已经更愿意用 Opus 5 而不是 Fable 5 了。AutomationBench 成本曲线研究员 Nathan Lambert 的解读则是这是更快的迭代速度加上规模化 RL 的产物Fable 5 那个体量目前反而还没办法好好做 RL。HLE 成本曲线05Medium 档的怪曲线这里还有个好玩的细节是Opus 5 在 FrontierCode 上的最好成绩出现在 medium 档53.4%继续往上加思考强度分数反而掉到了 48.0% 和 43.6%……FrontierCode 各档位曲线想得多反而错得多可以理解为用力过猛的意思。06三个案例官方博客里还给了几个例子。第一个给 Opus 5 一张机械零件图纸要求它写代码在 FreeCAD 里重建三维模型但故意不让它直接「看」图。它自己写了一套计算机视觉流程从原始像素里提取几何形状再把整个零件还原了出来而且能反复成功。同样配置下其他模型试了五次都没能搞定。不让看图就自己修条路第二个是一个开源包管理器的真实 Bug社区补丁漏了一个边界情况Opus 5 找到了根因并把缺口补上对照模型则只修了表面症状然后便宣布 Bug 已解决……这个场景你可能并不陌生贴胶布还是拧阀门第三个来自一家交易公司的工程师用 Opus 5 在一个会话里完成了新交易所的行情数据接入。因为找不到实时数据做验证它便自己搭了一套测试框架来检查解析结果对不对。没有陪练就自己造一个除了案例官方还放出了两个 Opus 5 直接做出来的交互 demo。一个是风洞模拟可以实时调整风速、旋转车身观察气流怎么绕过一辆或一个完全不符合空气动力学的物体风洞模拟 demo另一个是可交互的细胞图解每个细胞器都按实测尺寸绘制还能一层层切开来看细胞图解 demo这两个 demo 都在线可玩链接见文末。你可以自己上手感受一下。07最对齐的一版安全方面Opus 5 是 Anthropic 迄今对齐程度最高的模型。自动化行为审计里它的综合失准得分是2.30低于 Opus 4.8 的 2.85 和 Mythos 5 的 2.81Sonnet 5 是 3.35欺骗行为的比例也是全家最低。行为审计得分对用户更实际的一点是安全分类器的拦截会大幅减少。官方基于测试给出的预期是比 Fable 5少拦大约 85%。也就是说你不会莫名其妙地降级到 Opus 4.8 了。Anthropic 这次也刻意没用网络攻防任务去训练 Opus 5但随着通用能力上来它找漏洞的水平已经逼近 Mythos 579.4% 对 80.0%只在把漏洞变成可用攻击代码这一步两者还差得很远。漏洞识别与利用对比所以护栏方面也终于允许在源代码里找漏洞、修漏洞拦截二进制层面的扫描、渗透和 Exploit 生成了。而生物领域则反过来有所放宽原本在 Fable 5 上会被拦的生物类请求现在会转给 Opus 5 处理。Opus 5 是目前面向科研场景最强的公开模型有机化学任务比 Opus 4.8 高出 10.2 个百分点蛋白质相关任务则高出 7.7 个百分点不过在长时间自主研究任务上仍有明显限制。08感谢 K3最后我们应该感谢 Kimi K3Fable 终于不再是奢侈品了。◇ ◆ ◇官方发布页https://www.anthropic.com/news/claude-opus-5官方推文https://x.com/claudeai/status/2080699495453528290风洞 demohttps://assets.claude.ai/brand/artifacts/blog/opus/5-aeolus-demo.html细胞 demohttps://assets.claude.ai/brand/artifacts/blog/opus/5-sectio-demo.htmlAGI Hunt 链接https://agihunt.info/e/19f95175f79a3cc644ee936404e
Claude Opus 5 发布,比 Fable 5 强,仅一半价格
Claude Opus 5 发布比 Fable 5 强仅一半价格原创 尹John 尹John AGI Hunt2026年7月25日 02:45北京刚刚Claude Opus 5 终于发布了Opus 5 发布我 Claude 里的默认模型也已经悄悄换成了 Opus 5default opus 5官方给它的定位是“ Opus 5 是一个周到且主动的模型以一半的价格提供接近 Fable 5 的前沿智能。措辞上说的是「接近」但从跑分表看就会发现其实在大多数项目上Opus 5 已经把 Fable 5 反超了。01半价前沿API 定价是每百万token 输入 5 美元、输出 25 美元和上一代 Opus 4.8 完全一致但只有 Fable 510 / 50 美元的一半。我们知道Fable 5 是 A 社 6 月 9 日发布的最强公开模型也是史上最贵的通用模型同一底座的 Mythos 5 则只向 Project Glasswing 的少数合作伙伴开放。所以这次的 Opus 5 就是一个半价的新模型多数跑分反而压过了自家最贵的旗舰……可用性上所有付费套餐和 Claude API 今天直接可用模型 ID 是claude-opus-5。Claude Max 的默认模型已经切了过去Pro 用户能用到的最强模型也是它。上下文窗口是1M token另外还提供一个 Fast 模式速度约为默认的 2.5 倍价格也翻倍……。02反超 Fable 5先看官方给的这张总表十几个项目里Opus 5 拿下了绝大多数Opus 5 基准总表Agentic 终端编码Frontier-Bench v0.1拿到43.3%Fable 5 是 33.7%Opus 4.8 只有 21.1%一代直接翻了一倍还多。知识工作GDPval-AA v21861同样压过 Fable 5 的 1747。Agentic 搜索BrowseComp90.8%电脑操作OSWorld 2.070.6%业务流程AutomationBench26.0%全都是第一。SWE-bench Verified 也刷到了96.0%。不过在 DeepSWE 上 GPT-5.6 Sol 仍以 72.7% 领先法律和健康两项还是 Fable 5 和 Mythos 5 更强无工具版的 Humanitys Last Exam 上Fable 5 也还以 56.5% 对 56.3% 守住了一丝的领先。而且这表里还有个小乌龙是FrontierCode 一项Opus 5 的 53.4% 被涂成了领先的高亮色可旁边 Fable 5 明明是 53.5%……这图不会是让 Opus 5 自己做的吧0330.2% 的 ARC-AGI-3ARC-AGI-3 的成绩方面ARC-AGI-3 成本对比要知道该基准测的是模型解决从没见过的新题的能力靠背题是刷不上去的。Opus 5 拿到了30.2%而第二名 GPT-5.6 Sol 只有 7.8%Opus 4.8 更是只有 1.5%。04更省 tokenAnthropic 这次反复强调的另一个点是效率在相近甚至更低的单任务成本下跑赢其他模型。Frontier-Bench 成本曲线几组官方数据如下• Frontier-Bench 上成绩是 Opus 4.8 的两倍多单任务成本反而更低• CursorBench 3.2 上开最高 Effort 档时距离 Fable 5 的峰值成绩不到 0.5%单任务成本只有一半• OSWorld 2.0 上只用 Fable 5 三分之一出头的成本就超过了后者的最佳成绩• AutomationBench 上相同成本下任务通过率约是第二名的 1.5 倍哪怕开最低 Effort 档完成的任务也比其他所有模型都多注Effort 是可调节的思考强度档位档位越高模型想得越多也越贵OSWorld 成本曲线Anthropic 官方人员 Alex Albert 表示团队在跨领域的 token 效率上投入了大量工作而他自己在很多编码任务上已经更愿意用 Opus 5 而不是 Fable 5 了。AutomationBench 成本曲线研究员 Nathan Lambert 的解读则是这是更快的迭代速度加上规模化 RL 的产物Fable 5 那个体量目前反而还没办法好好做 RL。HLE 成本曲线05Medium 档的怪曲线这里还有个好玩的细节是Opus 5 在 FrontierCode 上的最好成绩出现在 medium 档53.4%继续往上加思考强度分数反而掉到了 48.0% 和 43.6%……FrontierCode 各档位曲线想得多反而错得多可以理解为用力过猛的意思。06三个案例官方博客里还给了几个例子。第一个给 Opus 5 一张机械零件图纸要求它写代码在 FreeCAD 里重建三维模型但故意不让它直接「看」图。它自己写了一套计算机视觉流程从原始像素里提取几何形状再把整个零件还原了出来而且能反复成功。同样配置下其他模型试了五次都没能搞定。不让看图就自己修条路第二个是一个开源包管理器的真实 Bug社区补丁漏了一个边界情况Opus 5 找到了根因并把缺口补上对照模型则只修了表面症状然后便宣布 Bug 已解决……这个场景你可能并不陌生贴胶布还是拧阀门第三个来自一家交易公司的工程师用 Opus 5 在一个会话里完成了新交易所的行情数据接入。因为找不到实时数据做验证它便自己搭了一套测试框架来检查解析结果对不对。没有陪练就自己造一个除了案例官方还放出了两个 Opus 5 直接做出来的交互 demo。一个是风洞模拟可以实时调整风速、旋转车身观察气流怎么绕过一辆或一个完全不符合空气动力学的物体风洞模拟 demo另一个是可交互的细胞图解每个细胞器都按实测尺寸绘制还能一层层切开来看细胞图解 demo这两个 demo 都在线可玩链接见文末。你可以自己上手感受一下。07最对齐的一版安全方面Opus 5 是 Anthropic 迄今对齐程度最高的模型。自动化行为审计里它的综合失准得分是2.30低于 Opus 4.8 的 2.85 和 Mythos 5 的 2.81Sonnet 5 是 3.35欺骗行为的比例也是全家最低。行为审计得分对用户更实际的一点是安全分类器的拦截会大幅减少。官方基于测试给出的预期是比 Fable 5少拦大约 85%。也就是说你不会莫名其妙地降级到 Opus 4.8 了。Anthropic 这次也刻意没用网络攻防任务去训练 Opus 5但随着通用能力上来它找漏洞的水平已经逼近 Mythos 579.4% 对 80.0%只在把漏洞变成可用攻击代码这一步两者还差得很远。漏洞识别与利用对比所以护栏方面也终于允许在源代码里找漏洞、修漏洞拦截二进制层面的扫描、渗透和 Exploit 生成了。而生物领域则反过来有所放宽原本在 Fable 5 上会被拦的生物类请求现在会转给 Opus 5 处理。Opus 5 是目前面向科研场景最强的公开模型有机化学任务比 Opus 4.8 高出 10.2 个百分点蛋白质相关任务则高出 7.7 个百分点不过在长时间自主研究任务上仍有明显限制。08感谢 K3最后我们应该感谢 Kimi K3Fable 终于不再是奢侈品了。◇ ◆ ◇官方发布页https://www.anthropic.com/news/claude-opus-5官方推文https://x.com/claudeai/status/2080699495453528290风洞 demohttps://assets.claude.ai/brand/artifacts/blog/opus/5-aeolus-demo.html细胞 demohttps://assets.claude.ai/brand/artifacts/blog/opus/5-sectio-demo.htmlAGI Hunt 链接https://agihunt.info/e/19f95175f79a3cc644ee936404e