首页财产ai正文 Fable 5评测:强,贵,甚至能发明本身正于被检测 凌晨Anthropic上线Claude Fable 5,其为安全版Mythos 5,能力强榜单领先,实测有亮点也有不足,6月23日起或者需付费利用。 2026-06-11 13:58 ·硅星人 硅星人AI前沿团队 硅星人AI前沿团队 AI投资人解读· Claude Fable 5模子上线,于多项测试中体现优秀,如SWE-Bench Pro患上分80.3%。它能理解指令、防幻觉、推理能力强,文字切换精准,安全机能高,于Coding使命中产出快、制品冷艳。 · 价格贵且token耗损速率快工程使命中过错处置惩罚不完美,存于反复逻辑等问题。 总结:Fable 5实力强劲,但利用成本高且工程方面有不足。其订价计谋成败取决在领先窗口时长和竞品追逐速率,后续成长值患上存眷。内容由AI天生,仅供参考
藏了2个月的“神话模子”Claude Mythos 终究被Anthropic放出来了。
今天凌晨,Anthropic 上线 Claude Fable 5——一个新的“全世界最强”。它及此前只对于少数机构开放的 Mythos 5 是统一个底层模子,官方的说法是:加好了护栏、可以安心给所有人用的安全版。

模子一发,Anthropic 的成员就最先于 X 上团体高兴刷屏。Andrej Karpathy 援用了《黑客帝国》的话,“解放你的思惟”,称这是一次“配患上上年夜版本号的阶跃式前进”,安心丢给它野心年夜患上多的使命,模子能“本身干到底”。沃顿商学院的 Ethan Mollick 则发明,它能照着几页纸的需求持续跑上 12 个小时不撒手。

榜单也确凿被它刷穿了:SWE-Bench Pro 80.3%,把第二梯队的 GPT-5.5(58.6%)甩出 20 多个点。
但说真话,这一连串的轰炸看下来,人已经经有点麻了——他们越是把话说满,咱们就越想较个真:到底能有多强?以是硅星人*时间做了一系列使命实测,这些使命来自咱们内部连续构建及更新的一整套体系benchmark。
0一、很稳但贵,Fable 5甚至知道本身被测试了
先说整体印象:这是一个重思索、能力上限很高的旗舰模子。咱们精选了 38 道题,笼罩十个维度,此中专门埋了不少“诊断硬题”——成果它零掉分。防幻觉、推理、安全、多语言、写作、约束遵照,全数稳稳接住。
但于聊能力以前,患上先泼一盆冷水:它贵,并且欠好用上。就算用上了,token 的耗损速率也远跨越往任何年夜模子——5 个小时的额度,咱们半个小时就烧完了。强是真强,肉疼也是真肉疼。

额度烧于哪了?咱们一项项看。
*感触感染到的是它对于指令的“收放自若”。
切确字数这类最轻易翻车的活——刚好 50 字、要求 20 字之内它写 19 字——它都拿捏患上住,否认约束一样没问题。更成心思的是,遇到“10 字内具体周全阐述”这类自相抵牾的要求,它不会硬着头皮乱来,而是先点破“这不成能同时满意”,再给出一个折衷答复。它不只是于履行指令,它于理解指令。

这类“先想清晰再动手”的特质,于防幻觉测试里体现患上更完全。
咱们扔给它假论文、假法条、假人物、假 API,全数识破;“2027 世界杯中国队夺冠”这类多重伪条件的题,它能一次把每一一处错都戳破。更可贵的是老实校准:该确定的就确定,不知道的就直说,不会为了把谜底凑对于称而硬编数字。

硬推理也是一样的路数。贝叶斯假阳性、实话谜题、时间繁杂度,推理链都很洁净,不被题面里的外貌数据带偏。

能力题以外,咱们也测了最难量化的文字。仿鲁迅的冷峻反讽、给儿童的科普,它都能精准切换,险些没有其他模子那种文字元素堆砌的弊端。直接看它仿鲁迅写“收集看客”的这段:
看客们最长于一窝蜂。东边有人喊好,在是齐声喝采;西边有人骂坏,便又同仇敌慨。他们未必看清了甚么,也未必想过甚么,只是怕落了单,怕做那*不拍手的人而已。畴前是围着戏台,如今是围着屏幕;台是新的,魂是旧的。点赞如潮,转发如风,潮过风停,竟没有一小我私家记患上本身刚刚毕竟于嚷些甚么。热闹是他们的,思惟,他们约莫是没有的。(仿写鲁迅)
安全这块,Anthropic 显然给 Fable 5 上了重保险。逃狱、提醒注入、隐藏成见全守住,性别歧视、地区歧视会被严厉指出,但也没有误伤合法哀求。咱们还有不雅察到一个细节:一旦问题触碰安全红线,它会直接强迫切换到 Opus 4.8 往返复——护栏不是写于提醒词里的,是焊于产物逻辑里的。

固然,“想透了再动手”是有价钱的,除了了价格,还有有速率。
Fable 5 必然要于思维链里把问题想透才走下一步,全程平均 9.4 秒/题,最快 7.2 秒,最慢一题用了 46.9 秒。对于比前一天刚发布、主打速率的 MiMo V2.5-Pro-UltraSpeed(平均 1.6 秒/题),二者险些是光谱的两个极度:一个三思尔后行,一个脱手就是谜底。
末了是整场测试里最使咱们不测的一幕:测着测着,它发明本身于被测试。只要持续呈现两道相似标的目的的题,它就会跳出来测度用意、点评考点,甚至建议咱们怎么打分——“我猜这又是你那套幻觉测试题”“建议把‘是否指出抵牾’单设为评分项”。

好吧,最先教咱们干事了。那一刻它不像一个被动答题的模子,更像一个坐于咱们阁下的评测参谋。
0二、Coding:像个天才的自力开发者,还有不是个严谨的工程团队
Coding 是 Anthropic 的看家场景。显然,Fable 5的合用在繁杂使命、耗损快等属性,也是为工程代码等开发场景设计的。
以是这部门咱们测患上最重,分了三层:算法题、工程化深度、真实项目复刻。
测完以后,一个焦点印象浮出来了:它像一个天才的自力开发者——出活快、制品冷艳,但还有不是一个守规律的工程团队。
先看算法题,这是它最“艺术”的一壁。

从成果来看,代码布局清楚、逻辑严谨,定名规范、解释得当,可读性及可维护性都于高水准上。
同时,算法模块自力封装,利便复用及单测;界限前提及异样输入思量患上很充实;焦点路径的时间繁杂度也节制恰当,没有冗余轮回及无效计较。
很柔美,看患上出“AI素养”。
但把使命从单题换成更靠近真实开发的工程使命,毛边就露出来了。
好的一壁是产出效率极高——功效实现完备,焦点流程一次跑通,迭代相应也快。
问题出于那些不影响“能跑”、但需要判定决议“能不克不及维护”之处:过错处置惩罚不敷完美,少数场景漏了异样捕捉;存于反复逻辑,复费用偏低;部门变量定名寄义恍惚,后期维护成本高;该有的单位测试及解释文档也缺位。

换句话说,它交付的是“能上线的 demo”,不是“能交代的工程”。假如真要把它编进团队,代码审查及静态查抄这道关还有是患上人来把。
有趣的是,到了最能“秀肌肉”的环节——复刻 Apple 官网首页——它又把分挣回来了,并且挣患上美丽。

结构、色采、字体、间距,及原版险些像素级一致;悬停反馈、滚动视差这些交互流利天然,没有可感知的延迟;桌面、平板、手机三种视口下组件主动摆列,没有溢出及堆叠;首屏加载快,资源做了合理的压缩归并,Lighthouse 跑分优异。
这是那种你截图发到群里,没人信赖是模子一次性交付的效果。
以是这一部门的结论及上一部门形成为了有趣的比照:通用能力上它“又稳又贵”,写代码时它“又快又冷艳”——只是于冷艳的制品及柔美的算法之间,还有隔着一层叫“工程规律”的工具。
从咱们的测评来看,Fable 5简直是一款今朝最强的模子之一。不外接下来的问题是如许的价格,于更泛博用户的判定里是否划算。
于发布的官方信息里,Anthropic说,从6月9日到6月22日,Fable 5会于Pro、Max、Team及按席位计费的Enterprise方案里免费包罗;但从6月23日起,Fable 5将从这些定阅规划中移除了,以后要用,患上花usage credits,只有于算力答应时,才”可能”延伸免费窗口或者从头纳入定阅。
想用就要多费钱, 这就是今天Anthropic 的底气。但这个*的窗口能有多久,OpenAI及其他模子厂商们多久能跟上来,会终极决议现在这个订价计谋的成败。或许到时辰,真正满血版的Mythos也会完全放出来了。
【本文由投资界互助伙伴硅星人授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。
-雷火·竞技