AI 周报 Vol.14 | 前沿模型扎堆发布:Fable 5.1、Astra、Gemini 3.8 Flash、Muse Spark 1.3 三天连发
九月头三天,AI圈像是把所有攒了两个月的事一起办完了。
周二Anthropic发Claude Fable 5.1,AA Intelligence Index冲到66,第一次有模型过65。周三OpenAI预告的下一代Astra被外媒实锤——第一个达到”Critical”网络安全等级的模型,周四可能直接发布。Google同一天发了Gemini 3.8 Flash。Meta隔了不到24小时甩出Muse Spark 1.3,顺手把GPT-5.6踩了一脚。马斯克还在X上喊Grok 4.7十天后见。
我盯着这周的新闻流,手里的咖啡凉了两轮都没喝。不是我没空喝,是每条都得停下来看一眼到底什么意思。
这一期比Vol.13还密,我尽量挑跟开发直接相关的——纯融资八卦和监管口水战都跳过了。
Claude Fable 5.1:Anthropic把”安静期”打破了
九月一号Anthropic憋了两个月之后扔出来的第一个重量级更新。
数字直接摆:Artificial Analysis Intelligence Index上66分,是这个榜单历史上第一个过65的模型。Terminal-Bench-Science从上一代的24.7%翻到52.6%,专门测自主科研能力的基准。SWE-bench、Long-context这些常规项也都涨了,但科研这一项的提升是最反常的。
价格上,缓存读取砍了75%,典型任务成本降低约25%,最贵那种agentic长任务最多降45%。但要注意一个反直觉的数字:满负荷跑的时候,比上一代贵20%,因为模型一次会写接近两倍的文本。
安全过滤也改了。Fable 5时代用户最大的吐槽是”我让它写个爬虫,它说这是网络攻击”——Fable 5.1把这个问题修了60%,医疗和生物问题的误判砍了85%。模型能力没”放宽”,是过滤器学会了不冤枉正常问题。
Mythos 5.1同一个模型,只是安全权限放得更宽,目前只对审核过的美国网安和生物研究者开放。Anthropic说它在网络安全任务上”能力最强”,但具体能挖多深的洞没有独立测试公开数据,谨慎对待。
程序员的实际感受,我看到的反馈是中等努力模式就已经能打上一代全力模式。这意味着可以用更低成本跑大部分任务,不需要每次都开 max effort 那种烧钱模式。
OpenAI Astra:第一个被定为”Critical”的模型
这个事比Fable 5.1更炸。
OpenAI周二宣布Astra达到了他们自家《准备度框架》里的最高等级——Critical。这层定义具体是:模型能在没人一步步指挥的情况下,独立发现并利用真实世界软件里之前未知的漏洞。
Astra在ExploitBench上拿了100%。更吓人的是一组独立评估:研究人员用V8引擎最近披露的20个高危漏洞自己建了个测试集防止数据污染,Astra不仅找出了漏洞,还把它们串成了一条完整的攻击链路——其中包含两个零日漏洞。OpenAI说已经在披露给相关维护者。
还有两个更具体的测试。Astra能从一个HTML文件开始,突破浏览器沙箱直接对宿主机执行命令;它还能把加固操作系统里的多个漏洞串起来,做成一个从普通用户到root的提权链。
为了发这个模型,OpenAI做了一堆流程性的补救:暂停了两周前沿训练(不是全停,是带Agent的训练任务暂停),加了chain-of-thought监控,设计了一个”失配检测器”在模型干疑似未授权的事时自动叫停。
Net的效果是个奇怪的妥协:模型照样发,但最强的网安能力先给Daybreak Blue项目的合作方——Cisco、Cloudflare、Palo Alto Networks这种关键基础设施的守门人先拿到。普通用户拿到的是限速版。
代价是误伤。Astra的失配检测器经常会冤枉正常任务——做合法网安工作的人会被频繁打断;跑长时agent的开发者在看到一个普通代码改动时可能会被要求二次确认。OpenAI自己承认了这点,说会比之前繁琐。
这就给内容行业提了一个新问题:Astra是OpenAI第一个横跨”天数级”工作量的通用模型。一个能连续跑三天、跨多轮修改还不丢上下文的系统,怎么定价?按token计费的前提是”一次请求一次回答”,长时任务打破了这个前提。我猜2026年底API的计价单位会开始掺入”按任务”或者”按agent小时”。但这是猜测,等官方价格公布再验证。
Gemini 3.8 Flash:六周三更,Google不演了
Google发模型的节奏明显在加快。Flash系列从3.6到3.7到3.8,六周三次更新。
3.8 Flash主打长周期软件工程和自主Agent。在DeepSWE v1.1基准上,超过自家上一代,也超过大多数规模更大的前沿模型。Google自己当然挑了对自己有利的基准说事,但Chrome安全团队的测试里,3.8 Flash在漏洞修复上生成的正确补丁数量是更大规模商业模型的2.6倍——这个独立数据更值得看。
网络安全有个Gemini 3.8 Flash Cyber版本,主打漏洞发现和自动修复。Google同步启动Fairwind计划,650多家政府和关键基础设施机构拿优先通道。
值得注意的细节:Google原本计划9月3日的Gemini 3.5 Pro被延后了,原因是内部候选模型在编码能力上打不过3.8 Flash。这很有意思——Flash本来是中端定位,现在反杀了原计划的Pro,说明Google的新路线是”用Flash打天下”。
Meta Muse Spark 1.3:隔夜跟进,把价格打到十分之一
Google发完24小时之内,Meta就发Muse Spark 1.3。
首席AI官Alexandr Wang的表态很直白:编码能力”超过”GPT-5.6 Sol,”和Claude Fable 5.1旗鼓相当”。Artificial Analysis智能指数跑到65——只比Fable 5.1低一分,但是比GPT-5.6 Sol的63高。
最硬的是价格。每百万输出token 4.25美元,Fable 5.1的50美元的十分之一都不到。同一档能力,价格砍到Claude的零头。
技术细节:相比上一代Muse Spark 1.2,新模型用同任务少25%的token,工具调用次数少约20%。这不是靠模型更强,是靠架构优化——Meta做了一套让模型少做无用功的设计。
模型真的融合到了Instagram和Facebook——也就是接下来你在这些平台刷到的内容,可能就是Muse Spark生成的。Wang透露,已经有开发者周用量达到万亿级token,单客户的规模化速度超出预期。
Grok 4.7:马斯克的”超越所有”剧本
9月2日马斯克在X发推,Grok 4.7将在”约10天后”发布,预计9月12日。
参数从Grok 4.6的1.5万亿涨到2.1万亿,增长40%。马斯克说”除了服务速度略慢之外,各方面都优于Grok 4.6,且token效率更高”。还补充了一句”上线后将超越所有当前模型”。
更引人注意的是训练数据:xAI用了”大量SpaceX公司内部数据”做了补充训练。Musk的逻辑是,SpaceX的工程数据让Grok 4.7在”真实世界工程任务”上具有不可复制的优势。
参考Grok 4.6的AA智能指数61——介于GPT-5.6 Sol Max的61和Fable 5 Max的62之间,距离Fable 5.1的66有5分差距。Grok在GDPVal-AA v2(通用任务)上以1753分领先,但在Terminal-Bench v3.0(编程基准)上只有26%,比GPT-5.6 Sol Max的34.6%低不少。也就是说Grok的强项一直在通用任务,编程是短板。
Grok 4.7能不能补这个短板,等独立测试出来再判断。
讯飞星火X2.5:端侧第一个百万上下文
国内端侧模型这周有动静。
9月1日科大讯飞旗下词元星火开源了星火X2.5-4B和星火X2.5-1.7B两款端侧通用模型。业界首批原生支持100万token上下文的端侧模型——之前端侧最多32K。
混合注意力架构,在智能体、代码、数学、指令遵循四个核心能力上做优化。支持英伟达、华为、海光、后摩等多硬件平台,兼容vLLM、SGLang、llama.cpp等主流推理框架,可通过Ollama、LM Studio快速部署。
对端侧应用的意义是:以前40页的产品手册只能切片读,现在能一次灌进去。模型自己能跨章节找规则,而不是像之前那样问了后问就忘了前。
100万token上下文端侧化的下一步是把AI Agent放到手机、PC、汽车座舱、机器人这些本地设备上。断网能用、隐私不出本地——这个组合对企业用户来说才真的实用。
三层观察:前沿趋同、框架竞争、算力继续金融化
这一周把2026下半年的三条主线彻底坐实了。
第一是前沿模型能力趋同。Fable 5.1的66、Muse Spark 1.3的65、Astra的传闻数据(如果属实也是过65),加上即将发布的Grok 4.7——所有玩家挤在了同一个分数段。过去的”Claude比GPT强10分”这种差距没了,差距在缩小到1-3分以内。这意味着选模型的标准变了,从”谁更聪明”变成”谁更适配你的具体场景”,价格、上下文长度、API稳定性都比绝对分数重要。
第二是框架而不是模型在分胜负。Claude Code在Agent排行榜登顶的故事把这点讲透了:模型趋同,框架决定生死。同一模型跑在不同Agent里出来的代码质量、错误恢复能力、长任务稳定性可以差出一倍。开发者视角下,下半年更值得关注的是Claude Code、Codex CLI、Gemini CLI这些Agent框架本身,不是模型又刷了几个分。
第三是算力继续往金融化方向走。Fable 5.1的降价背后是Anthropic跟Volta那种百亿级别的算力deal在支撑。AWS、Azure、Google Cloud在给所有这些模型厂商充基础设施,本质是把”AI推理需求”打包成一个可以融到的资产。开发者实际感受到的是API价格在持续走低,但背后是行业的融资模型在玩越来越大的杠杆。
这一周就这些。如果你也在追这波新闻,最大的建议是:别追新模型的分数了,去看Agent框架实测。 下一个真正影响你日常开发的更新,大概率不是从某个模型官博来的,是从某个工具的release note里冒出来的。
文章合集:AI周报系列
封面图:Pollinations.ai flux 生成,1200x630