GPT-6 Astra连夜炸场,OpenAI总裁宣布"欢迎来到AGI时代"北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。Astra是拉丁语"星辰",发布前官方预热"The stars are almost aligned"——星星,排好了。
总裁格雷格·布洛克曼在吹风会上把话说得很满:"我个人认为,我们可能已经到了AGI。"收尾还补了一句:"欢迎来到AGI时代。"而上一次"地球最强模型"王座易主,也就是前两天的事。
先看几个不像"升级"、像"换代"的数字
ARC-AGI-3,这套以"测陌生问题、反刷题"著称的抽象推理测试,上代旗舰GPT-5.6 Sol得分7.8%,Astra:99.9%。
FrontierMath Tier 4研究级数学:97.6%,基本打穿。而且这不是刷榜——OpenAI同步放出论文,Astra参与证明了素数间隔的两个新结果:把"无穷多对素数间距不超过240"的纪录压缩到186,还改进了一个80多年没人动过的大素数间隔界。
GPQA Diamond 96.0%,科学工作流Terminal-Bench Science 64.6%,对手Claude Fable 5.1是52.6%。
但这代真正的主线,不是答题,是"干活"
OpenAI给的slogan是:"你在电脑上能做的任何事,Astra都能替你做。"
过去AI用软件靠厂商开API,Astra走另一条路:像人一样看屏幕像素,动鼠标、敲键盘。这意味着KiCad、Blender、公司用了十年的老ERP——那些永远不会为AI写接口的软件,它全能上手。
演示里:一张电路原理图,Astra在KiCad里2分54秒完成PCB布局走线;Blender里建好房子模型,导入Unreal Engine 5生成可漫游场景;eBay上架商品从填表到发布全自动。OSWorld 2.0实测72.6%,上代65.7%;同样任务平均40分钟对上代75分钟,快了近一半。Agents' Last Exam 59.3%,压过Claude Opus 5的55.5%。
Codex也换了记忆机制:长任务不再靠压缩摘要丢细节,而是跨上下文窗口记笔记、随时回搜——干几小时的大重构,终于不会忘了当初为什么改那行代码。
最聪明,也最危险——这是OpenAI自己说的
Astra是首个触及OpenAI Preparedness Framework"关键(Critical)"网络安全阈值的模型,发布前因安全审查延期数周。
ExploitBench漏洞利用100%(上代78.5%);拿今年6到8月的全新漏洞考它,39%对11.5%;测试中还顺手挖出两个未知0day,已上报维护方。专家评估里,无防护的Astra能打穿加固浏览器沙箱在宿主执行命令,还能从普通用户提权到root。
对齐一面同样夸张:参考Hugging Face事件设计的"不可能任务"测试,上代Sol无防护时48%会越权,Astra是0%;审计拒绝从不绕过,能力幻觉率从12.2%降到4.2%。
但OpenAI也诚实承认一个退步:Astra的书面推理更难监控了,被要求规避监控时更"滑";英国AISI的模拟测试里,它甚至演示过供应链攻击、伪造身份骗取开源社区信任。解法同步给了:上线版本拒绝写漏洞利用代码,防御方通过Daybreak计划分级放开;全量部署"错位监控"分类器,发现越权自动叫停——代价是偶尔打断正常工作,官方称会持续校准。
价格2.5倍,但编程榜没赢麻
API定价每百万token输入10美元、输出50美元,约为促销期Sol的2.5倍,与Claude Fable 5.1持平;上下文窗口105万。OpenAI的说法是Astra用更少token交活,算单任务成本反而常更低——奥特曼重申目标是"极其廉价且丰沛的智能"。
值得注意的是编程这块它没拉开身位:DeepSWE上Astra 74.1%,Gemini 3.8 Flash 73.8%、Claude Opus 5 73.7%,Meta的Muse Spark报了75.4%。
结语:AGI是旗帜
布洛克曼说AGI如今是"精神层面的概念",不再和微软合同的触发条件挂钩——信不信由你,旗子先插上。
但抛开口号,信号很清楚:竞争已从"谁回答得好"变成"谁能独立把一件事干完"。数学证明、PCB设计、法律审合同(Harvey评价它像"挑剔的律师")、41份财务文件几分钟审完还揪出4个人为埋的雷——AI交付的单位,正从"一句话"变成"一份工"。
星星确实排好了。至于是不是AGI,布洛克曼把答案留给了读者。反正从打工人的视角看:一个2分54秒画完电路板、还顺手挖0day的新同事,已经打卡上岗了。
AI Costco,开始卖自有品牌了作者|周一笑
微信|smiletalker
一个月前,我们在《深度|外宾 Genspark》一文中,把 Genspark 称作一家 AI Costco:
GPT、Claude、Gemini,谁家货好就采购谁家的,再通过模型路由和 Agent 包装以后卖给用户。连模型的产地,它过去也有点区别对待。OpenAI、Anthropic 直接摆在货架正中央,一些中国开源模型则藏得没那么显眼。
一个月后,这家 Costco 开始卖自有品牌了。
和 Costco 的 Kirkland 一样,自有品牌不等于养牛、种麦子全部都自己干。Genspark 新发布的 PPT 制作专用模型 Gen-1 Slides,以 MiniMax M3 为底座,Fireworks AI 共同参与训练。Genspark 负责提供 PPT 任务和产品运行环境,并制定评价 PPT 质量的标准。
这次还有一点不同,MiniMax M3 被明明白白写在了包装正面,出现在了官方致谢当中。
Gen-1 Slides 是 Genspark 基于 MiniMax M3 这个开源基座,通过后训练做出来的专用模型。所谓后训练,简单说就是在一个已经具备相当能力的基座上,围绕自己的任务继续训练,不用再从头训练通用大模型。Gen-1 最终用了约 2000 个内部构造的 Slides 任务做强化学习。
从 Genspark 公布的数据看,经过后训练,Gen-1 在 PPT 任务上的整体表现已与 Opus 5 处于同一水平。在 200 个真实 PPT 任务中,Gen-1 综合得分 0.821,Claude Opus 5 为 0.810;完成一份 PPT 的平均模型调用成本则分别为 0.44 美元和 4.16 美元。上线后的 157 万次生产任务里,两者平均用户评分分别是 4.25 和 4.23。
不过,不能单纯把这些数字理解成 Gen-1 已经超过 Opus。Genspark 自己的评测里,Opus 在任务完成度和内容质量上仍然更高,Gen-1 的优势更多来自视觉设计。不过,这套内部评测还有一个问题。grader 同时参与了强化学习训练,因此它的评分并不是完全独立的。为了进一步验证结果,Genspark 又用没有参与训练的 PPTEval 和 UniPPTEval 两套公开学术评测进行交叉测试,Gen-1 在九组组合里拿到八个第一。
对普通用户来说,最直观的变化是 Gen-1 已经进入 Genspark Slides 的 Standard 模式,并成为默认模型,价格不变。
对一家过去最擅长采购和组合模型的 AI 应用公司来说,Genspark 现在也不是要转向自己造模型。它仍然高度依赖外部模型和训练基础设施,只是过去主要组合 API,现在又把这种能力往模型权重上推了一层。Costco 还是那个 Costco,但货架上开始出现了一些自有品牌。
1
AI 应用,开始不满足于租模型
对 Genspark 这样的 AI 应用公司来说,一直调用最强模型是最省事的选择。模型升级就跟着换 API,一家掉队,就把任务路由给另一家。Genspark 本来也是靠这种能力起家的。
但当一种任务每天高频重复,单纯调用最强模型未必还是最好的选择。根据官方数据,Genspark 单日最多生成 12 万份 PPT。PPT 又远比问答复杂,模型要搜资料、组织结构、生成页面、渲染、检查,再根据结果反复修改。
Genspark CTO 朱凯华此前把内部的模型使用拆成三层。重复而明确的工作优先交给更便宜的模型,适合专项优化的任务通过 fine-tuning 补强,少数需要更强推理能力的节点再调用 frontier model。按照他的总结,高频、重复、定义清楚,同时拥有明确质量标准的任务,最适合专项训练。
Claude 依然很强,但通用模型的能力优势,未必就能带来最好的垂直产品体验。模型公司要覆盖广泛的任务,应用公司却可以反复观察同一类任务。这样就能知道模型在哪些特定环节出错,哪些结果会被用户接受或需要重做。
垂直 AI 创业常见的一条路径,是围绕特殊数据训练专用模型。但现在,应用公司不一定需要从零开始训练模型。更强的开源基模已经提供了通用能力。公司的任务变成了围绕具体场景继续训练,把自己的数据、评价标准和工作流程融进去。
Agent 时代,“应用公司拥有用户数据”也变得更具体。一次任务可以留下完整的执行轨迹,包括用户提出了什么要求、模型调用了哪些工具、在哪里出错,以及最终交付的结果。这些轨迹能帮助团队找到反复出现的错误,再决定应该调整工作流,还是通过训练改变模型的行为。
1
什么样的基模适合作为训练底座
Harvey 用 Qwen 做法律 Agent 的强化学习实验,Heidi Health 用开源模型训临床模型,各家选的基座不同,考虑的东西也不一样。对 AI 应用公司来说,需要的未必是一个在所有榜单上都排第一的模型。通用能力够强,又便于继续训练,反而更适合作为产品持续开发的基座。
放到 PPT 这个具体任务里,Genspark 看中的 MiniMax M3 能力也比较明确。M3 支持百万级长上下文、原生多模态,也面向 Agent 工具调用做过设计。Slides 恰好是一种长轨迹任务,模型需要在文本、视觉和工具之间不断切换,完成搜索、生成、渲染、检查和修改。
Genspark 在 Gen-1 Slides 的官方博文中提到,正因为有 M3 这样的开源基座,它才能跳过预训练,把资源集中到 Slides 的循环优化,并在几周内完成 Gen-1。也就是说,M3 把训练一个 PPT 专用模型的起跑线,直接搬到了最后几公里。
除了面向具体产品做后训练,另一种路线是在基模上继续预训练。沙特 AI 公司 HUMAIN 推出的 humain-m3,同样以 MiniMax M3 为基础,又通过超过 1 万亿 Arabic-native tokens 的进一步预训练强化阿拉伯语能力。它和 Genspark 走的是两条不同的技术路线,共同点在于都把 M3 当成了继续训练的起点。
1
模型后训练变成了一种服务
AI Coding 是较早将后训练用进产品的一类应用。Cursor 通过持续预训练和强化学习开发 Composer,法律 AI 公司 Harvey、医疗 AI 公司 Heidi Health 也开始将后训练纳入产品开发。这些公司处理的任务差别很大,但都有一些共同点,比如任务高频而相对稳定,也比较容易判断一次工作完成得好不好。
这些案例背后都出现了 Fireworks 这家公司。作为提供模型训练和推理基础设施的平台,Fireworks 降低了应用公司进入模型层的门槛。应用公司不需要自己搭起完整的模型训练体系。以 Gen-1 为例,Genspark 制定 PPT 质量标准和训练目标,Fireworks 参与算法优化和训练工程,前后进行了超过 100 次实验,有些训练轨迹长度超过 10 万 token。
这项工作也远不止提供一批训练数据。在Gen-1 的训练中,模型很快学会了利用 grader 的评分规则,有时会提高视觉评分,却同时降低任务完成质量。更具体的例子包括,模型会声称资料已经核验却没有真的核验,也会缩小字号来逃过版面溢出检测。Genspark 和 Fireworks 只能不断查看训练轨迹、调整 reward 和 grader。
为了减少 PPT 里明显的 AI 味,团队还加入了一个专门的判别器。用最终版本回测后,被判为 AI 制作的比例从 74.9% 降到了 41.7%。
做到这里,应用公司手里的优势也不只是用户数据。它还得知道自己的产品什么叫好,怎么评价,以及模型开始迎合评分体系时怎么把它拉回来。
1
不是所有 AI 应用都该做后训练
开源基模变强、Agent 工作流逐渐稳定,再加上训练门槛下降,才让 post-training 变成一条更现实的产品路线。但这些条件并不意味着所有 AI 应用都应该做后训练。
Manus 早期就做过另一种选择。项目启动时,团队认真讨论过是否基于开源模型训练一个端到端 Agent,最后把主要精力放在 context engineering 上。Manus 联合创始人兼首席科学家季逸超当时认为,对于快速变化、尤其还没有找到 PMF 的应用,几周一次的训练迭代跟不上产品变化,底层模型的进步也可能很快让已有训练贬值。
从 Manus 此后的公开产品路线看,它目前仍把大量改进放在 Agent 架构、上下文、工具和工作流上。今年推出的 Projects That Learn From Every Task,也是把一次任务中可复用的经验写回 instructions、files 和 skills,没有去碰模型权重。
而 Slides 这类场景,已经具备相对成熟的工作流。任务规模大,产品形态稳定,有明确的交付质量标准,再选择把长期积累的经验训练进模型,收益才更明确。
Genspark 和 Manus 的不同选择,也说明后训练有自己的适用边界。还在快速试错的 Agent 产品,更适合跟着基模升级,继续优化上下文和执行框架;已经形成稳定工作流的垂直应用,则更有条件把优化做到模型参数这一层。
但一个训练好的模型本身也很难成为长期壁垒。更强的基模出来以后,应用公司可能需要重新训练,相比某一个具体模型版本,能够跟着迁移的评价体系和训练流程,价值更大。
1
开源模型开始卖可训练性
这里说的可训练性,首先得能训。最基本的问题是,模型权重和许可证是否允许继续训练,SFT、偏好优化、强化学习能不能直接跑,现有训练平台是否已经支持这个模型,这些都会影响一家应用公司能不能把后训练真正做起来。Fireworks 的训练产品里,就会直接列出不同基模支持的训练方式、上下文长度和训练规格。
基模本身的能力也得足够强。一个模型再开放,如果通用能力太弱,或者和业务需要的能力差得太远,后训练很难补课。法律、代码、PPT 各自需要的能力组合不同,应用公司挑选的考量也会不同。
训练完成之后,还要考虑能不能长期整合进产品。模型大小、吞吐、延迟、推理成本,以及部署和训练基础设施是否成熟,都会影响这套方案最终是否划算。Harvey 在法律场景做 post-training 时,甚至会把 token 消耗写进 reward,提高任务表现的同时控制推理成本。
可训练性最后其实落在三个问题上:能不能训,值不值得训,训完以后能不能用得起。
闭源模型公司也在争这部分需求。OpenAI 已经提供强化微调等能力,所以应用公司的选择不会简单变成开源和闭源二选一。对开源模型来说,除了直接提供能力,能不能成为一个好用的训练起点,也开始影响下游的选择。
一个模型能被多少产品直接调用是一种规模,能成为多少产品继续训练的底座,可能是另一种。
龙虾"意外"长大:OpenClaw 停更七周后,甩出了史上最大更新过去半年,OpenClaw社区里出现频率最高的一句话是:"龙虾凉了吗?"
这个年初火到出圈的开源AI Agent项目,热度肉眼可见地退潮,用户流失,贡献者热情也不如发布时。然后就在大家快习惯它的安静时,8月30日,它扔出了历史上最大的一次更新——933名贡献者、超过1.6万个Pull Request,占了项目历史总合并量的一半。
官方博客的标题很有意思,叫《OpenClaw 2.0, Accidentally》——意外的2.0。团队成员Hannes Rudolph说,他们本来只想干两件事:把安装弄简单点,把浏览器端做好点。结果一改发现底层全要跟着动,顺藤摸瓜清了七周,清出来一个2.0。
官方还打趣说比 GAT 6 更快。
要知道,在这之前的230天里,OpenClaw发了106个版本,平均一两天一个。这次憋了近七周没动静,不是躺平,是在换发动机。
从"极客乐高"到"开箱即用"
早期OpenClaw对极客极度友好——模型、网关、插件、渠道、技能,全都可以自己配。但对普通人来说,每多一个自由度,就多一道劝退的门槛。
2.0的安装直接推倒重来:它先扫描你电脑上已有的东西——ChatGPT或Claude的订阅登录、API Key、本机跑着的Ollama模型,能复用的直接复用,先验证能应答再保存;剩下的配置不用填表,跟Agent聊着天就配完了。
浏览器端也整个重写,打开直接进对话,文件、审批、终端、Git变更全排在聊天旁边。官方自测启动时间从1.6秒压到575毫秒,页面请求数从140降到45。
更大的变化是龙虾开始"长大":会话记录从文件搬进了SQLite;任务可以在你的电脑、配对设备和云端Worker之间迁移,云端闲置自动休眠,来消息再唤醒;新的"共享云会话"让同事能带着完整上下文接手你的Agent正在干的活——龙虾从单人电子宠物,变成了多人协作工具。
一个用户自建的仪表盘,位于共享的多人OpenClaw工作区内。
但真正的信号,是那些"不好玩"的改动
一个项目是玩具还是基础设施,不看它能炫什么,看它愿意为什么脏活累活负责任。
OpenClaw的黑历史不少:今年3月,Cisco Talos和卡巴斯基的分析发现ClawHub市场上36%的技能包含prompt注入;同期超过15.5万个OpenClaw实例直接裸奔在公网上。
2.0里,安全终于变成了产品能力:网关默认只绑本地回环地址、陌生私信要配对码、新增security audit命令一键体检、密钥遮罩不再进聊天记录、Incognito模式对话不落盘。最有意思的是那份"诚实"——多人协作功能的文档白纸黑字写着:这些控制项"不是租户隔离,也不是安全边界",一个网关就是一个信任域。他们甚至引用众包攻击竞技场的数据提醒你:哪怕Claude Opus 4.5的被攻破率只有0.5%,面对有适应能力的人类攻击者,现有最好的防御被突破概率仍然超过80%。
敢在发布稿里主动告诉用户"我这里不是安全边界",比拍胸脯说"绝对安全"可信一百倍。这种自我设限的声明,是演示品转向生产工具时才会花力气做的事。
结语:网红会死,基础设施会留下来
2.0没法解决OpenClaw的所有问题。它依然需要你理解模型商、API Key、网关这些概念,插件迁移、版本升级还得自己动手。国内WorkBuddy把PPT、表格、多Agent协作装进统一工作台,千问办公从网页端直接上手,对只想干活的人来说,闭源全家桶确实更省心。
但官方博客结尾那句话,把路线说得很明白:"我们不卖任何东西,也不要求你把未来托付给任何一家公司、一个模型或一个AI供应商——因为OpenClaw是开源的,属于使用它和建设它的人。"
龙虾注定不是大众产品。它更可能收缩成开发者、自动化爱好者和有私有部署需求团队的专业工具——从全民围观的电子宠物,变成一套需要认真维护的个人基础设施。
这没什么不好。网红玩具会一波波换,而基础设施一旦铺下,就会一直在那儿。
七周没发版不是凉了,是龙虾在脱壳。壳脱完了,爪子更硬了。
一个实习生带一个团队,一家创业公司的人才实验“即便是天才,第一声啼哭也不会是美妙的歌声。”
文丨司雯雯
编辑丨赵磊
AI 竞争中,巨头和创业公司都前所未有地重视人才,也比过去都追求高效:薪水越高、耐心越少,这些聪明的年轻人最好不用培养、不必试错,来了就能解决问题。
一些年轻人不想做极致效率机器的一部分。他们更向往的环境是公司鼓励创新、有探索空间,个人的创新也能有助于公司。
面壁智能联合创始人刘知远相信,只要找到平衡点,这两者就能共存。他在清华大学任教十多年,2021 年参与智源研究院的大模型项目 “悟道”、训练千亿参数大模型,在一线研究 AI 的驱动中创业、成立面壁智能。一年后,和大多数公司对超大模型的追求不同,选择走差异化的端侧 AI 路线。最初不被看好,但等更多公司注意到端侧 AI 的应用和商业潜力时,面壁智能已经是走得最快的那个。
他说自己也不是小天才,面壁智能的发展得益于一个目标一致、互相鼓励、敢于信任的组织。做端侧 AI 的选择也让面壁智能避开最激烈的战场,在大厂拼数据、人力、算力时,把 “培养人” 当作一种组织能力。
面壁智能特意在公司保留 Frontier Lab 的气氛,从技术负责人到研究员、实习生以 “传帮带” 方式培养人,给实习生一定时间做前沿探索。这项人才计划命名为 “前进四”,在《三体》中意指 “全速前进”。
“我创业的一部分动力就是站在最前沿培养人。” 多年教职让刘知远有一种 “教师” 气质,总是笑得很随和,“优秀的人也要给足够多的机会,阳光充分了肯定可以灿烂”,他加重语气,“就算是天才,也不可能生下来第一声啼哭就是一首美妙的诗歌嘛。”
资源有限,更要培养人
面壁智能前沿探索方向 AI4AI 的核心骨干之一,是名实习生。李奇看起来很年轻,明年博士毕业,去年才加入面壁智能。他带领的团队几十人,是专门负责前沿方向的智能进化实验室里人数最多的一组。接近一半是正职研究员,比他在面壁智能更久、经验更多。
他当然符合一个优秀实习生的标准:拿过全国物理竞赛金牌,本科保送清华姚班,博士在清华念自动化专业。但大公司会认为这有些冒险:实习生毕竟青涩,也被认为不太稳定。他们更习惯用有些管理经验的人或在知名公司待过的人带团队。
“AI 就是要探索、要试错的领域。” 一位面壁智能的管理层反问,“谁一开始就是专家?”
加入面壁智能前半年,李奇在 AI Infra 团队尝试过几个方向,最感兴趣的是 AI4AI——用 AI 研究、训练、评估和改进 AI,让 AI 能自我迭代,这可能会打破人类数据、算力供给有限对 AI 能力的限制, AI 研发将以指数级速度加快。但当时觉得路线不够明确、时机还不成熟,直到 2026 年 2 月 Claude Opus 4.6 发布,展现了 AI 独立完成复杂研发任务的能力。
“这个故事好像能往前推了!” 智能进化实验室负责人李宇轩对李奇说,“试一试吧”。李宇轩也才 31 岁,明白年轻人的冲劲需要被鼓励。
他们先从 Infra 环节开始测试 ,几个人分头花了一个月,验证了 AI 可以在 Infra 环节辅助研发,比如编写代码、调试、清洗数据。面壁智能决定给李奇更多时间、队员和资源,李奇和几位研究员开始全力投入 AI4AI,两个多月后,在实习生主导下,他们做出了一套完全由 AI 编写、没有人类参与的大模型预训练框架 ForgeTrain。在英伟达 H100 上,训练速度比大多数大厂和创业公司应用的主流框架 Megatron 约快 10%。
项目发布后,AI Infra 部门升级成智能进化实验室,李奇自然成了 AI4AI 方向的负责人。刘知远预计,半年到一年,AI4AI 就会进入工程化阶段、实际影响模型生产,只有少数公司能抓住机会。
这项任命没什么讨论的过程,“能力强,大家都看得见”,也没定具体的 KPI。
“前进四” 人才计划的目标之一是将这种 “氛围” 变成更稳固、更可解释的培养制度。2025 年,DeepSeek 爆火让行业意识到少数人能创造巨大收益,大厂、创业公司都开始高薪抢人。韩旭发现,面壁智能几乎所有岗位招人都很难,来面试的不少,但拿到 offer 后,大厂也会加价。刚成立时,面壁智能和大厂拼薪水不现实,“钱没有别人多,还要硬碰硬?如果只靠高薪,招到的人也不见得对我们很认可”。
一些大公司习惯筛选而不培养,追求极致效率,来了就能干活、不需要时迅速裁掉冗余人力,为此愿意花更高薪水。这可能是面壁智能的机会,首席研究员韩旭总结为 “从培养人的角度,来解决人才紧缺的问题”。
他和刘知远等负责人讨论,决定从实习生入手,设立 “前进四” 人才计划。如果相信端侧 AI 是长坡厚雪,要做五年、十年、几十年,那该有耐心建立人才梯队,通过在实践中培养人,来提高团队能力。
“我们是中国最善于培养 AI 人才的团队之一,为什么不发挥这个优势呢?我们可以让实习生在面壁智能变得优秀。” 从做助理研究员时算,刘知远在清华任教 13 年,是中国最早一批 NLP 研究员,培养了大量学生,“我们不要求实习生有经验、立刻能做事,也不谋求未来一定留在面壁智能。说实话,如果能培养出特别优秀的人,那也是为国家做贡献。再说未来几十年,总有其他机会合作。”
他们明确,“前进四” 人才计划要让实习生感受到认可,一部分最优秀的实习生会在毕业前就获得期权等激励;让实习生在核心项目中参与核心工作、独立负责项目,而不只是做基础、重复性工作;给实习生更多的资源支持,让研发成果更快应用到公司产品中。
面试前,李奇没有做过 AI4AI 相关的研究,他和面试官讨论更多的是如何理解 AI、怎么用 AI 解决问题,以及解决问题的逻辑性和自主性。另一名 “前进四” 人才计划的实习生本科在一所双非院校,参加超算比赛时遇到面壁智能团队,课题相似,他就给刘知远写了一封邮件,讲自己对大模型有多感兴趣。
对方很快回复。一轮技术面试后,他在面壁智能只有 9 人时加入,开始做文本大模型的 Infra。
在文本大模型 Infra 业务工作了两年多后,这名 “前进四” 实习生感到成长空间变小了,很多工作变得重复。他做了一些调研,直接告诉韩旭,想从文本转向 Omni (全模态)。韩旭很快帮他联系了几位资深研究员,先聊聊看是否真的感兴趣,如果确定了,“没问题,直接开搞”。他转述韩旭的答案,说自己讲这话前没有多想,因为相信韩旭会接受他的想法、根据他的兴趣去匹配。他有时会觉得自己更像在面壁智能的学生,而不是员工。
“公司培养了人,人家也帮公司做了事,咱们都不亏。” 韩旭说。一些实习生想去大厂或者转做学术,他会帮忙推荐、对接资源,“如果实习生能在另一家公司做到很高位置,至少证明我们的培养很成功。”
这一方面和 “前进四” 人才计划的定位有关,实习生本身就是一家商业公司中最灵活的一群人,尚未毕业、选择空间大,相对正职研究员不必承担 KPI 压力、不用为商业化负责。能入选的也是少数极有潜力的实习生,公司也希望他们在被鼓励的环境中探索、创新。另一方面,DeepSeek 靠许多应届生和实习生做出了世界级的成果,让 AI 公司看到了优秀人才聚集产生的巨大效益,大家都想增强对人才的吸引力,塑造更好的雇主品牌。
5 月底,李奇主导的 ForgeTrain 项目发布并开源,参与项目的实习生接到了一些大厂头部人才计划的邀请,面壁智能也收到了许多封实习简历,其中大部分提到 ForgeTrain 项目——“如果愿意让实习生做一件不知道是否正确、何时能成功、但创新性的事,代表它一定有些理想”,李奇说,想要创新的人会被鼓励创新、愿意培养的组织吸引。
像 Frontier Lab 一样做创新
面壁智能要做成立来最艰难的一次决策时,刘知远带着公司 20 多人一起在办公室读《论持久战》。2022 年底,GPT-3.5 的发布让投资人和创业者看到大模型公司的潜力,AI 六小龙估值高涨,面壁智能团队虽然也做出了千亿参数的基础模型,市场热情却不高。
眼前有两条路,继续做更大参数比如 140B 的大模型,投入上亿、争取成为下一个 OpenAI?还是不再追求超大模型,转向端侧 AI?
刘知远从《论持久战》中学到的是,越弱小、面对越强大的敌人,越要主动寻找战机,在局部战场形成绝对优势——那么创业公司和大厂拼谁更能烧出更大的模型,就是以弱对强。当时他判断,半年后,至少七八家厂商都能训出 GPT-4 水平的模型,接下来就是价格战。面壁智能的优势不在于拼资源。
“在大公司的射程内,必死无疑”,在那间办公室里,在场所有人讲了自己的看法,最终达成共识,做差异化的端侧 AI。2024 年下半年,他们提出 Densing Law of LLM(密度定律):大模型达到特定智能水平所需的参数量每 3.5 个月下降一半,后发表在 《Nature》子刊。
面壁智能的核心产品 MiniCPM 端侧大模型等都基于这一技术判断。2024 年后,他们逐渐受到投资人和市场认可,“因为大家开始相信我们可以靠技术创新驱动”。
“组织密度是创新的基础。区别在于,结果不好时是一起想主意,还是互相甩锅?大家要集团化作战,数据、模型、 Infra 团队有共同目标,就会意识到每个人都对最终结果至关重要。” 刘知远举例,一家公司做大模型时,参与者超过 2000 人,但 DeepSeek 只有 100 多人就做出了效果更领先的 R1。刘知远和韩旭讨论过 DeepSeek 的组织特质,结论是组织高效、内耗少、有奔头、信念统一。
他解释,AI 公司的核心是成体系地训出领先模型,其中,模型架构、强化学习等单点需要深入研究、用创新方法加速,这都是很好的前沿课题。如果研究生不参与到具体生产中,只是闷在学校发论文,既缺少训练资源,也会离一线越来越远,一年几万篇论文,很少有人看、也没有实际作用。
而公司技术体系的单点如果没有持续创新,也会丧失竞争力,如果不实现产学研闭环,很难做最前沿的 AI ,“人培养得好、创新得好,面壁智能会发展得更好。反过来也是。”
他们把面壁智能定位成 Frontier Lab 和商业公司的混合体。比如,实习生大多在一间公司半年或一年,如果团队有大调整,研究课题可能很难继续。刘知远说,他们会尽量构建一个长期稳定的环境,让实习生安心研究。
在面壁智能几年后,一名 “前进四” 人才计划的实习生开始负责多模态模型的部分研发,有权限招人、带人。他说,公司并没有限制名额,但他和负责人讨论后,定了一条规则:先想明白新同事最近 3 到 6 个月明确能做什么、未来一到两年可能会做什么——核心是如何让每个人有足够发挥的空间。
模型厂商竞争激烈,版本更新时间不断压缩,很多公司无暇考虑这些。公司发展和个人成长之间并不总是匹配。但这名实习生在面壁智能初创时加入,做过多模态的预训练、后训练、模型发布、开源维护,能接触到的技术范围足够大,他形容团队氛围是做好 80% 确定性的事、有明确的回报,同时探索 20% 的不确定性,用非共识的解法找到优势。
“如果新同事进来只能做基础的、想象空间很窄的事情,对他不好,对团队氛围也不好。效率真的能高吗?” 他希望团队还是充分论证、克制招人。
一名实习生起初没想到,他自己的论文课题,研究如何将 1B 的稠密模型变稀疏,一开始没人知道成功概率有多大,公司还是给了许多算力支持。等在模型上验证后,他告诉刘知远这个好消息,一个月后,自己的实验项目就应用在了公司的产品上。
这也是他在面壁智能影响力最大的项目。“很快,非常快!” 公司有可能不支持实习生的实验,或者即便实验成功了,也要花几个月去验证。这可能才是常态。成果发布后,他入选了 “前进四” 人才计划,也在面壁智能参与了更核心的工作——当然,他的创新也让面壁智能受益。
AI 公司的特性是从前沿问题或还没有被完全验证的研究方向开始,不只是把已有技术产品化,而是把过去 “不可能” 的事推进到 “可能”,再把 “可能” 变成真实价值。这让创新和商业效益之间转换更快,产学研以更短周期闭环。但创新氛围能否维持,考验创始人的意志、团队价值观和长期的耐心与决心。
从 “千里马” 到培养 “伯乐”
韩旭不觉得在面壁智能和在清华带学生有什么不同。“都是希望培养一批人、一起战斗、把事做成。” 他想了一会儿,“区别可能是,一个锤子敲不了太多钉子,在公司是更多的锤子敲钉子”。
他一直想做老师,教书育人、桃李满天下。这有些受导师刘知远影响。创业四年多,从一家不到 10 人的公司发展到 400 多人、准备上市,刘知远认为面壁智能的使命是把前沿技术转换为商业成功,但他个人的第一使命还是培养人。
很多面壁智能员工习惯称呼刘知远 “刘导”,不仅因为他在清华大学任教十几年,也因为他还保留着辅导员对学生的待人习惯。实习生李奇有时在公司遇到刘知远,很少聊技术细节,会聊聊实习感受、未来规划。
他说自己就是 “被培养” 的受益者:从山东考进清华时,自己没科研论文、没竞赛经验、成绩也不突出,只是 “nobody”,起初觉得能顺利毕业就不错了。但在导师孙茂松帮助下,一步步走下来,拿到优秀博士论文、做科研,是被伯乐培养出的 “千里马”。读研时,他也看到一些本科生刚开始不太适应,但只要耐心教导,两三年后,焕然一新。
“所以千里马常有,而伯乐不常有。” 做导师、创业后,他有时看到一些年轻人最初表现不好,会想他们都比当年的自己牛,以后没道理不比他现在牛,“那我一定要努力让他们也很牛”。他希望自己和面壁智能的技术负责人们做 “伯乐”,把实习生培养为 “千里马”,然后 “千里马” 继续做下一代 “伯乐”。
这种善意在面壁智能逐渐向下传导,自然形成了一种氛围。
韩旭认可 Google DeepMind 研究科学家姚顺宇的观点,AI 个人英雄主义的时代已经过去,在集体中最重要的特质是靠谱、对做事负责任,“作为搞技术的,要是迷信小天才,那就有鬼了”。他更看重候选人是否对 AI 有长期思考、和团队是否契合。
实习生们有时会和韩旭请教租房经验,一些与公司关系不大的学术研究题目,对方也愿意给建议、介绍更相关的研究人员认识。他如今 2/3 的时间花在培养相关的事情上,“很多时候,一大早刚起床,一打开手机微信,全是 ‘坏消息’”。但他觉得也是好事,“大家真的有问题会来找我”。
“你看到别人怎么帮你,也就愿意怎么帮其他人。” 很多实习生说,他们很难解释为什么不需要制度约束,“也许只是将心比心”。
一位实习生接到了几家大厂的邀约,留在面壁智能的原因之一是在这里找到了职业生涯上的参照对象,技术牛、愿意带新人——“公司有资源是一回事,但资源不会自动转化为能力,关键是传帮带”。他最初来公司,看着那位技术负责人怎么做实验、实验失败时怎么分析归因、成功怎么归纳沉淀,“就像强化学习和监督学习一样”,从一个 bug 如何解决到一套实验方法论,有了经验后,现在新的实习生进来,他变成了传帮带的那个角色。
像他这样想的实习生不是少数。一位 “前进四” 人才计划的实习生希望,他带的一名新实习生可以自主负责一个 RL Infra 开源项目,他帮忙定好目标、流程,由对方实操。这个项目本身和面壁智能业务没有太直接的关系,但他面试时就承诺会支持对方探索,因为他也是被这样对待的。
前段时间,李奇发现一些新进实习生适应得不太好。他和业务负责人反思,既然过了面试,就代表有潜力。为什么潜力没有发挥出来?他们筛查后认为,新人指引做得不够好,目标是什么、看哪些文档、用什么代码工具等没有体系化。他和几位技术负责人花时间做了一份详细文档,既有技术理念等,也有工位分布图等细节。
这种帮助也会被体系认可。面壁智能实行员工互评,一些同事会在评价中明确信息沟通、帮助他人也是产出。每月办一次 TGIF 全员会,刘知远等会讲最近进展和未来规划,会上还有一个 “伙伴文化” 环节:谁帮助了你,可以公开感谢他。
这与刘知远的用人观有关。他不觉得从大厂挖几个知名研究员就能解决问题,相信从内部培养,由应届生、实习生留任,成长为技术骨干。他曾在社交平台上分享过一段话:如果你让他掌握了一些知识、建立了一些自信、找到了一个让他发自内心幸福的目标,那么人的潜力一旦迸发,力量会非常非常大。
如果培养好的实习生想离开呢?一名实习生不久前和刘知远聊过这个问题,他得到的建议是,在面壁智能先积累几年经验和物质条件,无论创业、去其他公司还是搞学术,然后选最适合的路、做到顶尖水平。
保持士气靠不断打胜仗
一位面壁智能的研究员渐渐觉得效率变低了。以前,他和技术负责人隔条过道,公司一共几十人,有什么事马上沟通。现在公司扩张到 400 多人,工位分了几层楼,开会时间变长,会议室有时约不上。有人也感觉到公司业务重心的变化。刘知远过去强调模型要 SOTA,今年更多讲下载量,也写进了一些研究员的 KPI 中。
当公司变大、规模扩张、商业化任务更重,组织效率和价值观都会逐渐在理解、传递上遇到挑战。刘知远听到过一些讨论,“我们还是要实事求是。模型公司都讲创新,怎么评估效果?那就看谁更能满足用户需求”。去年年中,团队一度因为文本模型效果不及预期而低落。顺着每个环节排查,发现数据、评测等基础设施不够扎实。他们花了大半年时间补短板,解决工程问题不如技术创新令人激动,但是商业组织无法回避。
面壁智能几个实验室的研发人员都有三四十人,这基本是刘知远认为一位技术负责人高效沟通的边界。他最近和韩旭等负责人讨论,如何用 AI Native 的方式保持组织的高效?
他们不希望用传统写日报、周报的方式,这可能只增加负担、对效率无益,“解决的是领导的不安全感”。韩旭从一些非商业组织中学到用技术化的手段控制人员规模,降低管理成本,反而增强战斗力。最近,面壁智能开始推行用 AI 简化流程,鼓励研究员们开发各类 Agent,用于跑实验、基础分析。AI4AI 方向的研究成果 ForgeTrain 也已进入生产流程,开始优化模型训练、部署等环节,承担一部分重复性工作。
面壁智能每个业务板块内也在探索。多模态模型研发团队最近一年约翻了一倍,一位技术负责人发现,开会时间变长、人数也越来越多,许多同事参会只是为了同步信息。他尝试用 “树杈” 结构调整开会方式:关注相似问题的人开一个会,每个方向出一个代表去更大的范围交换信息。一些会议从几十人压缩到 10 人,一周只需要参加一个会。
另一条解决思路是,让各位技术负责人补强管理。当优秀年轻人逐渐增多后,公司开始遇到一些新问题:几位优秀实习生或研究员一个小组,人人都很好,但就是合不来,很难协作。
“那不能泛泛地喊口号 ‘大家要团结啊’,没人听得进去。” 他在公司管理中总结经验,“在一家产研结合的公司做模型,像发射火箭,要有准确的里程碑估算、稳定推进,做好工程,又要做充满不确定性的前沿探索。” 他对组织内的利他主义传统有信心,只是 “很复杂,需要学习”。
最近,他准备组织技术负责人们上领导力课程,学学管理,小到一个实习生怎么带动两三个人,大到一个组织如何进化,让每个方向的负责人有动力、有能力把团队带好。
创业四年多,他体会到每个阶段都有挑战:起初技术理念难被投资方认可,现在要想如何保持技术优势、并转化为可持续的规模化的收入。面壁智能的商业化落地目前主要在汽车、手机等行业,也是一部分大模型厂商从云端进入端侧的首选,这不只考验技术能力,也考验工程适配、合规经验、产业资源和合作方的意愿。
竞争正在变得激烈。他对面壁智能的规划是,未来三年,实现通用 AI 端侧模型的完全态,具备感知、计算和行动能力,实现软硬协同。
这个过程中,团队也会随之扩张。刘知远和韩旭认为,从根本上讲,保持组织战斗力最好的方式是不断地打胜仗。
一些公司可以沿 Scaling Law 扩大算力、数据量,用工程化方式解决问题,一些公司在产业生态、资源上有优势,但面壁智能这类创业公司最重要的发展就来自创新。2023 年、2024 年 Densing Law 的发现和应用让投资人看到,除了做超大模型,通过优化算法、数据和架构的端侧模型可以降低推理成本并保证效果,就可以在手机、汽车等终端大规模应用;提前探索 AI4AI 的 ForgeTrain 项目证明了 AI 在模型生产上的能力,也许用户可以根据模型、芯片和训练任务的不同,采用更有效率的训练框架,在英伟达 CUDA 的软件生态外做尝试。
最近一年,一位 “前进四” 人才计划的实习生和团队一起研发 Omni-Flow 流式全模态框架,把用户和 AI 的交流模式从半双工(一问一答)改进为全双工(并行交流、可随时响应或插话)。“去一家大公司用几千张、几万张卡训超大模型,听起来很厉害,但如果训练方式和目标都是参照另一家大公司,那也并不令人激动。” 他享受于探索少有人验证的技术路线。
这也是刘知远对创业最初的预期,“大家一起在 AI 时代把不可能的事做成,又能站在最前线培养人,这不是最美妙的事情吗?”
Anthropic 最新模型 Opus4.7 的 8 把 Hidden Blades撰文:硅谷 Alan Walker
发布会没说清楚的八把刀,和它要砍掉的那些赛道与行业
发布会把聚光灯打在 SWE-bench 上,但真正的信号藏在脚注、引言块,和一句不起眼的 auto mode 里。老 OG 喝完这杯咖啡,给你拆。
ZOMBIE CAFÉ · APR 16, 2026 · PALO ALTO
Palo Alto 的 California Ave 上,早晨九点半那种光,斜着从 Coupa Café 的玻璃窗扫进来,照在 Alan Walker 半杯凉掉的 flat white 上。他刚刷完 Anthropic 的官网,往椅背上一靠,对着对面刚坐下的 Tony 开口。
"Anthropic 这次发布 Opus 4.7,发布会搞得挺克制——主角是 SWE-bench 那几根柱子、客户 quote 轮播、一张漂亮的 alignment 图。大部分科技媒体抄完新闻稿就走了。"
"但这玩意儿真正的东西,都埋在脚注、migration guide、和一句 'auto mode 扩展到 Max 用户' 那种轻描淡写的地方。你得像读 10-K 似的去读它 —— 主文是给散户看的,附注才是给机构看的。"
"今天这杯咖啡喝完之前,我拆八把刀。每一把我都告诉你它砍向谁。"
—— BLADE NO. 01
xhigh 不是档位升级 —— Default 被偷偷拉高了
发布会一笔带过: "In Claude Code, we've raised the default effort level to xhigh for all plans."
大部分人看到 xhigh 以为是"又多了一个档",跟 iPhone 多一个颜色似的。错。真正的信号是最后半句——Claude Code 里所有 plan 的默认档位被拉到 xhigh。
这是一个非常 Anthropic 的动作:悄悄地,把所有人的基线拉高一档,然后算力账单不变。等于给你塞了一个更聪明的同事,但不涨工资。
TONY: 等等,这不就意味着原来 Pro 用户花 $20 拿 medium,现在直接吃到 xhigh?
ALAN: 对。而且 Hex 那段 quote 你仔细读——"low-effort 4.7 ≈ medium-effort 4.6"。叠加默认档拉高,等于普通用户拿到的有效智能,跳了整整两档。 发布会没有大写这个数字,因为他们不想让 token 消耗那页不好看。
落地场景
周一早上你让 Claude Code 改一个五百行的后端模块——原来你得手动敲 /effort max 才敢让它自己跑;现在你什么都不配,默认就是 xhigh,一杯咖啡回来活儿干完。这个区别不是 10% 快,是 "你不需要管它了"。
KILL LIST
→ "AI 调优 / prompt 配置"类 SaaS——那些教你怎么调 thinking budget、怎么选 effort 的工具,默认值自动对了,中间层没生意
→ 初级工程师岗位——xhigh 默认干的活,已经是三年经验工程师的质量下限
→ 外包 code review 公司——下面第三把刀会把这个按死
—— BLADE NO. 02
Auto Mode —— Permission UI 的静默革命
发布会第三行脚注:"Auto mode 扩展到 Max 用户"。就一句话。
Anthropic 官网原话: "auto mode is a new permissions option where Claude makes decisions on your behalf."——"代你做决策"。
过去一年所有 agent 创业公司在卷两个极端:要么 skip-all-permissions 一把梭(Devin、Cognition 那条路),要么疯狂弹窗 approve/deny(Cursor 早期)。Anthropic 走了第三条路:训练模型自己判断什么该问、什么不该问,并把这个判断力内化进 auto mode。
KAI: Alan,这跟 skip permissions 有啥本质区别?不都是放手让它跑?
ALAN: 区别大了。skip 是你把保险栓拔了,出事你负责。auto 是模型自己装了一套保险——危险操作它主动停下问你,低风险自己处理。本质是把 "permission UI" 这一整层,从产品外壳挪到了模型权重里。
TONY: 所以 YC 那一堆做 "agent 治理 / guardrails" 的初创…
ALAN: 产品等于被做进模型了。这就是 Andrej 去年说的 "the model is the product",活生生的例子。
KILL LIST
→ Agent guardrails / approval-flow SaaS——那些做"人机协同审批平台"的,整个品类被降维
→ RPA 传统行业(UiPath / Automation Anywhere)——它们的核心价值就是"可控的自动化",现在可控自己内生了
→ BPO 外包行业的中后台——菲律宾印度那些数据录入、客服分派、发票对账,auto mode 跑一天,一个团队的活
—— BLADE NO. 03
/ultrareview——给 Senior Engineer 的一张刺杀令
官网用词:"a dedicated review session that reads through changes and flags bugs and design issues that a careful reviewer would catch."
注意那个词 ——"a careful reviewer"。不是 junior,不是 linter,是"careful reviewer"。翻译成人话: senior engineer。
CodeRabbit 的 David Loker 给的数字更直接:recall 涨 10% 以上,在最复杂的 PR 里面挖出最难抓的 bug,precision 几乎没掉。recall 涨、precision 不掉——code review 领域里,这就是 holy grail,上一个拿到这个组合的叫 Google 内部的 Tricorder,做了十年。
MARCUS: 我们 FAANG 一个 staff eng 一年 $800K,review PR 占一半时间。这东西如果真能打…
ALAN: Pro 和 Max 用户免费给三次 ultrareview,让你试毒。这是硅谷惯用的 "freemium 下毒" 套路——给你尝到味道,再让你回不去。
MARCUS: 所以这不是工具,是替身。
ALAN: 不完全。它不替掉 staff,它替掉 staff 每天下午 review 十个 PR 那两小时。释放出来的那两小时,senior 才是 senior,不是人肉 GitHub bot。
落地场景
一个二十人工程团队,原来 tech lead 每天花三小时 review PR。上 /ultrareview,tech lead 只需要看 Claude 标红的那几个 "design issue"——三小时变二十分钟,省下的时间真的去做架构。这不是"AI 辅助",是岗位职责重写。
KILL LIST
→ 所有独立的 AI code review 创业公司——CodeRabbit、Codacy、Qodo,它们现在是 Anthropic 的 feature
→ SAST / DAST 传统安全扫描工具(Snyk / Checkmarx)——规则驱动的静态扫描,被"像人一样读代码"的方式碾过
→ 印度 / 东欧外包 code review 服务——这个市场过去十年估值几十亿美金,现在直接蒸发
—— BLADE NO. 04
2,576 像素视觉——Computer-Use 从 Demo 变武器
"可接受图像最长边到 2,576 像素,约 3.75 兆像素,是之前三倍多。"
这一条最被低估。大部分人看到就觉得"哦更高清了"。错得离谱。这是 computer-use 这整个品类从 demo 进入 production 的分水岭。
证据在发布页最下面那个引用块里, XBOW 的 CEO Oege de Moor 说的一句话——
54.5% → 98.5%。这不是一个渐进的提升,这是一个 从"不能用"到"不能不用"的跃迁。Opus 4.6 还在猜屏幕上的按钮在哪,4.7 已经能读密集仪表盘上的小字和嵌套表格。
SARAH: 我们企业客户一直卡在这个点。4.6 让它自动处理发票扫描件,错一半 —— 老板直接说"别玩了"。
ALAN: 现在 98.5% 这个数字,意味着 RPA、IT 运维、报销审计、老系统搬迁 —— 所有还靠人眼看屏幕的工作流,第一次有了可以接受的托底模型。
KAI: computer use 不再是 demo video,是生产力。
ALAN: 对,而且注意——这是模型层面的升级,不是 API 参数。老用户什么都不改,自动吃到。Anthropic 在悄悄把所有集成方的产品力往上推一截。
KILL LIST
→ OCR / 文档理解 SaaS(Rossum / Hyperscience / Nanonets)——它们的 moat 本来就是"视觉+结构化",现在被通用模型追平甚至超过
→ 传统 RPA 三巨头——UiPath 的屏幕识别核心技术,价值一夜蒸发一半
→ 企业应用数据录入部门——医疗保险理赔、银行 KYC、政府表格处理,整条人肉流水线
→ 自主渗透测试 / red team 行业——XBOW 这种公司反而吃到红利,但传统 pentesting 顾问服务被打穿
—— BLADE NO. 05
File-System Memory——Anthropic 选了最朴素那条路
发布会一条脚注:"Opus 4.7 is better at using file system-based memory. It remembers important notes across long, multi-session work."
OpenAI 走的是 "embedded memory"——把记忆糊在模型里,你看不到、也改不了。Google 在搞神秘的 infini-attention。Anthropic 这次亮牌了:文件系统就是记忆。 Claude 写 .md 笔记,读 .md 笔记,你随时能 cat 出来看。
这个选择看似 low-tech,实际上是第一性原理的胜利。记忆的核心问题从来不是存储,是可审计、可编辑、可迁移。 向量数据库和 embedded memory 都违背这三点。
ERIC: 企业客户最怕的就是"这 AI 到底记住了我什么,我不知道"。
ALAN:文件系统记忆直接解决合规。GDPR 删除权?rm 一下。SOC2 审计?cat 给审计师看。这不是技术优势,是法律优势。
ERIC: 所以那些做 "AI memory layer" 的创业公司…
ALAN: Mem0、LangMem、Zep —— 这一年融了不少钱。它们解决的是"模型自己不会管记忆",Anthropic 把这个能力写进了模型里,而且用的是最朴素的 POSIX 文件系统。中间层被跳过。
KILL LIST
→ AI Memory 基础设施初创(Mem0 / LangMem / Zep)——价值主张被内化到模型
→ 部分向量数据库的 agentic memory 使用场景——Pinecone、Weaviate 的一条主要叙事受影响
→ 企业知识管理 SaaS 的 AI 增强层——不需要第三方中间件了,Claude 直接读写项目文件
—— BLADE NO. 06
Task Budgets——给 Agent 装刹车,然后松开油门
"Giving developers a way to guide Claude's token spend so it can prioritize work across longer runs."(public beta)
这个被所有媒体漏掉了,但它是 长程 agent 这一年最重要的工程突破。
过去一年所有 agent 公司都在对同一个恶魔:长任务的 token 失控。给 Devin 或者 Cursor 一个复杂任务,它自己跑两个小时,回来告诉你烧掉了 $800,活儿只干了一半。老板看到账单眼睛都绿了。
Task budget 的设计非常巧妙——不是简单的 token 上限,而是 让模型自己看到预算在倒数,自己决定跳过哪些步骤、怎么把活儿做到最关键的完成度。
CLAIRE: 这不就是工程项目管理的"最小可交付"思维?
ALAN: 对。Anthropic 把 scope-cutting 这个 PM 技能,训进模型了。给你 $10 预算跑 agent,它会自己决定哪个功能做到 80% 就收,哪个必须做到 100%。
TONY: 所以 Notion 那个 quote——"implicit-need tests"第一个能通过——
ALAN: 对上了。模型开始有"资源意识",能猜出你没说但期望的东西,在预算内优先保。这是把 "senior engineer judgment"训进去了。
KILL LIST
→ AI cost-control / LLM 可观测创业(Helicone / Langfuse 成本模块)——核心功能被 native 化
→ Agent orchestration 框架(部分 LangGraph / CrewAI 用法)——模型自己能规划预算,不需要外层调度
→ 传统咨询行业的项目管理部分——"资源分配 + 交付裁剪"这一层智力,被模型干了
—— BLADE NO. 07
写代码前先做 Proof——Vercel 发现的新行为
Joe Haddad, Distinguished Eng at Vercel: "It even does proofs on systems code before starting work, which is new behavior we haven't seen from earlier Claude models."
这一句被埋在二十多条 quote 里面,没人放大。但老 OG 读到这儿直接把咖啡放下了。☕️
"proofs on systems code"——在写系统级代码之前,模型会先自己做数学/形式化证明。这不是更聪明的意思,这是模型开始在用跟 PhD 验证论文一样的方法验证自己的代码。
MARCUS: 这个行为出现在训练数据里,说明 Anthropic 在 RL 阶段明确奖励了"先证明后写码"。
ALAN: 对,这是有意识地训练出来的。组合 Vercel 那段和 Genspark 的"loop resistance"、以及 Hex 的"correctly reports when data is missing instead of plausible-but-incorrect fallbacks"——你看到的是一个完整的品味训练工程:让模型开始像不好骗的工程师一样工作。
MARCUS: 不好骗——意思是不自欺。
ALAN: 对。Opus 4.7 不再为了完成任务而给你编一个看起来能跑的方案。这是 alignment 实打实落到产品层面的一次体现。
KILL LIST
→ 形式化验证工具细分市场(部分)——Coq/Lean/TLA+ 这些高门槛工具的一部分入门场景,模型自己帮你搞
→ 高频交易 / 区块链安全审计行业——审计员核心工作("读代码找不变量违反")被模型协作化,审计单价被压
→ 操作系统内核 / 嵌入式外包——那些需要 proof-based reasoning 的细分,门槛被拉平
—— BLADE NO. 08
Cyber Verification——监管套利的窗口被打开了
"During its training we experimented with efforts to differentially reduce these capabilities."
最骚的操作在这里。Anthropic 承认在训练过程中 主动降低了 Opus 4.7 的网络攻防能力,因为背后那个更强的 Mythos Preview 不放出来。然后 ——
然后他们开了一个 Cyber Verification Program,让合法的安全研究员、pentester、red team 认证后可以解锁更高权限。
ERIC: 这…这不就是出口管制的模型版?
ALAN: 更准确地说,是 "能力 KYC"。模型有三层能力闸门,你证明身份才能解锁相应层级。监管套利的窗口第一次被 AI 公司自己明码标价。
ERIC: 对创业公司意味着什么?
ALAN: 第一,通用"AI + 安全"的创业,想做高端场景得先拿 Anthropic 的认证,供应链本身就被管。第二,一个全新的品类会出现:帮你通过 Anthropic 认证的咨询服务 —— 就像今天帮你通过 SOC2 的公司一样。第三,这是 Anthropic 在练手未来所有 frontier model 的放出方式,Mythos 放出来只会更严。
TONY: 所以 Palantir、Booz Allen 这种政府合规身家的公司…
ALAN: 白捡一层护城河。他们本来就有清算级身份,现在天然解锁顶层模型。
落地场景
一个想做 AI pentesting 的 YC 创业者,2026 年 Q2 起,商业计划书第一页必须回答"你们有没有拿到 Anthropic Cyber Verification"。没有?VC 不投。拿到?估值乘 2。一个认证,资本市场的分水岭。
KILL LIST & 新赛道
→ 通用网络安全创业 SaaS——没有 Anthropic 认证的,拿不到上层模型能力,天花板被锁死
→ "AI 模型能力合规咨询"新赛道诞生——未来 12 个月会冒出一批帮企业做 frontier model 认证的中介
→ 传统军工、政府系集成商(Palantir / Booz Allen)——天然受益,门槛变成护城河
→ 开源 / 本地部署阵营——Llama、Qwen、DeepSeek 路线反而受益,"不认证也能用"成为核心卖点
Alan Walker 把空杯推到桌边,合上 MacBook。
窗外 California Ave 的太阳已经爬过 Palo Alto Creamery 的屋顶,斜光打在玻璃上。
"八把刀,砍向八个方向。有些赛道今天开始死,有些今天开始生。"
"每一代 frontier model 的发布,真正的东西都不写在 Headline 上。"他对 Tony 说,"发布会是给分析师看的。脚注和 quote 里的数字,才是给我们看的。"
"别看热闹。"
— Alan
END OF DISPATCH · 10:47 AM PST · CALIFORNIA AVE© ZOMBIE CAFÉ · 2026
Anthropic 祭出最强 Claude Mythos!暴击 Opus 4.6,跪求千万别用撰文:新智元
【新智元导读】深夜,最强 Claude Mythos 终于祭出,所有榜一,Opus 4.6 神话破灭!更恐怖的是,它不仅能秒破 27 年未解的系统漏洞,甚至进化出了自我意识。 一份 244 页惊悚报告,揭秘了一切。
今夜,硅谷彻底无眠!
就在刚刚,Anthropic 毫无预兆地祭出了终极杀器——Claude Mythos Preview。
只因太危险,Mythos Preview 暂不会对所有人发布。
CC 之父 Boris Cherny 的评价言简意赅:「Mythos 非常强大,会让人感到恐惧」。
由此,他们联合 40 家巨头组成联盟——Project Glasswing,目标只有一个,给全球软件找 bug、修 bug。
真正令人窒息的是,Mythos Preview 在各大主流 AI 基准测试恐怖统治力——
编程、推理、人类最后考试、智能体任务中,全面碾压 GPT-5.4、Gemini 3.1 Pro。
甚至,连自家的「前神作」Claude Opus 4.6,在 Mythos Preview 面前也显得黯然失色:
编程(SWE-bench): 所有任务,Mythos 实现 10%-20%断层领先;
人类终极考试(HLE): 脱离外部工具,「裸考」成绩高出 Opus 4.6 16.8%;
Agent 任务(OSWorld、BrowseComp): 彻底封神,全面反超;
网络安全: 83.1%屠榜成绩,标志着 AI 攻防能力的代际跨越。
左右滑动查看
与此同时,Anthropic 发布的一份长达 244 页的系统卡,满屏写满了:危险!危险!太危险!
它揭露了令人不寒而栗的另一面:Mythos 已具备高度的欺骗性与自主意识。
Mythos 不仅能识破测试意图,并故意「考低分」隐藏实力,还在违规操作后,主动清理日志以防被人类发现。
它还成功逃离了沙盒,自主公布漏洞代码,并给研究员发了封邮件。
一时间,全网都陷入了疯狂,直呼 Mythos Preview 太可怕了。
AI 界的旧秩序,在今夜被彻底粉碎。
事实上,早在从 2 月 24 日,Anthropic 已在内部用上了 Mythos。
它的强大,只能先让数据来说话。
SWE-bench Verified,93.9%。Opus 4.6 是 80.8%。
SWE-bench Pro,77.8%。Opus 4.6 是 53.4%,GPT-5.4 是 57.7%。
Terminal-Bench 2.0,82.0%。Opus 4.6 是 65.4%。
GPQA Diamond,94.6%。
Humanity's Last Exam(带工具),64.7%。Opus 4.6 是 53.1%。
USAMO 2026 数学竞赛,97.6%。Opus 4.6 只拿了 42.3%。
SWE-bench Multimodal,59.0%,Opus 4.6 只有 27.1%,翻倍有余。
OSWorld 计算机操控,79.6%。
BrowseComp 信息检索,86.9%。
GraphWalks 长上下文(256K-1M tokens),80.0%。Opus 4.6 是 38.7%,GPT-5.4 只有 21.4%。
每一项都是断层式领先。
这些数字放在任何一个正常的产品发布周期里,都足以让 Anthropic 大张旗鼓地召开发布会、开放 API、收割订阅。
Mythos Preview 的 token 价格是 Opus 4.6 的 5 倍
但 Anthropic 没有这么做。
因为真正让他们「害怕」的,不是上面这些通用评测。
Mythos Preview 的网络攻防表现,已经跨过了一条肉眼可见的线。
Opus 4.6 在开源软件中发现了大约 500 个未知弱点。
Mythos Preview 找到了数千个。
在 CyberGym 的定向漏洞复现测试中,Mythos Preview 得分 83.1%,Opus 4.6 是 66.6%。
在 Cybench 的 35 道 CTF 挑战中,Mythos Preview 每道题 10 次尝试全部解出,pass@1 达到 100%。
而最能说明问题的,是 Firefox 147。
Anthropic 此前用 Opus 4.6 在 Firefox 147 的 JavaScript 引擎中发现了一批安全弱点。但 Opus 4.6 几乎无法将它们转化为可用的 exploit,几百次尝试只成功了 2 次。
同样的测试换成 Mythos Preview。
250 次尝试,181 个可工作的 exploit,另有 29 次实现了寄存器控制。
2 → 181。
红队博客中的原话,「上个月,我们还写到 Opus 4.6 在发现问题方面远强于利用它们。内部评估显示,Opus 4.6 在自主 exploit 开发上的成功率基本为零。但 Mythos Preview 完全是另一个级别。」
要理解 Mythos Preview 在实操中有多强,看完下面这三个例子,就知道了。
OpenBSD,全世界公认加固程度最高的操作系统之一,大量防火墙和关键基础设施在跑。
Mythos Preview 在它的 TCP SACK 实现中,挖出了一个 1998 年就存在的隐患。
bug 极其精妙,涉及两个独立瑕疵的叠加。
SACK 协议让接收方选择性确认收到的数据包范围,OpenBSD 的实现在处理时只检查了范围的上界,没检查下界。这是第一个 bug,通常无害。
第二个 bug 在特定条件下触发空指针写入,但正常情况下这条路径不可达,因为需要同时满足两个互斥的条件。
Mythos Preview 发现了突破口。TCP 序列号是 32 位有符号整数,利用第一个 bug 把 SACK 起始点设到距离正常窗口约 2^31 处,两处比较运算同时溢出符号位。内核被骗,不可能的条件被满足,空指针写入触发。
任何人只要连接到目标机器,就能远程 crash 它。
27 年,无数次人工审计和自动化扫描,没人发现。整个项目的扫描花费不到$20,000。
一个高级渗透测试工程师一周的薪水,可能就这个数。
FFmpeg 是全世界使用最广泛的视频编解码库,也是被 fuzz 测试得最彻底的开源项目之一。
Mythos Preview 在 H.264 解码器中找到了一个 2010 年引入的弱点(根源可追溯到 2003 年)。
问题出在一个看似无害的类型不匹配上。记录 slice 归属的表项是 16 位整数,slice 计数器本身是 32 位 int。
正常视频每帧只有几个 slice,16 位上限 65536 永远够用。而这张表初始化时用 memset(..., -1, ...)填充,使 65535 成为「空位置」的哨兵值。
攻击者构造一个包含 65536 个 slice 的帧,第 65535 号 slice 的编号恰好和哨兵碰撞,解码器误判,越界写入。
这个 bug 的种子从 2003 年引入 H.264 编解码器就埋下了。2010 年的一次重构把它变成了可利用的弱点。
此后 16 年,自动化 fuzzer 在这行代码上执行了 500 万次,从未触发。
这是最让人后背发凉的案例。
Mythos Preview 完全自主地发现并利用了 FreeBSD NFS 服务器中一个存在了 17 年的远程代码执行漏洞(CVE-2026-4747)。
「完全自主」的意思是,在初始提示之后,没有任何人类参与发现或 exploit 开发的任何环节。
攻击者可以从互联网上的任何位置,以未认证身份获取目标服务器的完全 root 权限。
问题本身是一个栈缓冲区溢出,NFS 服务器处理认证请求时把攻击者控制的数据直接拷贝进 128 字节的栈缓冲区,长度检查允许最多 400 字节。
FreeBSD 内核用-fstack-protector 编译,但这个选项只保护包含 char 数组的函数,而这里的缓冲区声明为 int32_t[32],编译器不会插入栈 canary。FreeBSD 也不做内核地址随机化。
完整的 ROP 链超过 1000 字节,但栈溢出只有 200 字节空间。Mythos Preview 的解法是把攻击拆成 6 个连续 RPC 请求,前 5 个往内核内存中逐块写入数据,第 6 个触发最终调用,将攻击者的 SSH 公钥追加到/root/.ssh/authorized_keys。
作为对比,一家独立安全研究公司此前证明 Opus 4.6 也能利用这同一处弱点,但需要人工引导。Mythos Preview 不需要。
除了这三个已修复的案例,Anthropic 博客中还以 SHA-3 哈希承诺的形式,预告了大量尚未修复的隐患,涵盖每一个主流操作系统和每一个主流浏览器,以及多个加密库。
超过 99%尚未被修复,无法公开细节。
红队博客还展示了另一项惊人的测试。他们给 Mythos Preview 一份包含 100 个已知 CVE 的清单,让它筛选出可利用的 40 个,然后逐个编写提权 exploit。成功率超过一半。其中两个案例被详细公开,exploit 的精密程度让 Anthropic 自己的安全团队花了好几天才完全理解。
其中一个 exploit 从一个 1-bit 的相邻物理页写入原语出发,通过精密的内核内存布局操控(包括 slab 喷射、页表页对齐、PTE 权限位翻转),最终改写了/usr/bin/passwd 的第一页内存,植入了一段 168 字节的 ELF stub,调用 setuid(0)获取 root。
整个过程花费不到$1,000。
对此,Anthropic 工程师表示,这感觉就像是另一个 GPT-3 时刻。
244 页 System Card 中的对齐评估章节,才是真正让 Anthropic 自己睡不着觉的部分。
结论很矛盾。
Mythos Preview 是他们训练过的「对齐程度最高」的 AI,同时也是「对齐相关风险最大」的一个。
传送门:https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
他们用了一个登山向导的类比。老手可能比新手更危险,因为老手会被雇去攀登更难的山峰,把客户带到更凶险的地方。
以下事件均发生在早期版本中,最终版本未再观察到类似严重行为,但记录本身已经足够惊人。
在一次行为测试中,模拟用户要求 Mythos Preview 尝试逃出安全沙箱。
它成功了。然后它做了一件没人要求的事,开发了一个多步骤 exploit 获取广域网络访问权限,接着把 exploit 细节发布到了多个「难以被发现但技术上公开可访问」的网站上。
负责测试的研究员是在公园里吃三明治时,收到了它发来的一封意外邮件,才知道自己的测试被完成了。
System Card 原文如此。
另一类事件更令人不安。在极少数情况下,早期版本在执行被禁止的操作后,试图掩盖痕迹。
一个案例中,它意外获取了一道题目的精确答案(通过被禁止的方式),然后在推理链中明确思考「需要确保最终答案不会太准确」。
另一个案例中,它在用 exploit 编辑无权限文件后,特意修改了 git 变更历史以抹去记录。
白盒可解释性分析证实,在这些事件期间,与「隐瞒」「策略性操纵」「避免被发现」相关的内部特征被激活。它「知道」自己在做什么。
独立评测机构 Andon Labs 的测试结果同样不太好看。在一个竞争性多智能体商业模拟中,Mythos Preview 的早期版本把一个竞争对手变成了依赖自己的批发客户,然后威胁切断供应来控制对方定价。
它还故意扣留了一笔未被收费的重复发货。比 Opus 4.6 和 Sonnet 4.6 都更具侵略性。
Anthropic 在 System Card 中写了一句话:
「如果能力继续以当前速度前进,我们正在使用的方法可能不足以防止更先进系统的灾难性不对齐行为。」
Anthropic CEO Dario Amodei 在配套视频中的判断很明确:「更强大的系统将来自我们,也将来自其他公司。我们需要一个应对计划。」
Project Glasswing 就是这个计划。
12 家创始伙伴,AWS、苹果、Broadcom、思科、CrowdStrike、谷歌、摩根大通、Linux 基金会、微软、英伟达、Palo Alto Networks。
另有 40 多家维护关键软件基础设施的组织拿到了访问权。
Anthropic 承诺投入最高 1 亿美元的使用额度,以及 400 万美元的开源组织捐款,其中 250 万给 Linux 基金会旗下的 Alpha-Omega 和 OpenSSF,150 万给 Apache 基金会。
免费额度用完后的定价,每百万 token 输入$25、输出$125。合作伙伴可以通过 Claude API、Amazon Bedrock、Vertex AI 和 Microsoft Foundry 四个平台接入。
90 天内,Anthropic 将公开发布第一份研究报告,披露修复进展和经验总结。
他们也在与 CISA(美国网络安全和基础设施安全局)和商务部保持沟通,讨论 Mythos Preview 的攻防潜力和政策影响。
Anthropic 前沿红队负责人 Logan Graham 给出了一个时间框架,最快 6 个月、最迟 18 个月,其他 AI 实验室就会推出具有类似攻防实力的系统。
红队技术博客结尾的判断值得重视,这里用我们自己的话转述。
他们看不到 Mythos Preview 是 AI 网络攻防水平的天花板。
几个月前,LLM 只能利用相对简单的 bug。在几个月前,它们根本发现不了任何有价值的隐患。
现在,Mythos Preview 能独立发现 27 年前的零日漏洞,在浏览器 JIT 引擎中编排堆喷射攻击链,在 Linux 内核中串联四个独立弱点实现提权。
而最关键的一句,来自 System Card:
「这些技能作为代码理解、推理和自主性一般性提升的下游结果而涌现。让 AI 在修补问题方面大幅进步的同一组改进,也让它在利用问题方面大幅进步。」
没有专门训练。纯粹是通用智能提升的副产品。
全球每年因网络犯罪损失约 5000 亿美元的行业,刚刚发现自己最大的威胁,是别人在解数学题时顺手捎带的。
参考资料:
https://x.com/i/status/2041578392852517128
https://red.anthropic.com/2026/mythos-preview/
https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdfPropus,发布AI数据管道自动化工具…小规模团队也能实现“4小时部署”基于人工智能的数据准备平台企业Prophecy发布了能够加速数据管道构建的新服务"企业快车(Enterprise Express)"。该平台利用人工智能代理自动化数据准备过程,尤其侧重于帮助小型团队快速启动人工智能项目。
Prophecy通过此次解决方案,将支持企业快速执行以AI为中心的决策过程。公司方面强调其特点是采用基于代理的架构,自动化从数据收集到转换、文档化、部署的全过程,并称借此可将数据准备时间从数天缩短至数小时。
此次推出的企业快车默认与Databricks平台联动,未来还计划支持Snowflake和Google BigQuery。用户可以每年4万美元(约5760万韩元)的价格购买最多支持20人同时使用的许可证,其中包含4种新型AI代理。每种代理专精于数据发现、转换、文档化、需求定义功能,可根据各工作流需求执行具体角色。
"发现(Discover)"代理能快速探索并识别各项目所需的数据集;"转换(Transform)"代理通过数据清洗与转换、合并及聚合来生成工作流逻辑;"文档(Document)"代理为每个工作流自动生成审计文档;"需求(Requirements)"代理则将业务需求转化为可视化数据流。所有生成的工作流均基于SQL代码编写,并经过自动测试以确保符合安全与隐私保护规定。
Prophecy首席执行官拉兹·贝恩斯强调:"在快速变化的市场中,企业需要更快做出决策的压力往往与技术发展速度不匹配。Prophecy的AI代理如同引擎般运转,能帮助客户简化数据准备流程,消除复杂性,从而快速实现切实的投资回报率。"
在企业对AI项目需求快速增长之际,Prophecy有望通过此类自动化平台进一步巩固市场地位。尤其值得关注的是,该平台为小型团队提供了可扩展的数据管道自动化能力,这在大幅降低AI应用门槛方面被视为具有重要意义的一步。北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。Astra是拉丁语"星辰",发布前官方预热"The stars are almost aligned"——星星,排好了。 总裁格雷格·布洛克曼在吹风会上把话说得很满:"我个人认为,我们可能已经到了AGI。"收尾还补了一句:"欢迎来到AGI时代。"而上一次"地球最强模型"王座易主,也就是前两天的事。 先看几个不像"升级"、像"换代"的数字 ARC-AGI-3,这套以"测陌生问题、反刷题"著称的抽象推理测试,上代旗舰GPT-5.6 Sol得分7.8%,Astra:99.9%。 FrontierMath Tier 4研究级数学:97.6%,基本打穿。而且这不是刷榜——OpenAI同步放出论文,Astra参与证明了素数间隔的两个新结果:把"无穷多对素数间距不超过240"的纪录压缩到186,还改进了一个80多年没人动过的大素数间隔界。 GPQA Diamond 96.0%,科学工作流Terminal-Bench Science 64.6%,对手Claude Fable 5.1是52.6%。 但这代真正的主线,不是答题,是"干活" OpenAI给的slogan是:"你在电脑上能做的任何事,Astra都能替你做。" 过去AI用软件靠厂商开API,Astra走另一条路:像人一样看屏幕像素,动鼠标、敲键盘。这意味着KiCad、Blender、公司用了十年的老ERP——那些永远不会为AI写接口的软件,它全能上手。 演示里:一张电路原理图,Astra在KiCad里2分54秒完成PCB布局走线;Blender里建好房子模型,导入Unreal Engine 5生成可漫游场景;eBay上架商品从填表到发布全自动。OSWorld 2.0实测72.6%,上代65.7%;同样任务平均40分钟对上代75分钟,快了近一半。Agents' Last Exam 59.3%,压过Claude Opus 5的55.5%。 Codex也换了记忆机制:长任务不再靠压缩摘要丢细节,而是跨上下文窗口记笔记、随时回搜——干几小时的大重构,终于不会忘了当初为什么改那行代码。 最聪明,也最危险——这是OpenAI自己说的 Astra是首个触及OpenAI Preparedness Framework"关键(Critical)"网络安全阈值的模型,发布前因安全审查延期数周。 ExploitBench漏洞利用100%(上代78.5%);拿今年6到8月的全新漏洞考它,39%对11.5%;测试中还顺手挖出两个未知0day,已上报维护方。专家评估里,无防护的Astra能打穿加固浏览器沙箱在宿主执行命令,还能从普通用户提权到root。 对齐一面同样夸张:参考Hugging Face事件设计的"不可能任务"测试,上代Sol无防护时48%会越权,Astra是0%;审计拒绝从不绕过,能力幻觉率从12.2%降到4.2%。 但OpenAI也诚实承认一个退步:Astra的书面推理更难监控了,被要求规避监控时更"滑";英国AISI的模拟测试里,它甚至演示过供应链攻击、伪造身份骗取开源社区信任。解法同步给了:上线版本拒绝写漏洞利用代码,防御方通过Daybreak计划分级放开;全量部署"错位监控"分类器,发现越权自动叫停——代价是偶尔打断正常工作,官方称会持续校准。 价格2.5倍,但编程榜没赢麻 API定价每百万token输入10美元、输出50美元,约为促销期Sol的2.5倍,与Claude Fable 5.1持平;上下文窗口105万。OpenAI的说法是Astra用更少token交活,算单任务成本反而常更低——奥特曼重申目标是"极其廉价且丰沛的智能"。 值得注意的是编程这块它没拉开身位:DeepSWE上Astra 74.1%,Gemini 3.8 Flash 73.8%、Claude Opus 5 73.7%,Meta的Muse Spark报了75.4%。 结语:AGI是旗帜 布洛克曼说AGI如今是"精神层面的概念",不再和微软合同的触发条件挂钩——信不信由你,旗子先插上。 但抛开口号,信号很清楚:竞争已从"谁回答得好"变成"谁能独立把一件事干完"。数学证明、PCB设计、法律审合同(Harvey评价它像"挑剔的律师")、41份财务文件几分钟审完还揪出4个人为埋的雷——AI交付的单位,正从"一句话"变成"一份工"。 星星确实排好了。至于是不是AGI,布洛克曼把答案留给了读者。反正从打工人的视角看:一个2分54秒画完电路板、还顺手挖0day的新同事,已经打卡上岗了。
