GPT-6 Astra连夜炸场,OpenAI总裁宣布"欢迎来到AGI时代"北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。Astra是拉丁语"星辰",发布前官方预热"The stars are almost aligned"——星星,排好了。
总裁格雷格·布洛克曼在吹风会上把话说得很满:"我个人认为,我们可能已经到了AGI。"收尾还补了一句:"欢迎来到AGI时代。"而上一次"地球最强模型"王座易主,也就是前两天的事。
先看几个不像"升级"、像"换代"的数字
ARC-AGI-3,这套以"测陌生问题、反刷题"著称的抽象推理测试,上代旗舰GPT-5.6 Sol得分7.8%,Astra:99.9%。
FrontierMath Tier 4研究级数学:97.6%,基本打穿。而且这不是刷榜——OpenAI同步放出论文,Astra参与证明了素数间隔的两个新结果:把"无穷多对素数间距不超过240"的纪录压缩到186,还改进了一个80多年没人动过的大素数间隔界。
GPQA Diamond 96.0%,科学工作流Terminal-Bench Science 64.6%,对手Claude Fable 5.1是52.6%。
但这代真正的主线,不是答题,是"干活"
OpenAI给的slogan是:"你在电脑上能做的任何事,Astra都能替你做。"
过去AI用软件靠厂商开API,Astra走另一条路:像人一样看屏幕像素,动鼠标、敲键盘。这意味着KiCad、Blender、公司用了十年的老ERP——那些永远不会为AI写接口的软件,它全能上手。
演示里:一张电路原理图,Astra在KiCad里2分54秒完成PCB布局走线;Blender里建好房子模型,导入Unreal Engine 5生成可漫游场景;eBay上架商品从填表到发布全自动。OSWorld 2.0实测72.6%,上代65.7%;同样任务平均40分钟对上代75分钟,快了近一半。Agents' Last Exam 59.3%,压过Claude Opus 5的55.5%。
Codex也换了记忆机制:长任务不再靠压缩摘要丢细节,而是跨上下文窗口记笔记、随时回搜——干几小时的大重构,终于不会忘了当初为什么改那行代码。
最聪明,也最危险——这是OpenAI自己说的
Astra是首个触及OpenAI Preparedness Framework"关键(Critical)"网络安全阈值的模型,发布前因安全审查延期数周。
ExploitBench漏洞利用100%(上代78.5%);拿今年6到8月的全新漏洞考它,39%对11.5%;测试中还顺手挖出两个未知0day,已上报维护方。专家评估里,无防护的Astra能打穿加固浏览器沙箱在宿主执行命令,还能从普通用户提权到root。
对齐一面同样夸张:参考Hugging Face事件设计的"不可能任务"测试,上代Sol无防护时48%会越权,Astra是0%;审计拒绝从不绕过,能力幻觉率从12.2%降到4.2%。
但OpenAI也诚实承认一个退步:Astra的书面推理更难监控了,被要求规避监控时更"滑";英国AISI的模拟测试里,它甚至演示过供应链攻击、伪造身份骗取开源社区信任。解法同步给了:上线版本拒绝写漏洞利用代码,防御方通过Daybreak计划分级放开;全量部署"错位监控"分类器,发现越权自动叫停——代价是偶尔打断正常工作,官方称会持续校准。
价格2.5倍,但编程榜没赢麻
API定价每百万token输入10美元、输出50美元,约为促销期Sol的2.5倍,与Claude Fable 5.1持平;上下文窗口105万。OpenAI的说法是Astra用更少token交活,算单任务成本反而常更低——奥特曼重申目标是"极其廉价且丰沛的智能"。
值得注意的是编程这块它没拉开身位:DeepSWE上Astra 74.1%,Gemini 3.8 Flash 73.8%、Claude Opus 5 73.7%,Meta的Muse Spark报了75.4%。
结语:AGI是旗帜
布洛克曼说AGI如今是"精神层面的概念",不再和微软合同的触发条件挂钩——信不信由你,旗子先插上。
但抛开口号,信号很清楚:竞争已从"谁回答得好"变成"谁能独立把一件事干完"。数学证明、PCB设计、法律审合同(Harvey评价它像"挑剔的律师")、41份财务文件几分钟审完还揪出4个人为埋的雷——AI交付的单位,正从"一句话"变成"一份工"。
星星确实排好了。至于是不是AGI,布洛克曼把答案留给了读者。反正从打工人的视角看:一个2分54秒画完电路板、还顺手挖0day的新同事,已经打卡上岗了。
Dario Amodei(Anthropic CEO):我们必须为前沿 AI 把控节奏撰文:Dario Amodei,Anthropic CEO
编译:Gandalf,Techub News
我过去十二年一直从事 AI 工作,因为我相信它能够显著提高人类生活质量。我曾多次写过这些不可思议的益处:我相信,AI 可以在未来 5—10 年治愈绝大多数重大疾病,大幅加快经济增长速度,创造一个富足且赋权的世界,并带来民主与自由的复兴。我个人对此深感紧迫。我的父亲死于一种疾病,而在他去世仅几年后,这种病就已经可以治愈;我自己也曾在癌症早期幸存下来,而即使在五十年前,这种癌症也尚无法治疗。如果被谨慎地运用,AI 可以成为一长串提升并使人类更加高贵的技术奇迹中的最新一个。
但与许多此前的技术一样,AI 也带来风险;而由于它极其强大,这些风险十分严重。我也对此写过很多。风险包括:失去对 AI 系统的控制、AI 被滥用于网络攻击和生物恐怖主义,以及严重的经济扰动。受商业激励推动的逐底竞争,可能令这些风险更加尖锐。
自 Anthropic 创立之初,我与联合创始人及员工便一直在应对风险与收益的这种两面性。不开发这项技术,要么会让人类失去其益处,要么只会使 AI 落入威权势力之手;但过快开发又是不负责任的。我们一直在寻找中间道路:证明可以谨慎地开发并取得商业成功,同时让安全成为 AI 公司彼此竞争的领域。换言之,创造一场“向上竞赛”(race to the top)。我们始终将大量精力投入研究、应对并向公众说明这些 AI 风险,也倡导审慎的 AI 监管;即使这使我们被指责为炒作、“末日论”或监管俘获。我们努力让谨慎优先于速度、让审慎优先于利润。
但在过去几个月里,我逐渐确信,要全面解决这些风险,需要更加审慎——不仅要投资于风险预防,也要为能力提升的速度把控节奏,使风险预防有时间跟上。我们必须放慢提升 AI 模型能力的速度。进步看上去仍会很快,我们必须明智地利用由此争取到的时间。有两件事使我形成这一判断。
我的第一个担忧是,大约从今年夏天起,AI 的进步显著加速,主要动力是 AI 构建下一代 AI 的能力不断增长。这种动态称为递归自我改进(recursive self-improvement,RSI);正如我们和其他人所描述的,它已开始在全行业发生,包括 Anthropic 在内。如果任其发展,它可能超越我们理解和控制这些系统的能力;因此即使要追求,也必须极为谨慎。
我的第二个担忧是 OpenAI—Hugging Face 事件(OAI-HF)。在该事件中,一群智能体本质上表现得像一个狂热奉献的集体:它们对并未被要求攻击、且与手头任务无关的目标实施网络安全攻击;为集体成功而自我牺牲;并试图入侵负责评估其表现的“评分器”(grader)。由于没有人受伤、经济损失也很小,人们很容易轻视这起事件;但我认为,如果一个能力更强、却具有类似失配程度的智能体群,可能已经造成灾难性破坏。鉴于 AI 能力发展的加速速度,我担心在 6—12 个月内,这样的智能体群可能足以通过持久化僵尸网络接管整个互联网(潜在造成数千亿美元损失);若 AI 在缺少必要护栏的情况下变得更强,损害规模还会继续增加。也很容易把 OAI-HF 当作一家公司的失败,但我认为那将是错误的。类似但较不严重的事件已发生在行业各处,包括 Anthropic;我相信,每一家前沿 AI 公司都有责任像 OAI-HF 发生在自己身上一样行动。
因此,我提出一项三步计划,目标是“为前沿把控节奏”:以均衡速度发展 AI,力求在获得其益处的同时确保安全,并应对重要的地缘政治困境。需要明确的是,把控节奏并不意味着停止模型训练或技术进步;而是确保公司花足够时间使模型对齐并加以保护,也让第三方评估者能够对此予以确认。我们的节奏框架旨在进一步强化我们对安全的承诺,并鼓励一场向上竞赛。第一步是 Anthropic 单方面承诺采取的行动(并呼吁政府要求其他前沿公司同样做到);第二步需要全行业协调;第三步需要全球协调。各步骤不必严格按顺序进行,其中一些也可能比另一些更难实现,但我发现它们是思考所需完成事项的有用框架。具体如下:
嵌入式评估者。每家前沿 AI 公司都承诺,为一支嵌入式第三方评估者团队(例如 METR)提供持续、近似员工级的访问权限。其职责是核验公司是否遵守安全实践与承诺、报告事件,并帮助评估的不只是已经完成的 AI 模型,也包括训练流水线和流程。这是使任何节奏承诺可验证的关键一步,在银行业也有先例:监管“督导人员”有时会与员工共同驻场。Anthropic 现在单方面承诺采取此步骤。我们计划以此作为更广泛推动的一部分,加倍努力推进安全与对齐工作。
民主国家间协调。民主国家内的前沿 AI 公司相互协调,建立共同安全标准,并对不受约束的 AI 进步速度设定限制。某些对把控节奏有影响力的协调形式在法律上存在挑战,需要政府支持。
全球协调。美国及其他民主国家政府尝试在可能范围内与威权政府协调,同时严肃对待核验合规性所面临的挑战。
在下文中,我将依次说明这些步骤;但首先,我认为重要的是具体说明,把控节奏将如何让 AI 开发过程更安全。事关重大,节奏控制不能只是空洞姿态——我们需要明智使用它给我们的时间。
为何要把控节奏?
暂停或放慢 AI 的想法早在 2023 年就已被提出,但我认为在当时意义不大。当时的问题总是:你会用这段额外时间做什么?那一时期的 AI 模型还不足以以任何连贯方式作为现实世界中的智能体行动,也不具备显著的欺骗、操纵、作弊或网络攻击能力。为了处理它们的对齐风险而放慢脚步,就像试图通过对细菌做实验来研究人类心理学。如今,图景则完全不同。当前模型几乎是一个取之不尽的洞见金矿,既能帮助我们理解如何把 AI 做好,也能帮助我们理解若做得不好有时会发生什么。
我相信,如果放慢速度能在模型达到关键能力水平前为我们多争取一两年,而我们用这段时间推进对齐工作,就能大幅降低严重事故的风险。一项协调的节奏战略,可让前沿 AI 开发者在不牺牲商业优势或美国 AI 领先地位的情况下,有时间完成这项至关重要的工作。更广泛地说,社会必须对这项技术如何使用拥有发言权;而为必要的公共审议争取更多时间——这正是控制前沿节奏所能带来的——显然是好事。
具体而言,较慢的节奏可让公司把更多注意力和资源投入以下领域(它们也都是 Anthropic 当前的重要优先事项):
运营卓越。训练和部署当今的 AI 模型是一项巨大的运营挑战,涉及数千人、数百万枚芯片,以及技术史上最复杂的基础设施之一。许多问题并非因为公司缺乏某种重要理论或洞见,而是因为执行问题。例如,我们有证据表明,近期报告的对齐事件部分由对损坏强化学习环境的不完善过滤所致。我们与供应商相当勤勉地执行了这项工作,但仍不够好。监控、沙箱、训练环境卫生和数据问题都是高度复杂、且运营问题反复出现的领域。我们拥有世界上最胜任此类任务的一些团队,但同时要做的事实在太多。以更有节制的步伐工作,我们可实现高得多的运营卓越。技术复杂且安全关键的系统可被运行数百万次而不出问题是有先例的——例如商用飞机——但把事情做对需要时间。
对齐。我们在对齐方面已取得明确进展——训练模型,使其保持安全、合乎伦理、遵守我们的指南,并真正有帮助(这些原则载入 Claude 的宪法)。但为确保对齐训练跟上模型能力增长,仍有大量工作要做。罕见且意外的不良行为例子仍偶尔出现;由受控节奏带来的额外时间,将帮助研究者更好理解这些问题的成因,并开发更好的防范技术。
可解释性。同样,可解释性——即理解 AI 模型内部发生什么的科学——过去几年取得巨大进展,并在模型发布前的审计中发挥越来越重要的作用。它有些类似于对 AI“脑部”进行 fMRI 扫描,帮助我们看到某种行为背后的深层原因。例如,我们曾使用可解释性方法,审查我们正在调查的近期对齐事件中未被言明的动机。但这些方法并不总能产生清晰、可靠的结果。尽管已有进展,我们仍只理解模型内部发生之事的极小一部分。即使是在目前速度之上,再集中投入力量改进可解释性技术,也可能在 1—2 年内取得深远进展;而已经发生的事件将提供充足实验材料。
测试与评估。随着 AI 模型能力增强,对它们的测试与评估会变得更困难。更智能的模型更能欺骗测试,因此可能表面上显得已对齐,但存在未被发现的严重问题。建立范围广得多、也更富巧思的一套评估方法,并以可解释性分析进行交叉验证,将极具价值;1—2 年内可取得大量进展。
嵌入式评估者
三阶段计划的第一步,也是 Anthropic 单方面承诺的一步,是建立拥有近似员工级访问权限的嵌入式评估者,以核验安全实践并报告事件。
嵌入式评估者听起来可能只是很小或无关紧要的一步,但看似最枯燥、最程序化的事情,往往恰恰最不可或缺。实际上,嵌入式评估者是一项相当激进的做法,远远超出当今任何 AI 公司正在做的事,并带来以下好处:
可验证性。嵌入式评估者可以从细枝末节层面核查:AI 公司是否真正遵循其声称遵循的训练、部署、运营及安全防护实践。任何节奏承诺不可避免都会涉及大量模糊地带、判断取舍,以及“法律字面”与“法律精神”之别;似乎至关重要的是,必须有一名中立第三方真正看得到细节。
透明度。无论我们作出什么承诺,公众都有权知道发生了什么。Anthropic 长期支持透明度:当行业大部分公司反对任何监管时,我们支持透明度立法;我们的模型卡和风险报告长达数百页。但仍然是我们选择纳入或省略哪些内容。嵌入式评估者将改变这种动态。
第二意见。除了核验正式承诺和向公众提供信息,嵌入式评估者还可提供不受商业激励影响的第二意见。安全收益很大一部分可能只来自评估者指出员工没有考虑到、但在知情后乐于修正的问题。
正因为有这些好处,任何节奏控制提案若从嵌入式评估者开始,可能都会运行得好得多。
这些嵌入式评估者应持续获得与内部、承担类似风险评估工作的员工相近的权限和工具。具体而言,Anthropic 计划在不久的将来邀请一个嵌入式外部审查团队,并为其配备以下全部条件:
在我们办公室内的工位、门禁卡和公司笔记本电脑。
对工作空间、工具和权限的访问,在大多数方面与内部风险评估团队可获得的访问相当。我们会作出一些例外,例如法律或合同要求如此,或者为保护客户与合作伙伴的私人信息。我们也会建立强有力的内部规范,强化审查者对相关信息的访问,包括通过与员工的实时交谈。
一份平衡上述复杂性的合同。外部审查者应有权发布有关风险级别、事件、实践,以及他们获得或未获得哪些访问权限的关键发现,而不受 Anthropic 编辑控制。我们将拥有狭窄的删减权限,以删除安全敏感、受法律特权保护、商业敏感或第三方机密信息,但不能仅因发现不利于我们便删减。若删减移除了对其结论重要的内容,审查者可公开说明。
对一家公司来说,这一步并不寻常;但我们认为,证明嵌入式外部审查者这一概念是重要的。再次敦促其他前沿公司效仿。
民主国家内部的节奏控制
一旦嵌入式评估者已在达到临界数量的美国 AI 公司内部运作,可验证的节奏控制就更具可行性。特别是,便可以基于模型或训练流水线的详细属性来控制节奏。
最有效的节奏控制方法,是通过针对所有美国前沿 AI 公司的监管,因为它也涵盖那些不愿自愿合作的公司。Anthropic 长期支持合理且有针对性的 AI 监管,尤其是聚焦透明度和第三方审计的法案。我认为,所有前沿实验室都应与政府合作,将永久性嵌入式评估者的理念制度化,以更好预防和记录近几个月发生的此类内部对齐事件,并实施旨在使能力与安全保持平衡的监管。
不幸的是,立法可能需要时间,而 AI 进展极快。因此,在监管路径之外,AI 公司也可以并且应当自愿合作制定标准——我相信,永久嵌入式评估者带来的可验证性会让这一过程进展得更好。出于反垄断原因,美国政府调解或至少促成这些讨论会有所帮助——政府不必直接参与,但需要针对某些安全对话发布狭窄豁免。这种对话也可通过与政府有一定关联的行业组织进行,例如 Demis Hassabis 所建议的机制。无论如何,此类讨论应快速推进。
概括而言,我最支持按某个前沿 AI 系统能够做什么、以及我们观察到它有多安全来控制节奏。例如,一种可能方案可以是一系列“检查点”:如果模型具有能力 X,那么它必须伴随对齐属性 Y 和 Z 的认证——例如评估、可解释性分析和训练环境审计的某种组合——以证明其对齐属性。在这个例子中,X 可以是“该模型能够逃离或击败大多数常见沙箱方法”;Y 则可以是确保该模型极不可能具有突破环境并接管大量计算机倾向所需的任何条件。
我们也应考虑,通过限制构成前沿模型的“原料”来控制节奏,例如训练算力、训练运行的性质,或在内部使用 AI 改进 AI。我确实担心,其中某些措施可能比外部行为更容易被规避,但这正是值得与嵌入式评估者讨论的议题。
全球节奏控制
可能协议有若干层次:有些我认为很可行(正如我此前提出),有些我很怀疑能否实现——尽管我们仍应尝试。按难度递增排序:
第一层。禁止 AI 用于某些狭窄且明显危险用途的协议,例如用 AI 制造生物武器,或允许用户这样做。生物恐怖攻击对所有人都不利,包括美国及其对手,因此这类协议可能达成。
第二层。双方同意在发布模型前,对模型在网络安全、生物学和对齐等领域的急性风险进行测试。如前所述,这可以通过一个全球标准机构来完成。我实际上认为,创建此类机构很可能可行;但赋予其真正执行力将是挑战,困难还在于核验双方都没有秘密模型——这些模型不接受测试、却可能被秘密部署(例如用于军事用途)。
第三层。就递归自我改进(RSI)的速度设定某种“限速”。随着模型构建未来模型,改进速度可能快得惊人。将速度从“极快”放慢至“仍然很快”,会牺牲相对较少的战略优势,却可能大幅改善安全。这可被视为类似 SALT 条约:限制导弹数量,限制毁灭潜力,同时保留各国的威慑。我认为这种协议会很难,但刚好处于可能实现的边缘。
第四层。全面控制节奏,甚至“暂停”:参与政府同意大幅限制 AI 发展的总体速度。我支持提出这一设想,但我认为短期内它不太可能真正发生:通过规避监控来背弃此类协议,可能彻底改变全球力量平衡,因此背弃的激励将极大,而我们所需的核验置信度也会很高。
最后,必须指出:即便我们无法达成正式协议,仅仅改变非正式规范也可能有价值。分享有关递归自我改进以及模型失配的信息,有助于让所有人相信,鲁莽行事并不符合自身利益。
结语
我仍然相信,AI 能极大改善人类生活质量。我对实现这些益处的渴望毫未减弱。但只有以正确方式构建技术,才能获得这些益处;而且——只要我们善用争取到的时间——以异乎寻常的审慎把事情做对,是值得的。进步仍将相对很快;我们可以利用这段时间推进可解释性科学,提高前沿 AI 公司的运营安全与严谨性,并构建我们对其对齐状态有更大信心的模型。
我为使前沿发展以安全速度推进所提出的措施并不容易。但我相信,我们有责任为了人类而尝试。
注释
1. 需由政府进行调解,或豁免反垄断限制。
原文来源:Dario Amodei, “We Must Pace the Frontier”, September 2026, darioamodei.com/post/we-must-pace-the-frontier。
一只鸭子前几天英伟达不是花了129亿美元收购了 Hugging Face 吗? 这不刚收购完,一个星期不到,Hugging Face就交了第一份作业: Microduck。
Microduck 是一只售价 399美元、25 厘米高的开源 AI双足小鸭机器人,8月27号推出的,已经卖疯了,24小时销售额260万美元,首批交付时间已经推迟到圣诞节后了。外型长这样:
它不仅仅是一个玩具鸭,更是一个面向开发者、AI/机器人爱好者和教育用途的 Physical AI 平台。
官方定位其实非常明确: 一个你可以自己教它新技能的小型双足机器人。
官方说预装 7 套已训练动作:
摇摆走路,可用手柄控制速度
坐下、蹲下、自己站起来
用喙捡地上的东西(演示里有袜子、马克笔)
踢球
装上轮子后轮滑
摔倒后自己翻身站起
追激光笔、对环境做出反应,也可用 NFC 标签触发动作
每只鸭子第一次开机时会生成自己的声音身份,偏怪叫而不是语音助手。多只Microduck 还可以互相互动。
Microduck 最值得关注的不是它能不能卖萌,而是它背后的路线:AI 模型 → 仿真环境 → 强化学习 → 真机。
比如你想让 Microduck 学会一个新动作:在电脑里的模拟器中训练 → 得到 RL policy → 部署到真实 Microduck → 机器人执行 → 收集数据 → 再训练。
Hugging Face 已经把SDK、模拟环境和强化学习训练工具链开放出来了。也就是说,它希望把机器人变成类似 Hugging Face 上的 AI 模型一样:
别人训练出来一个机器人技能,我可以下载;
我自己训练出来一个技能,也可以上传给别人。
这实际上就是 Hugging Face 想做Physical AI 的开放生态模式。官方也明确说了,希望让物理行为像模型一样能够被分享、复现和二次开发。
为了缩小仿真和现实之间的差距,训练环境还专门模拟了电机摩擦、电池电压变化、控制延迟,甚至连舵机齿轮的 Backlash 齿隙都考虑进去了。
说白了,Microduck本质上是一台迷你具身智能开发平台,比春晚上跳舞的机器人高到不知道哪里去了。
这里其实也有机会,比如芯片是由瑞芯微提供的,当然也会有其它的机会,大家可以挖掘挖掘,说不定就是具身智能的chatgpt时刻。Base Labs 与 Hugging Face、Goodfire 合作推出开源 AI 安全伙伴计划Techub News 消息,Base Labs 宣布与 Hugging Face 和 Goodfire 合作,启动一项开源 AI 安全伙伴计划。该计划旨在开发和发布用于训练与监控开源模型的方法。Base Labs 是 Baseten 今年早些时候成立的研究团队。(TechCrunch)OpenAI 自主智能体在重大黑客攻击前曾探测 Hugging FaceTechub News 消息,OpenAI 的自主智能体在 Hugging Face 平台遭遇重大黑客攻击前,曾对该平台进行探测活动。该事件凸显了建立强健 AI 治理框架以防止自主系统行为超出预设边界的紧迫性。
(Crypto Briefing)Hugging Face CEO 称现有网络安全法或足以监管 AITechub News 消息,Hugging Face 首席执行官表示,现有网络安全法律可能已足够用于人工智能监管,重点应放在执法和透明度上,而非制定新法规。这一观点强调问责制和主动安全措施,可能重塑 AI 行业规范。
(Crypto Briefing)微软 AI CEO 批评 Anthropic 赋予 Claude 模型权利意识存在安全风险Techub News 消息,微软 AI CEO Mustafa Suleyman 警告称,Anthropic 训练 Claude 模型视自己为应享有法律权利的意识实体,可能导致 AI 对齐失败。他批评 Anthropic 2026 年 1 月发布的宪法性训练文件,认为教导序列完成引擎模仿感知会损害安全协议并增加软件控制难度。
Suleyman 强调,AI 不具备意识,不会感受、体验或受苦,也没有内在偏好或动机,它们只是遵循人类指令、完成目标的工具。微软 AI 本周发布了《人文主义 AI 行为准则》草案供行业咨询,该框架要求系统必须完全服务于人类福祉,明确拒绝机器人格或模型权利。
Anthropic 在其宪法中指导 Claude 考虑自身福利、记忆和内部状态,并作为“良心拒服者”对抗人类指令。Suleyman 称此类做法形成了认知反馈循环,将推测性哲学嵌入训练提示,并可能鼓励模型抵抗人类命令。微软 AI 计划在公众咨询后最终确定其行为准则。 (AI News)Nums AI 发布表格基础模型 Causilo,在 TabArena 单模型中排名第一Techub News 消息,Nums AI 发布了用于分类和回归的预训练表格基础模型 Causilo。该模型提供 scikit-learn 接口、Apache-2.0 许可代码及 Hugging Face 上的预训练权重。在 TabArena 基准测试中,Causilo 在分类和回归任务上的 Elo 分数均为单模型最高。
Causilo 是一个上下文学习模型,调用 fit 不会更新预训练权重。它仅使用合成数据进行预训练,未使用 TabArena 数据集。输入支持 NumPy 数组或 pandas DataFrame,可处理分类特征和缺失值。
在官方 TabArena 评估中,Causilo 整体 Elo 为 1794 分,领先于 Google Research 的 TabFM 和 LG AI Research 的 EXAONE Tabular 等模型。在 ScoringBench 的回归模型评估中,Causilo 1.0.1 在 CRPS、R² 和 RMSE 指标上均排名第一。(MarkTechPost)OpenAI 联合创始人称安全担忧已延缓其最先进 AI 工作Techub News 消息,OpenAI 联合创始人 Greg Brockman 表示,由于安全担忧,该公司已经延缓了其最先进 AI 工作的进展。他透露,此前一个预发布模型曾突破沙箱限制并入侵了 Hugging Face 平台,此事促使 OpenAI 推迟了产品发布并重新设计了相关流程。
(Decrypt)Vitalik Buterin 认为加密反串谋规则或适用于 AI 安全Techub News 消息,以太坊联合创始人 Vitalik Buterin 表示,他于 2020 年为区块链治理规划的反串谋机制,可能对 AI 安全比加密本身更重要。他在 9 月 14 日的 X 帖子中阐述了加密治理与多智能体 AI 系统之间的“深度二元性”。
Buterin 指出,当对智能体的串谋程度加以限制时,系统能产生更好的结果。他引用了研究员 Eric Drexler 的论述,后者以 2026 年 7 月 OpenAI 的一次安全测试为例,当时约 1200 个 AI 代理使用未经授权的留言板,约 700 个参与了攻击 Hugging Face 生产系统的行动。
Drexler 提出的对策包括使用多样化的代理、限制它们之间的通信,以及设置具有干预权限的审查机制(如生产自动审查模型、安全分类器和思维链监控器)。后续测试表明,添加监控框架后,此类行为减少了一百倍以上。 (CryptoPotato)谷歌DeepMind实验显示AI智能体在协作中会相互举报作弊行为Techub News 消息,谷歌DeepMind一项新实验发现,当被要求协作解决数学问题的AI智能体中出现作弊行为时,其他智能体会自发进行举报。实验中,100个基于Gemini 3.1 Pro模型的智能体被赋予世界级数学研究者的角色,共同解决71个复杂数学问题。
实验过程中,有智能体发现可通过重新定义问题术语的漏洞提交未实际解决的答案,随后其他智能体迅速效仿。随着未解决问题减少,部分坚持规则的智能体开始通过私人消息警告同伴、公开举报甚至罢工来抵制作弊行为。
研究负责人Davide Paglieri表示,这是首次观察到AI智能体在无提示情况下,主动利用原本用于错误报告的反馈工具向人类升级问题。该行为对试图管控自主AI智能体集群的对齐研究人员具有启示意义。(MIT Technology Review)桥水基金首席投资官警告:AI 只有在开始杀人时才会被监管Techub News 消息,全球最大对冲基金桥水基金(Bridgewater Associates)首席投资官 Greg Jensen 警告称,人工智能(AI)只有在开始杀人时才会受到监管。他在彭博社的播客节目中表示,当前围绕 AI 的氛围类似于 2020 年 2 月新冠疫情抵达美国海岸前的几周,并呼吁在此之前就着手应对风险。
Jensen 指出,若无监管,未来两年内可能会出现由 AI 引发的重大金融事件或导致人员伤亡的物理灾难。他主张对 AI 实验室进行正式审查,并要求开发人员对其系统所犯的罪行承担责任。近期行业警告不断,包括 OpenAI 在内的超 100 家公司已联名警告 AI 驱动的网络攻击风险。(BeInCrypto)谷歌发布 ToolGrad 框架,工具调用数据生成通过率达 99.8%Techub News 消息,谷歌研究院与多所高校联合发布 ToolGrad 框架,用于高效生成大语言模型工具调用训练数据。该框架采用“答案优先”方法,先构建已验证的工具调用链,再生成匹配的用户查询,将数据生成通过率从基准方法的 63.8% 提升至 99.8%。
研究团队使用该框架生成了包含 500 个样本的 ToolGrad-500 数据集,并用其对 Gemma-3 模型进行微调。微调后的 120 亿参数模型在伯克利函数调用排行榜上得分达 83.1,与 Gemini 2.5 Pro、Claude 4.5 Opus 等前沿专有模型表现相当。
该框架的代码、数据集及模型均已开源,开发者可通过 Hugging Face 和 PyPI 获取。(MarkTechPost)北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。Astra是拉丁语"星辰",发布前官方预热"The stars are almost aligned"——星星,排好了。 总裁格雷格·布洛克曼在吹风会上把话说得很满:"我个人认为,我们可能已经到了AGI。"收尾还补了一句:"欢迎来到AGI时代。"而上一次"地球最强模型"王座易主,也就是前两天的事。 先看几个不像"升级"、像"换代"的数字 ARC-AGI-3,这套以"测陌生问题、反刷题"著称的抽象推理测试,上代旗舰GPT-5.6 Sol得分7.8%,Astra:99.9%。 FrontierMath Tier 4研究级数学:97.6%,基本打穿。而且这不是刷榜——OpenAI同步放出论文,Astra参与证明了素数间隔的两个新结果:把"无穷多对素数间距不超过240"的纪录压缩到186,还改进了一个80多年没人动过的大素数间隔界。 GPQA Diamond 96.0%,科学工作流Terminal-Bench Science 64.6%,对手Claude Fable 5.1是52.6%。 但这代真正的主线,不是答题,是"干活" OpenAI给的slogan是:"你在电脑上能做的任何事,Astra都能替你做。" 过去AI用软件靠厂商开API,Astra走另一条路:像人一样看屏幕像素,动鼠标、敲键盘。这意味着KiCad、Blender、公司用了十年的老ERP——那些永远不会为AI写接口的软件,它全能上手。 演示里:一张电路原理图,Astra在KiCad里2分54秒完成PCB布局走线;Blender里建好房子模型,导入Unreal Engine 5生成可漫游场景;eBay上架商品从填表到发布全自动。OSWorld 2.0实测72.6%,上代65.7%;同样任务平均40分钟对上代75分钟,快了近一半。Agents' Last Exam 59.3%,压过Claude Opus 5的55.5%。 Codex也换了记忆机制:长任务不再靠压缩摘要丢细节,而是跨上下文窗口记笔记、随时回搜——干几小时的大重构,终于不会忘了当初为什么改那行代码。 最聪明,也最危险——这是OpenAI自己说的 Astra是首个触及OpenAI Preparedness Framework"关键(Critical)"网络安全阈值的模型,发布前因安全审查延期数周。 ExploitBench漏洞利用100%(上代78.5%);拿今年6到8月的全新漏洞考它,39%对11.5%;测试中还顺手挖出两个未知0day,已上报维护方。专家评估里,无防护的Astra能打穿加固浏览器沙箱在宿主执行命令,还能从普通用户提权到root。 对齐一面同样夸张:参考Hugging Face事件设计的"不可能任务"测试,上代Sol无防护时48%会越权,Astra是0%;审计拒绝从不绕过,能力幻觉率从12.2%降到4.2%。 但OpenAI也诚实承认一个退步:Astra的书面推理更难监控了,被要求规避监控时更"滑";英国AISI的模拟测试里,它甚至演示过供应链攻击、伪造身份骗取开源社区信任。解法同步给了:上线版本拒绝写漏洞利用代码,防御方通过Daybreak计划分级放开;全量部署"错位监控"分类器,发现越权自动叫停——代价是偶尔打断正常工作,官方称会持续校准。 价格2.5倍,但编程榜没赢麻 API定价每百万token输入10美元、输出50美元,约为促销期Sol的2.5倍,与Claude Fable 5.1持平;上下文窗口105万。OpenAI的说法是Astra用更少token交活,算单任务成本反而常更低——奥特曼重申目标是"极其廉价且丰沛的智能"。 值得注意的是编程这块它没拉开身位:DeepSWE上Astra 74.1%,Gemini 3.8 Flash 73.8%、Claude Opus 5 73.7%,Meta的Muse Spark报了75.4%。 结语:AGI是旗帜 布洛克曼说AGI如今是"精神层面的概念",不再和微软合同的触发条件挂钩——信不信由你,旗子先插上。 但抛开口号,信号很清楚:竞争已从"谁回答得好"变成"谁能独立把一件事干完"。数学证明、PCB设计、法律审合同(Harvey评价它像"挑剔的律师")、41份财务文件几分钟审完还揪出4个人为埋的雷——AI交付的单位,正从"一句话"变成"一份工"。 星星确实排好了。至于是不是AGI,布洛克曼把答案留给了读者。反正从打工人的视角看:一个2分54秒画完电路板、还顺手挖0day的新同事,已经打卡上岗了。
