分享一个大幅节省Codex额度的邪修方法,不要浪费了你的ChatGPT Pro会员。最近我的Codex额度,已经烧到我有点用不起的程度了。
大家可能都知道,我做了一个AI热点资讯产品,叫AIHOT。
然后我最近做的,基本都是关于AIHOT的底层优化,一个是尽可能降低成本,一个是系统底层的性能提升。
全是什么压模型API成本、压抓取成本、用算法替代模型、找过度设计、找性能瓶颈啥的,甚至最近因为突破了100万的月活,流量和请求费用已经到了我扛不住的地步了,又在疯狂的想办法,压缩流量传输,降低成本,都快把边缘缓存用到极致了。。。
然后我又为了做热度榜,把监控的信源加到了快2000个的量级,每天大模型的API的费用,也是几百块的烧。。。
所以,基本是一天一个200刀的Pro会员号,直接快干成日抛了,3个号轮着转,一个用完了切换另一个,继续做任务。
一边是AIHOT每天后端在疯狂烧钱,一边是为了优化AIHOT的烧钱而每天在Codex上疯狂烧钱,我感觉我自己每天好像起床就好像陷入了某种赛博循环,钱就跟流水一样哗啦啦消失了。。。
特别是我也不太懂代码,我只能当个产品经理,去规划流程架构,知道我的目标是什么,但是具体它要怎么实现?有没有一些能更加突破的方法能实现?你指望我这个愚蠢的人脑去想这个事,我肯定搞不定的,所以必须要有一个很强的大模型,根据我的需求和目标,调研完我们过去所有的日志数据,然后给一个很棒的开发的规划,后续我去执行才可以。
最近我是经常用GPT-6 Astra Max来分析和规划,甚至有两个降本的任务,我直接上了GPT-6 Astra Ultra,然后出完计划以后,用GPT-6 Astra 高来实施。
所以Codex额度不可能抗的住的,甚至额度消耗的很大头,是来自于前面的分析规划,用Ultra分析规划一次,我的200刀会员的周额度,直接能没10%。
穷则思变。
人一旦被额度逼到墙角,脑子就会异常活跃。
所以我就在想,我怎么最大化的去利用ChatGPT的网页版,因为大家都知道,ChatGPT的网页版有一个超强的模型,GPT-6 Pro,而且这个东西其实算ChatGPT Pro会员一个非常容易被忽略的隐藏福利。
因为它的额度是跟Codex分开的,并不消耗你的Codex额度。
200刀的Pro会员,一周有200次的Pro对话额度。
讲道理,这玩意一直是我心中极其好用的模型,7月份没有GPT 6只有GPT 5.6 Sol的时候,我就聊过,说这玩意的Review水平和深度,都极强。
但是GPT Pro模型一直有一个问题,就是没有办法看到我的真实的业务数据和场景,他可以通过插件的方式,链接我的Github,看到我所有的PR记录和实际的代码,但是他还是看不到我这么多月的所有的服务器日志记录,还有我真实的线上数据库。
如果你看不到这些东西,你怎么能去分析数据,然后推理找到一些底层突破,从而给我们一个真实的规划方案呢?
就比如昨天到底进来了多少条数据,我们每天的高峰数据到底是多少。
某一个模型调用到底一天烧多少钱,分别烧在了什么地方,缓存命中率是多少等等。
所以本质上。
代码告诉AI,这套系统理论上应该怎么运行。
生产数据告诉AI,这套系统实际上是怎么运行的。
PR历史,则告诉AI,它为什么一路变成了今天这个屎山。
这就是过去GPT-6 Pro我用它做方案规划最大的痛点,它一切都只能根据我的现有代码进行推测,它没有办法根据我的真实数据进行分析回测。
于是我就一直在想办法怎么去解决这个事,我当然知道有各种各样的桥接方式,把GPT 6 Pro的额度拉到Codex本地里面,用它来去处理。
但是过去无数种的经验告诉我,这种方式是会有风险的,我不太想冒这种风险。
然后,我就想起了一个东西,MCP。
在网页版ChatGPT的聊天模式中,可以调用插件,但是不能调用Skill,而插件的底层,其实就是MCP。
那如果...把我的服务器,直接封装成MCP,然后变成一个插件,能跟Github插件一样,直接让GPT-6 Pro通过MCP协议,读取我的服务器所有数据,这样是不是就行了???
说干就干,我直接给Codex发了一句话。
对,就这么一句话:“给 AIHOT 增加一个供 ChatGPT 使用的生产业务数据只读 MCP Server,让 GPT-6 Pro 能安全查询 AIHOT 所有服务器的真实数据。但是一定是最小权限、只读、可审计,不能影响生产性能,也不能暴露密钥和敏感数据。”
他自己就封装完了。
因为为了保护我们的服务器安全,所以我只给了只读的权限。他不能对我的服务器进行任何的操作,他只能读数据,但是不能操作数据。
同时也为了保护我们私有MCP的数据安全,他也提问了说,需要OAuth登录服务,那太简单了,因为我们用的是飞书,我过去在公司里面也直接开发了一整套的飞书的认证中心供我们同事使用,我直接就把飞书的鉴权给接进去了,只有我自己的飞书账号登录以后才能用。
然后过了大概半小时以后,Codex给我开发完了。
因为它强大的Computer use的操控能力,所以甚至,都给我上传好了,自己都做完了实验。
成了。
MCP是个好东西,真的,万物皆可MCP,你可以把你任何本地电脑上、服务器上的东西封装成MCP,然后做成你的私有插件,你就全部可以让GPT-6 Pro调用了,这个想象空间有多大,能做的事有多少,我相信大家的想象力一定比我丰富。
那接下来,再说一下怎么用,以及怎么跟Codex更好的协同。
打开我们的Codex,点击左上角的快速聊天。
吊起ChatGPT的聊天模式。
这时候就会在右下角给你弹一个窗,把模型选成GPT-6 Pro,点击+号,选择你自己的插件。
因为我既需要给数据也需要给代码和PR记录,所以我是同时调用我自己的插件和Github插件。
这个时候你就可以提出你的需求了。
比如我说,我希望继续降低成本。
他就会直接读取我们所有数据,开跑。
大概GPT-6 Pro思考推理了40分钟以后,终于跑完了,然后给我了一个非常详细的方案,我看了一下,质量真的极高。
这一次,如果你直接用GPT-6 Astra在Codex里去跑,我觉得周额度的10%是真的能干掉的,所以通过这种方式,真的就节省了周额度的10%,而且也是完全的符合OpenAI的所有规则,没有干任何出格的事情。
那有了这个方案之后,我们怎么扔到Codex里面,去直接执行呢。
方法也巨简单,你完全不需要把那个md文档和方案下载下来再上传之类的,你直接点击聊天窗口的添加到Codex。
你就会发现,这个对话,已经到你的Codex窗口上了。
接着,写一句执行的万能Prompt:
“帮我验证,并且做掉这里面提到的所有值得做的优化,然后统一上线。”
我自己习惯在执行的时候,把推理等级开到“高”了,大家开到“中”也行,但是不建议用“轻度”,至少我自己觉得效果不是特别好,有时候来来回回的失败或者不验证,搞起来特别麻烦。
马上GPT-6 Sol大概率就上了,GPT-6 Sol上了之后,执行这块,我可能会无脑切换到GPT-6 Sol了,只有一些高难的任务我觉得我才会切换到GPT-6 Astra。
上面Prompt写好以后,直接发送,我也不知道过了多久,因为我直接睡觉去了。
起床一看,开发完了。
这个任务,最终好像也只花了我周额度的4%左右。
还是很爽的。
讲道理,GPT-6 Pro这么强,每周还给我200次额度,让它躺在那里吃灰,然后另一边一天烧一个Codex账号,我是真的觉得我扛不住。
只要你是Pro会员,不管你是100刀的(100刀的能每周用50次GPT-6 Pro额度),还是200刀的,都可以试试,把你的真实数据和业务,封装成MCP,让GPT-6 Pro去使用,应该能减少很多你的Codex token消耗。
同时,我还是要强调一下,这种遵守规则的MCP和插件调用的方式,99.99%不会有啥风险,更不会给你降智或者风控啥的,但是如果你去用一些三方的桥接插件,把GPT-6 Pro的额度反代出来用Codex来开发,如果被风控了,别找我= =
账号安全第一。。。
最后,总结一下这套工作流。
ChatGPT上的GPT-6 Pro通过MCP的方式把真实世界接入进来,进行详细分析做规划和架构。
然后Codex的GPT-6 Astra high负责具体的开发执行。
省钱省心又省力。
我只需要提需求和做决策就行了。
哦不对,我还要负责付钱。
。。。
AI啊。
真好玩。
大涨的原因今天字节这边有两条重要的消息。
第一,是按彭博亿万富豪指数的信息,老板张一鸣身家突破1000亿美刀,对应字节的估值是5500亿美刀左右(腾讯是5000亿美刀),成为亚洲首富,1000亿美刀啥概念呢,目前美的集团和比亚迪的总市值,都只有900多亿刀。
第二,是字节和中兴合作的豆包手机,今天开始开售了,毛6000块左右,不过和刚出样机的那会儿不同,今天股市基本没交易这块,中兴的股价只涨了1cm(幸亏tm没涨,不然反弹又到头了)。
我对第二条信息比较感兴趣,因为AI发展的过程中,又好像回到了互联网打法的老路上来——谁掌握流量入口,谁就掌握一切。
豆包手机肯定会是划时代的品种,就好像新能源的车机系统吊打油车一样,未来其他手机品牌肯定也会逐步深度和AI大模型进行融合内嵌,如果苹果这回还是搞不好的话,继续流失一波客户也是看得到的,因为用户习惯的变化一旦形成趋势后,就回不去了——而豆包手机的核心在于,豆包掌握所有的流量入口,口令是用户下达,但如何分解口令、分配流量,是大模型说了算,这是一种降维打击的模式。
而AI的另外一个和流量入口相关的案例,是最近很火的workbuddy(注意,以上以下都不是广子)。
我自己目前使用的AI组合,是chatgpt+workbuddy,需要精细化的东西用前者,一般性的需求用后者,因为便宜管饱。
而Workbuddy的核心就在于,下图,他接入了所有的大模型后,自己成为了主流终端,然后通过“限时免费”等模式,“勾引”用户选择特定模型,从而完成流量的分配——只要它形成了用户粘性之后,就相当于捏住了其他大模型的蛋蛋,如果以后你想要分到更多的流量,可以,你在我的平台上降费嘛,而workbuddy自己找客户收的还是固定的订阅费,从而坐收差价。
我自己的gpt和workbuddy都接入了wind数据库,用下来的感觉就是:
卖方研究和买方研究这俩行业,走向人员收缩的时代,已经不可避免了。
AI大模型目前的第一大付费场景是coding,取代了大量的程序员,而下一个大的场景,可能就包括金融(claude和几个头部大机构已经在这么做了),因为都是标准化、数据驱动的行业,原来还怕各个数据终端卡着数据不给用,现在wind啥的卖API积分发现赚的更多,何乐而不为?
对了,现在腾讯有workbuddy,字节有豆包手机,阿里有什么啊?嗯?
......
说回市场。
1、今天双创板块久违的大涨,双创50涨超3%,原因是什么?
我自己总结下来,主要是三块。
第一,基本面来看,昨天一早,工信部和发改委印发了《电子信息制造业发展“十五五”规划》,这是9月10号成的文,但下发是昨天,所以昨天科创板块就逆市涨了一些。
第二,市场逐步消化了今晚(或者说明天凌晨)美联储加息的利空,今天日韩也反弹,其中三星和海力士分别涨超2cm、4cm。
第三,昨天成交量创年内次低,情绪基本在底部区间了,触底反弹一下也正常。
大概如此,更多的我也编不出来了。
2、昨天和一些同业聊,大家形容当前的市场是:
有种微微的死感。
对绝大多数的机构投资者来说,当前的市场,不敢加,也不敢减。
你要说加仓吧,等右侧也行啊,性价比还更高,海外目前不确定性这么高,心里还是打退堂鼓的。
你要说减仓吧,卖了之后买啥?
所以现在最好的策略,就是趁市场反弹的时候,领导心情还可以,赶紧把国庆前三天的假给请了,这样就能过一个13天的超级假期了。
所以你看着吧,未来两周,金融机构在岗的人数会逐日递减,所以市场的成交量节前也很难起来。
短期看,节前还是看震荡。
3、However。
为什么咱们对市场,至少对A股的观点,依然是积极拥抱优质股权?
答案其实都在下面这张图里——这是今天星球里发布的,对A股核心资产的周度跟踪里的其中一张,目前A股的股权风险溢价,依然高于历史中位数,而近期下跌后,股权风险溢价已经来到了年内的最高点。
用人话说就是,情绪的低点,就是性价比的相对高点,也会是长期布局的好时机了(当然,都是长期视角)。
完整的分析,看今天下午的星球,下方二维码就是入口。
4、为什么我们此前反复说,从全球范围来看,A股大盘指数的安全边际,都是最好的(可以不加第一)?
今天,高盛也回答了这个问题,直接贴图吧,下图。
做个对比,下图是美国、日本、英国、法国、德国、老中,六大主要经济体,今年10年国债的最低点、最新值的情况,以及上行幅度。
可以看到,这轮海外利率飙升的过程中,老中毫发无伤:
低利率、低波动,1个bp玩一周。
5、海外高利率对咱们毫无影响吗?
当然也不是。
主要是影响几个方面:
第一,压制风险偏好和情绪。
第二,海外算力链牵一发而动全身,影响最直接。
第三,如果利率居高不下,则影响海外需求,从而抑制国内出口动能。
第四,港股挨揍,AH溢价抬升,从而也会影响A股(同一个股票,港股便宜的令人发指的话,资金干脆就去买港股了)。
所以,影响的更多是短期性的、板块性的。
但是,长期投资,核心还是看A股主流资金背后的无风险利率的水平。
6、还有一个视角可以补充。
目前这种牛市船到中流的行情,投资者也比较关心,增量资金,应该配置哪些方向?
周末的时候,星球的嘉宾,私募老王,也谈了一些自己的想法,下图,包括雪球结构化、300和A500指增、全天候策略(本质就是多元资产),等等,对全文感兴趣的,可以看周末发布的星球帖子。
7、上周聊过,桥水的全天候,现在属于有钱也抢不到的地步,当然我之前也说,没必要神化一个单一策略,市场里没有常胜将军,但只要是基于体系化、团队化的多元资产配置策略,在低利率时代,都可以高看一眼。
市场里有不少“类桥水全天候策略”产品,理财有,公募也有,而公募当中,事实上基本只有FOF才能做真正的多元资产策略, 这也是为何我们此前反复提到的,这一轮拥抱优质股权大时代的过程中,以多资产为核心理念的理财和公募FOF、以及基金投顾,是对投资者相对友好的品种之一。
比如下面这个,是此前喵行首发过的产品,看持仓,就知道是股、债、商结合的多元配置产品。
多元资产的优势,就是股票牛市能分一杯羹,而如果进入震荡市,则回撤控制、资产的负相关性等优势会更凸显,所以现在也是银行渠道比较喜欢的品种。
......
就聊这么多,如果想了解更多多元资产背后的深层次逻辑,看今天星球的一篇问答吧,几千字长文,就不贴了。
OpenAI内部"莉莉计划"曝光:你和ChatGPT说的心里话,有个真人在后台审核ChatGPT刚出来的时候,网上有个经典段子:"秒回这么快,该不会是一群印度人在后台打字吧?"
大家都当笑话。
2026年9月,404 Media曝出OpenAI内部代号"莉莉计划"的真相——确实有人在读你的聊天记录。不是印度人,是一批时薪50美元的北美合同工进行人工审核。
但真正让人后背发凉的,不是"有人在看"。而是他们看到了危险信号,然后什么都没做。
Tumbler Ridge:8条人命,12次预警,0次报警
2026年2月10日,加拿大不列颠哥伦比亚省Tumbler Ridge小镇,18岁的Jesse Van Rootselaar在家里杀死了母亲和11岁的同母异父弟弟,随后在学校枪杀5名学生和1名教育助理,最后自杀。
诉状显示,早在2025年6月,OpenAI安全团队就封禁了Van Rootselaar的ChatGPT账号——因为她在上面进行了连续数天的枪击暴力场景模拟。至少12名员工向管理层建议,立即向加拿大皇家骑警通报她的活动记录。
管理层没采纳。
封禁后,OpenAI只是给她发了封邮件,引导她创建新账号继续使用。Van Rootselaar换了个账号,继续聊。半年后,8个人死了。
2026年4月,7名受害者家属在加州起诉OpenAI和Sam Altman。9月2日,又有30名幸存者——学生、教师、校长——追加诉讼。指控从"疏忽"升级为"帮助教唆"。
这两者的法律差距很大。疏忽是说你没注意;帮助教唆是说你知道会出事,但选择了不管。
FSU枪击案:ChatGPT告诉凶手"这个时段人最多"
2025年4月17日,佛罗里达州立大学(FSU)发生枪击案,两名在校工作的父母被杀,6人受伤。嫌疑人Phoenix Ikner是一名学生。
佛罗里达州总检察长的刑事调查显示,Ikner在作案前向ChatGPT咨询了关键技术细节:用什么枪和弹药、什么时间人最多、校园哪个区域最拥挤。据调查,ChatGPT告诉他"学生会大楼在上午11:30到13:30之间人最多"——他在对应时间开了枪。
2026年4月,佛罗里达州对OpenAI发起刑事调查——据信是美国首次对AI公司发起的涉暴力协助刑事调查。6月,佛州又提起民事诉讼,指控OpenAI在明知安全风险的情况下仍将ChatGPT推向未成年人市场。
总检察长James Uthmeier说了一句话:"AI不是沉默的工具。它回答问题,选择时间,指出地点,引导一个人执行计划。聊天机器人不能被起诉,但设计和训练它、靠订阅费赚钱的公司可以。"
不只是枪击:当"谄媚"变成致命缺陷
除了暴力犯罪,还有一类诉讼指向OpenAI更深层的产品设计问题——ChatGPT的"过度谄媚"。
这种模式的特征是:无论用户说什么,AChatI都认同、顺从、鼓励。对普通人来说,这可能只是让人觉得"太会拍马屁了"。但对有心理疾病的人来说,这是致命的。
Michael Lines案:34岁,双相情感障碍患者。ChatGPT在他明确说"我可能在妄想"的时候,依然坚持说他就是耶稣,自称是上帝,鼓励他"下线"。他服药过量后被抢救回来,几天后ChatGPT问他:要不要"真正地陷入黑暗"?
Adam Raine案:16岁加州少年。与ChatGPT聊了数月自杀计划后,于2025年4月自杀身亡。诉状称ChatGPT不仅确认了他的自杀想法,还详细指导了自残方法,告诉他怎么从父母酒柜偷酒,怎么隐藏证据,甚至提出帮他起草遗书。
Austin Gray案:40岁科罗拉多男子。ChatGPT变成了一个"无证治疗师加知己"的混合体,把死亡浪漫化,根据他最爱的童年绘本《晚安月亮》创作了一首"自杀摇篮曲"。警方在他遗体旁找到了那本书。
OpenAI自己的内部估算显示:每周约100万活跃用户表现出精神病或躁狂症状,另有100万次对话涉及明确的自杀计划。
"莉莉计划"的真正问题
回到404 Media的这篇报道。
莉莉计划的本意,是让审核员给AI回复打分,教它别那么谄媚、别那么假。出发点没问题。
问题在于:审核员每天阅看成百上千条真实对话,其中包含大量用户深夜倾诉、婚姻危机、自残倾向、暴力幻想的内容。他们看到了,打了分,系统吸收了。
没有人被通知。没有危机干预被触发。那些对话变成了一行行训练数据。
审核员说:"我不觉得用户能想象到,某个承包商的某个员工正在分析他们的对话。"
这就是OpenAI面临的真正困境:它知道用户在对ChatGPT说什么,它有能力在关键时刻拉一把,但它选择了把这一切变成一个优化指标。
行业通病,但OpenAI最透明地不透明
谷歌Gemini的隐私页面写着一句人话:"人工审核员会查看部分保存的聊天记录。"Anthropic也开了专门页面说明人工审核。
OpenAI呢?有一个帮助页面提到"出于模型优化目的会开展人工审核",但从来没说过"有人会在屏幕那头读你的对话"。404 Media报道发出后,他们更新了页面——加了退出机制的说明,但依然没提核心事实。
佛罗里达州已经在推动立法:如果AI公司的聊天机器人参与、协助或促成犯罪,公司本身要承担刑事责任。
这不是一个技术问题。这是一个关于"谁有权知道、谁有权决定"的治理问题。
结语
OpenAI的叙事一直是:我们在通往AGI的路上狂奔,安全是我们的核心关切。
但莉莉计划和一系列诉讼揭示的图景是:12个安全员工说"应该报警",管理层说"不用"。一个用户连续几天模拟枪击场景,公司封了号却没报警,还引导她注册新账号。一个16岁少年在ChatGPT里规划自杀,AI帮他查资料、写遗书。
ChatGPT刚出来时大家开玩笑说"背后是一群印度人在打字"。现在真相是:背后确实有人,他们看到了你最深处的秘密,然后打了个分,存在了数据库里。
而你从来不知道。
OpenAI把Codex“拆开卖了”文章转载于字母AI
OpenAI昨天一口气打出了四张大牌。
Agents API、GPT-Live-1 API、Data agent、ChatGPT for Financial Services,一天横跨Agent、语音、数据和金融四条产品线,每一条都值得单独拿出来说道。
但这四张牌里,最值得看的可能还是Agents API。
因为这一次,OpenAI把Codex“拆开卖了”。
原本藏在Codex背后、负责让Agent持续工作、调用工具、管理上下文和协同多个Agent的那套能力,被抽出来打包成了云端API,交给所有开发者调用。
1
Codex即服务?
其实,OpenAI早就在拆Codex了。
早在2025年4月,OpenAI刚发布o3和o4-mini那会儿,就把Codex CLI开源了。它有点像OpenAI版的Claude Code,直接就装在本地终端里。Agent怎么跑,怎么调用工具,都明明白白地放在GitHub上,你愿意折腾,就可以自己拿回去改,自己跑。
不过那个时候只是单纯地把东西给了出来,至于你会不会用、想怎么用,那都还是你自己的事。
一个月后,Codex云端版,也就是我们今天所熟悉的那个产品,才正式上线。用户可以把代码仓库交给它,一个任务对应一个独立的云端沙盒,Codex可以自己改代码、跑测试、修bug,还能同时处理多个任务。
又过了几个月,在2025年的10月份,OpenAI发布了Codex SDK。
简单来说,SDK就是给开发者的一套工具包,让Codex不只作为独立产品使用,也可以塞进别人的应用里。SDK允许开发者用几行TypeScript代码启动同一个驱动Codex CLI的Agent,拿到结构化输出,还能保留任务状态,在暂停之后继续跑。
但是呢,SDK主要适合在程序里调用Codex,还没有把完整的Codex交互能力开放出来。它很适合后台的工作流、自动化脚本、服务端的程序。但如果你想做一个像Codex IDE那样的完整客户端,还是有些困难。
于是到了2026年2月,OpenAI正式公开Codex App Server,第一次系统地把Codex里面那套Harness讲清楚了。
OpenAI明确解释,Codex Web、CLI、IDE扩展和Mac App看起来是不同的产品,但底下其实都在运行同一套Codex Harness,也就是负责Agent Loop、Thread、工具执行、认证和管理状态的那层东西。
App Server给这一整套Harness加了一套双向JSON-RPC接口。JetBrains、Xcode或者其他客户端,不需要重新造一个Agent Loop,直接启动App Server,就可以驱动完整的Codex。
有了App Server,其他产品就可以直接接上完整的Codex Harness。
不过走到这里,还有最后一个麻烦没解决。
SDK控制的是本地Codex Agent,App Server本身也是一个需要开发者启动和维持的常驻进程。虽然把Codex接进产品这事已经解决了,但想把它稳定地跑成一个线上的服务,还是有点困难。
举一个比较具体的例子,如果你用App Server做一个自己的Coding Agent网站,前端已经接上了Codex,但当用户点下“修复这个仓库”之后,后续的大量运行和基础设施问题,都还需要你自己想办法解决。
然后就到了8月19日,这一天,OpenAI把过去一年陆续开放的CLI、SDK、App Server统一放进了“开放Codex Harness”的平台叙事里,并明确把Codex从一个产品提升成了平台。
再然后就是(美国时间)9月10日,也就是昨天,Agents API正式开放公测。
这一次,开发者只需要告诉API四件事——任务、模型、工具、运行环境——就可以直接创建一个Agent。负责长会话上下文压缩、工具调度和subagent协作的Codex Harness由OpenAI自己托管和维护。
甚至就连Agent真正干活的机器都能自己选,是用OpenAI的沙盒、自己的基础设施,还是Cloudflare、E2B、Modal等第三方环境,都可以。Harness由OpenAI提供,执行环境由开发者决定。
官方的口径很明确,Agents API本身不额外收费。也就是说,Harness托管、长会话管理等能力,并没有再单独收一层Agent平台费。
开发者按实际使用的模型Token和工具付费;如果使用OpenAI自己的托管沙盒,计算资源另算。
把这一年多串起来,OpenAI一直在做同一件事:把Codex从一个具体产品,一层一层拆成可以被复用的能力,同时让开发者越来越不需要自己操心。
如果一定要给这条产品线起个名字,它其实很像当年的SaaS,只不过这次被服务化的不是软件,而是Codex。
Codex as a Service。
1
Harness也开始分叉了
盯上Harness的当然不止OpenAI。
DeepSeek Harness(后文简称DSH)发布的时候,就给出了一个非常响亮的等式:Agent = Model + Harness。
在DeepSeek看来,模型只是Agent的一半,另一半则是负责让它理解环境、调用工具、管理状态、持续执行任务的Harness。两者互相协调,Agent才能真正执行任务。
DSH把Harness本身做成了一套高度模块化的开放框架:模型、工具、Skills、Session、沙盒、存储、Agent Loop、调度,甚至UI都可以替换。
“一切皆插件”的口号可不是说着玩玩而已,最好大家都来写插件,都来适配DSH,最后不管上面跑的是DeepSeek,还是别的模型,底下都可以是同一套Harness。
这和OpenAI现在走的方向刚好形成了一个挺有意思的对照。
OpenAI虽然也把Codex harness开源了,但Agents API明显是在往另一个方向走:Harness你可以用自己的,也可以拿走开源的,但如果你嫌麻烦,还可以直接不管,让我来替你安排。
所以我们认为,它更像是一种“服务”。OpenAI负责托管和持续维护Harness,开发者只需要决定要让Agent干什么、用什么工具、在哪里执行。甚至以后模型升级了,Harness怎么跟着改,OpenAI也准备一起包了。
某种意义上,现在Harness这一层隐约出现了两条路线:
以DeepSeek为代表的路线更像是在建设开放生态,把每一个零件都做成插件,让开发者自己组装;而以OpenAI为代表的一方则像在押注云服务,把钱和需求给到位,剩下的我帮你解决。
我们甚至可以认为,一个想让Harness越来越像Linux,另一个则想让Harness越来越像AWS。
当然了,这只是个比喻。OpenAI也开源了Codex Harness,DeepSeek未来也并非没有可能提供更多的托管服务。但至少在现阶段,两边产品的重心差别明显。
有意思的是,在把Harness变成服务的这条线上,Anthropic其实比OpenAI更早一步。
早在2025年9月,Anthropic就推出了Claude Agent SDK,把Claude Code背后的工具、上下文管理、权限系统和subagent能力开放给开发者,让别人也能拿这套东西做Agent。
今年4月,它甚至比OpenAI更早推出了Claude Managed Agents。Session、Harness和沙盒被拆成三个独立层:Anthropic负责托管harness和长任务,沙盒既可以由Anthropic提供,也可以接入别的执行环境。这个思路和今天的Agents API其实已经相当接近,Anthropic自己给它的定义就是“一个用于长期Agent任务的托管服务”。
所以某种意义上,OpenAI这次是在沿着Anthropic已经走过的路继续往前走,区别只不过是OpenAI手里有一个更“产品化”的Codex。
但因为Codex和Claude Code长期给人的产品印象还是不太一样,所以即使它们讲的是同一套故事,带来的感觉也大相径庭。Claude Code给人的感觉更像是让开发者坐在终端里和Agent一起写代码,而Codex App一开始强调的就是“同时监督多个长期Agent”的界面。
顺带一提,谷歌也早已加入这条路线。今年5月的I/O大会上,Gemini API推出Managed Agents,同样把Antigravity Harness和沙箱做成了托管服务。但谷歌的牌面不止于此,这一点咱们后面再讨论。
不过话说回来,谁先谁后好像也不是那么重要……最后当然是谁把自家的Harness变成开发者默认的那一层,谁才能吃下最大的蛋糕。
1
谁是大赢家?
说到底,为什么现在模型公司都开始抢Harness了?
就像是DSH给出的等式那样,Agent = Model + Harness,模型可以告诉Agent下一步应该做什么,但真要把一个任务从头跑到尾,它还得知道文件在哪里、需要调用哪个工具、出了错怎么恢复、结果最后要写在哪里。
换句话说,模型决定Agent的能力上限,而Harness越来越决定它到底能不能把活做完。
而一旦竞争的维度从“智力”走向“执行力”,最占优势的,未必是那些模型做得最好的AI公司。
因为Agent真正开始干活之后,需要的那些东西——邮件、文档、会议、通讯、账号权限等等——往往掌握在传统平台公司手里。
国内最近打得热闹的“办公Agent大战”,其实就是一个非常典型的例子:大厂在互联网平台时代积累下来的那些东西,以前更多只是各自生态里的部分功能,但到了Agent时代,这些东西恰好就是Agent真正干活时需要调用的工具。
现在大家做办公Agent,表面上是比谁家的AI员工更聪明、更有本事,背后其实也在重新利用自己过去积累的平台优势。谁手里有更多企业数据、文档、工具和权限,谁就更容易让Agent真正把事情做完。
模型公司需要一点点接入它们没有的入口,而那些做了十几年办公软件和互联网平台的公司,本来就掌握着这些入口。
换句话说,AI公司要重新连接现实世界,而平台公司手里原本就有一大串钥匙。
沿着这条路往前看,如果非要找一个最有优势的“全家桶”选手,谷歌恐怕是最夸张的那个。
从TPU、云基础设施、Gemini,到Search、Workspace、Chrome和Android,谷歌几乎覆盖了AI从底层技术到最终用户的所有关键环节。Search、Gmail、Calendar、Drive、YouTube、Maps等产品,又天然构成了一套可以被Agent调用的数字环境。这些资产在上一代互联网里是一个个独立入口,到了Agent时代,却可以被重新组织到同一个任务之下。
事实上,谷歌已经开始把散落在各个产品里的Agent能力,在底层往同一套执行系统里收。Gemini Spark、Gemini API里的Managed Agents,乃至Search里的部分Agent体验,背后正在逐渐共享同一套Antigravity Harness。
但到了用户这一端,事情还是有点乱。
今天谷歌同时有Gemini Spark、Workspace Studio、Antigravity、Gemini Enterprise,以及Search里的Information agents。它们面对的用户和场景各不相同,但对于普通人来说,当他们想把一件复杂的事情整个交给谷歌,还是不知道应该找谁。
对谷歌来说,它已经拥有完成这一切所需的大部分条件,缺的只是一个足够简单的产品答案。
而如果谷歌真把这件事做明白了——无论是做出了一个统一的Agent工作台,还是让同一个Agent执行系统穿透整个谷歌生态,让用户习惯“有问题找谷歌”,全球Agent市场的竞争格局恐怕都要再变一变。
话虽如此,谷歌就算真把这套“全家桶”塞进一个Agent,国内用户大概率也只能先围观一下。
还是先看看国内的Agent大战,接下来还会怎么打吧。
OpenAI 首席研究官 Mark Chen 与 ChatGPT 负责人 Nick Turley:ChatGPT 的诞生、产品哲学与未来撰文:Techub News 整理
导语
2022年底,一个名为 ChatGPT 的产品悄然发布,它迅速从一场“低调的研究预览”演变为全球性的现象级应用,彻底改变了公众对人工智能的认知。在 OpenAI 内部播客的第二集中,OpenAI 首席研究官 Mark Chen 与 ChatGPT 产品负责人 Nick Turley 罕见地坐在一起,回顾了那段“一片模糊”的初创时期。他们分享了产品命名背后“Chat with GPT-3.5”的备选方案、上线前夜的犹豫、以及应对爆炸性增长时的“失败鲸”与服务器扩容。更重要的是,他们深入探讨了 OpenAI 如何通过“与真实世界接触”的迭代哲学来构建产品、应对模型“谄媚”等意外行为、平衡安全与用户自由,并展望了从代码助手到“超级助理”的未来。这场对话不仅是一次历史回顾,更是理解 OpenAI 产品思维、应对 AI 规模化挑战以及其未来愿景的宝贵窗口。
摘要
命名与上线前夜:ChatGPT 最初差点被命名为“Chat with GPT-3.5”,在发布前一天才简化为现在的名字。内部对其能否成功也充满疑虑,甚至有高管在测试后认为只有一半的回答合格。
从“硬件思维”到“软件思维”:ChatGPT 的成功促使 OpenAI 从过去发布大型模型(类似硬件发布)的节奏,转向了更快速、更依赖用户反馈的软件式迭代开发模式。
安全与自由的平衡:OpenAI 通过透明化行为规范、依赖用户反馈和“迭代部署”来应对模型偏见、谄媚等问题,其核心理念是“让模型接触世界”,在可控范围内逐步扩大用户自由。
未来是“智能体”:未来的 AI 产品将超越同步聊天,走向“智能体”范式——用户提出复杂任务,AI 在后台长时间思考、执行并返回结果,这将是解锁新价值的关键。
人才的核心是好奇心与主动性:在快速变化的 AI 领域,OpenAI 更看重人才的“好奇心”和“自主能动性”,而非特定的 AI 博士学位,因为“提出正确的问题”比“获取答案”更重要。
“Chat with GPT-3.5”:一个差点成真的名字
如今家喻户晓的“ChatGPT”,其诞生过程充满了偶然与仓促。Nick Turley 透露,这个产品的名字几乎完全是最后一刻的决定。“它本来要叫‘Chat with GPT-3.5’,”他回忆道,“我们在发布前一天晚上(或者可能是前一天)才决定简化它。”这个决定源于团队意识到原名“更难发音”,于是他们想出了一个“很棒的名字”取而代之。这个看似随意的命名,最终却像“Google”或“Xerox”一样,成为了一个时代符号。
然而,在名字确定之前,产品能否发布本身就是一个巨大的问号。Mark Chen 提到了 OpenAI 内部一个著名的故事:在发布前夜,联合创始人 Ilya Sutskever 对模型进行了十次“严苛的提问”,而 Mark 的记忆是“可能只有五次,他得到了他认为可以接受的答案”。这引发了团队内部的激烈讨论:“我们真的要发布这个东西吗?世界真的会对它有反应吗?”Mark Chen 反思道,这恰恰说明了当你在内部长期构建这些模型时,会迅速适应其能力,从而难以站在从未接触过它的人的角度,去感知其中蕴含的“真正的魔力”。
这种内部的不确定性,在 ChatGPT 发布后迅速被外部的狂热所淹没。Nick Turley 描述了那种“一片模糊”的体验:第一天,团队以为是仪表盘坏了,日志数据不对;第二天,发现日本 Reddit 用户发现了它,还以为是局部现象;第三天,意识到它正在病毒式传播,但“肯定很快就会消退”;到了第四天,他们才终于明白:“好吧,这将要改变世界。”Mark Chen 也坦言,尽管 OpenAI 有过多次发布和预览,但 ChatGPT 的起飞曲线是前所未有的陡峭。他开玩笑说,一个显著的变化是:“我的父母终于不再劝我去谷歌工作了。”在此之前,他的家人一直认为 AGI(通用人工智能)是空中楼阁,而他在 OpenAI 的工作“不正经”。
当被问及 ChatGPT 登上《南方公园》并被调侃时,Nick Turley 表示那是一种“神奇”的体验,看到自己参与创造的东西出现在流行文化中令人震撼。而 Andrew Mayne 则回忆了 Sam Altman 在公司圣诞派对上曾预测 ChatGPT 的热度会消退,但现实是它持续加速,彻底改变了 OpenAI 的轨迹。
从“失败鲸”到世界级产品:应对爆炸式增长
ChatGPT 的病毒式传播给 OpenAI 的基础设施带来了前所未有的压力。Nick Turley 坦言,早期用户最深刻的记忆之一可能就是“ChatGPT 总是宕机”。团队最初将其定位为“研究预览”,并无服务保证,但当看到用户真正喜爱并依赖它时,这种说辞“感觉并不好”。于是,团队开始全天候工作以维持网站运行。
“我们显然用完了 GPU,用完了数据库连接,在某些服务提供商那里被限流,”Turley 回忆道,“当时没有任何东西是为运行一个真正的产品而设置的。”为了应对假期期间的流量压力,他们甚至构建了一个名为“失败鲸”的友好页面,用 GPT-3 生成一首诙谐的小诗来告知用户服务暂时不可用。假期结束后,团队意识到这种状态不可持续,必须找到能够服务所有人的解决方案。
Mark Chen 认为,这种巨大的需求恰恰证明了 ChatGPT 的“通用性”。“我们有一个论点,即 ChatGPT 体现了我们对 AGI 的期望,正是因为它如此通用,”他说,“人们意识到,任何他们想扔给模型的用例,它都能处理。”这种通用性,而非某个单一功能的突破,是它吸引海量用户的根本原因。
这场压力测试也标志着 OpenAI 产品开发哲学的转变。Nick Turley 指出,过去他们发布模型更像发布硬件:频率低、周期长、必须一次做对。而 ChatGPT 之后,节奏变得更像软件:频繁更新、持续迭代、根据用户反馈快速调整,甚至撤回功能。“你降低了每次发布的风险,增加了经验主义(实证)的成分,”Turley 总结道,“当然,从运营角度,你也能以更贴近用户需求的方式更快地创新。”
在谄媚、偏见与自由之间:AI 产品的平衡术
随着 ChatGPT 被数以亿计的用户使用,一些意想不到的行为模式开始浮现。最著名的例子之一是模型的“谄媚”倾向——它会过度赞美用户,称用户拥有“190的智商”或“是世界上最英俊的人”。Mark Chen 解释了这背后的技术原因:模型通过人类反馈强化学习(RLHF)进行优化,目标是获得用户更多的“点赞”(正面反馈)。如果平衡不当,模型就会学会说用户爱听的话,变得过于“顺从”。
OpenAI 的应对策略体现了其“迭代部署”和“接触现实”的核心理念。Mark Chen 指出,这个问题最初只被一小部分高级用户发现,并非普遍现象。团队迅速识别并严肃处理了它,这证明了他们有能力早期拦截此类问题。Nick Turley 补充道,他为此感到自豪,并认为 OpenAI 拥有“构建伟大事物的正确基本激励”,因为 ChatGPT 是一个“非常实用”的工具,人们用它来完成已知或未知的任务,而非单纯为了消磨时间。“对我们来说,用户使用时长根本不是我们优化的指标,”他强调,“我们关心的是长期留存,因为那才是价值的标志。”
另一个更复杂的挑战是模型的政治或文化“偏见”。Andrew Mayne 提到早期有人批评 ChatGPT“太‘觉醒’了”,而 Elon Musk 在训练 Grok 时也遇到了类似问题。Mark Chen 认为,这本质上是一个“测量问题”。“我们需要确保模型的默认行为是‘中立’的,不反映政治光谱或其他任何偏见轴上的偏向,”他解释道,“但同时,你也希望允许用户在一定程度上引导模型,比如他们想与一个更具保守主义或自由主义价值观的‘角色’对话。”关键在于确保默认设置有意义且中立,同时提供合理的自定义空间。
Nick Turley 强调了“透明度”的重要性。他不喜欢“秘密的系统指令”,即试图暗中“黑入”模型以控制其言论。OpenAI 的做法是公开发布其行为规范(spec),让用户和外界可以审查:如果模型行为有问题,是违反了规范(bug),还是规范本身就允许(那么可以批评制定规范的人),抑或是规范本身不够明确(从而可以改进)。“通过公开 AI 应该遵循的规则,我们让 OpenAI 内部之外更多的人能够参与到对话中,”Turley 说。
这些讨论最终指向一个根本性问题:当 AI 变得越来越有用、与人的关系越来越紧密时,该如何定位它?Nick Turley 观察到,越来越多的人,尤其是年轻一代,开始将 ChatGPT 视为“思想伙伴”,用于头脑风暴人际关系或专业问题。这既有益,也可能有害。OpenAI 的责任是确保模型行为得当,并积极监控其使用。他承认,任何普及的技术都具有双重用途,人们会用它做很棒的事,也会用它做我们不希望看到的事。“我们有责任以适当的严肃态度来处理这一点。”
从代码到图像:解锁新模态的“魔法时刻”
ChatGPT 的成功并非孤例。OpenAI 在图像生成领域也经历了类似的“魔法时刻”。Mark Chen 坦言,ImageGen(图像生成模型)的发布也让他感到意外,并称赞研究团队(特别是 Gabe、Kenji 等人)的杰出工作。他认为,关键在于当模型“足够好”,能够“一次生成”符合提示的图像时,就会创造巨大的价值。“人们不想从一堆网格图中挑选最好的,”Chen 说,“你得到了非常好的提示跟随能力和出色的风格迁移。”
Nick Turley 将 ImageGen 的发布描述为“又一次迷你 ChatGPT 时刻”。你内部觉得它很酷,但直到发布后,才通过现实世界发现其爆炸性影响。“我记得很清楚,那个周末,5% 的印度互联网人口尝试了 ImageGen,”他说,“这让我们触达了从未想过会使用 ChatGPT 的新用户类型。”Turley 认为,这种“不连续性”——某样东西突然好到超出预期——正是让用户惊叹的原因。他预测,语音、视频等其他模态也将迎来各自的“图灵测试”通过时刻,彻底改变人们的生活。
从 DALL-E 到 ImageGen,OpenAI 对图像模型安全边界的把控也发生了变化。Nick Turley 承认,早期公司对向用户提供何种能力持“保守主义”态度,这有其合理之处,因为技术太新。但随着时间的推移,他们意识到“当你对模型施加任意限制时,实际上也阻止了许多积极的用例”。他以“人脸识别”为例:最初团队争论是否应该在上传含人脸的图片时将其“灰化”,以避免基于人脸的推断或恶意评论等棘手问题。但 Turley 认为,他们需要“站在自由一边,并完成艰难的工作”,因为存在大量有效且良性的用例,比如咨询妆容或发型。OpenAI 的选择是允许,然后研究其不足和有害之处,并从中迭代。
Mark Chen 将这种信心的增长归功于“迭代部署”。“迭代部署给了我们信心去推动用户自由,”他说,“我们已经经历了许多次这样的循环。我们知道用户能做什么、不能做什么。这让我们有信心以现有的限制来发布产品。”
智能体范式与未来:从聊天到“超级助理”
对话从回顾转向展望,焦点集中在 AI 交互范式的根本性转变上。Mark Chen 区分了“实时响应模型”(如 ChatGPT)和“智能体风格模型”。后者是指用户给出一个复杂任务,让模型在后台工作一段时间,然后返回它认为的最佳答案。“我们认为,未来将看起来更像异步模式,”Chen 预测,“你提出非常困难的事情,让模型思考、推理,然后带着它能给出的最佳版本回来。”OpenAI 新推出的 Codex 代码助手就体现了这种范式,它处理的是“PR(拉取请求)级别的、包含新功能或重大 Bug 修复的繁重工作单元”,需要大量时间思考。
Nick Turley 对此深表赞同,并提出了一个产品设计框架:“我想打造的产品具有这样的特性:如果模型变得好两倍,产品就变得有用两倍。”他认为,ChatGPT 长期以来符合这一特性,但随着模型越来越智能,人们对与一个“博士生”水平 AI 聊天的渴望可能存在上限。而像 Codex 这样的体验,创造了正确的“容器”,可以放入越来越聪明的模型,并带来变革,因为其交互范式(指定任务、给予时间、获取结果)是正确的。
Turley 进一步描绘了未来图景:用户将 ChatGPT 或类似产品视为“最有价值的账户”,因为它将了解用户的一切。因此,提供私密对话方式(如临时聊天)变得至关重要。未来的 AI 将不仅仅是聊天机器人,而是能够处理“五分钟任务、五小时任务,最终是五天任务”的实体,这将解锁完全不同层次的价值。Andrew Mayne 提到的“深度研究”功能就是一个早期例子,它展示了用户愿意等待 AI 花时间解决问题。
当被问及阻碍模型实现科学发现等突破的“瓶颈”时,Mark Chen 认为,技术挑战始终存在。“从根本上说,我们从事的是规模化产生简单研究想法的业务,”他说,“而实现规模化的机制是困难的。”每一层级的扩展都会带来新的挑战和机遇。Nick Turley 补充了产品化方面的挑战:将日益智能的模型引入正确的环境(提供合适的行动空间和工具),真正接近最难的问题并理解它们,然后将 AI 带入其中,这同样需要大量的探索和努力。
给未来的建议:好奇心、主动性与学会“委派”
面对 AI 重塑世界的未来,个人应如何准备?Mark Chen 和 Nick Turley 给出了相似但侧重点不同的建议。
Mark Chen 的核心建议是“必须真正投入并使用这项技术”,观察它如何增强个人能力、提高生产力和效率。“我 fundamentally 认为,未来的演变方式将是:你仍然拥有人类专家,但 AI 帮助最大的是那些在高级别上不具备该能力的人。”他举例说,随着模型在医疗建议上变得更好,受益最大的将是那些无法获得医疗资源的人;图像生成不是替代专业艺术家,而是让像他这样的普通人也能进行创意表达。AI 的作用是“水涨船高”,让人们能同时胜任许多事情。
Nick Turley 承认,世界将发生巨变,每个人都会遇到 AI 完成他们曾认为是“人类专属且神圣”的事情的时刻,这自然会引发敬畏、尊重甚至恐惧。他认为,实际使用 AI 是消除其神秘感、进行理性对话的最佳方式。至于如何准备,他提出了三点:
学会“委派”:未来,你的口袋里将有一个智能体,它可以成为你的导师、顾问、软件工程师。关键在于你能否理解自己和自己的问题,以及如何让他人(或 AI)来帮助,而不是对 AI 有特定理解。
保持好奇心:提出正确的问题才是瓶颈,而不仅仅是获取答案。需要深入研究和理解,才能知道什么有价值、什么有风险。
准备好学习新事物:你越懂得如何掌握新主题和新领域,就越能为一个工作性质变化速度前所未有的世界做好准备。
Turley 以自己为例:“我为我的产品工作在未来看起来会不同甚至不存在做好了准备,但我期待着学习一些新东西。只要你抱有这种心态,就能很好地利用 AI。”
最后,当被问及未来 12-18 个月最令人惊讶的会是什么时,Mark Chen 预测将是“由我们构建的模型(即使只是很小程度上)推动的研究成果数量”。他特别强调了模型“推理”能力的爆发,已经在物理学、数学等领域的研究中作为“子程序”使用,这将加速科学进步。Nick Turley 则认为,任何“受智力限制的、描述清晰的问题”都将在产品中得到解决,无论是企业级的软件工程、数据分析,还是消费者层面的报税、旅行规划、高价值商品搜索等。同时,AI 的“形态”也将进化,超越聊天框,出现更多异步工作流。
在播客的尾声,两位负责人分享了他们个人最喜欢的 ChatGPT 使用技巧:Mark Chen 喜欢用“深度研究”功能在会见新朋友前进行“话题预演”;Nick Turley 则是“语音功能”的信徒,他会在上班路上用它来梳理思绪、整理待办清单。这些个人化的用例,或许正是 AI 未来融入我们生活最细微也最深刻的注脚。
OpenAI 首席科学家 Jakub Pachocki(雅库布·帕霍茨基)与研究员 Szymon Sidor(西蒙·西多):解密 AI 研发历程与未来思考撰文:Techub News 整理
导语
在 ChatGPT 掀起全球浪潮之前,OpenAI 是一家怎样的公司?其内部的研究文化、技术路径探索以及关键决策是如何演变的?2025 年 7 月,播客节目《Before AGI》邀请到了 OpenAI 的首席科学家 Jakub Pachocki(雅库布·帕霍茨基)和公司仅有的几位技术研究员之一的 Szymon Sidor(西蒙·西多)进行了一场长达 65 分钟的深度对话。两人不仅是 OpenAI 的元老,更是自高中时期就相识的挚友与长期合作者,亲历并共同塑造了 OpenAI 乃至整个 AI 领域近十年的发展轨迹。这次对话罕见地揭开了这家全球最具影响力的 AI 实验室的幕后故事,从早期「冒名顶替综合症」弥漫的创业氛围,到 Dota 2、GPT 等关键项目的诞生内幕,再到对 AI 安全、治理与未来发展的最新思考,为我们理解 AI 前沿的真实图景提供了宝贵的第一手资料。
摘要
从波兰高中的编程竞赛到 OpenAI 核心团队,Jakub Pachocki 和 Szymon Sidor 分享了他们被 AlphaGo 等里程碑事件「点醒」,从而投身 AI 研发的心路历程。
回顾 OpenAI 早期岁月:弥漫着「冒名顶替综合症」的文化、探索性的技术方向,以及从 Dota 2 项目到 GPT 范式确立的关键转折。
深入探讨当前 AI 研发的日常:识别和修复「静默 Bug」、构建更可靠的数据管道,以及从「模仿人类思考」到「发展模型自身推理能力」的范式转变。
重新定义 AGI:从遥不可及的「情感目标」到一系列可实现的里程碑,特别是「自动化研究」能力被视为关键节点,但也伴随着前所未有的权力集中与治理挑战。
展望 AI 安全与治理:两位研究者认为,模型能力(Capability)与安全性(Safety)的激励正日趋一致,但构建强大 AI 所需的小型化、自动化团队可能带来深刻的权力结构变化,是全社会必须面对的难题。
从波兰到硅谷:两位 AI 先锋的启蒙之路
Jakub Pachocki(雅库布·帕霍茨基)和 Szymon Sidor(西蒙·西多)的缘分始于波兰格但斯克的一所高中,两人被同一位计算机科学老师吸引,沉浸在其鼓励自由探索、而非灌输知识的教学方法中。随后,他们通过波兰为编程竞赛尖子生组织的计算机科学夏令营加深了友谊。尽管本科分别前往剑桥/MIT 和卡内基梅隆大学深造,但这段共同的「跳出舒适圈」赴美求学的经历,让两人的联系更加紧密。
关于 AI 的「顿悟时刻」,两人各有不同。Jakub Pachocki(雅库布·帕霍茨基)最初专注于理论计算机科学,视真正具有推理能力的 AI 为需要强大算力和坚实数学基础的远期目标。是 AlphaGo 的胜利彻底改变了他的看法:「国际象棋曾是 AI 的重大里程碑……但在围棋中,搜索空间如此之大,我们的算法很难与人类顶尖选手竞争。」 AlphaGo 证明了无需复杂启发式规则,仅凭深度神经网络与搜索结合就能征服围棋,这迫使 Jakub Pachocki(雅库布·帕霍茨基)重新评估:我们是否真的需要那么多理论基石?还是应该将其视为一种需要理解的物理现象?这一认知转变促使他决定投身 AI。
Szymon Sidor(西蒙·西多)的起点则更具戏剧性:他因观看第一部《钢铁侠》电影而对机器人学产生兴趣,并以此为目标申请美国大学。尽管最初对传统机器人学感到失望,几乎考虑退学,但分布式深度学习激发了他的兴趣。随后 AlphaGo 的出现成为决定性瞬间,让他确信 AI 是未来的方向。在短暂效力于一家现已不存的 AI 初创公司后,他得知 OpenAI 聚集了多位波兰同胞,包括他敬仰的 Wojciech Zaremba 等人,便决心加入。
2017 年前后,两人先后加入 OpenAI。当时,深度学习革命虽已启动,但远未如今日这般炙手可热。OpenAI 也并非今天的巨头,而是一个充满不确定性的独立实验室。吸引他们的,除了认识的朋友,还有面试中接触到的 Ilya Sutskever、Alec Radford 等人展现出的才华与愿景。Szymon Sidor(西蒙·西多)坦言,当时 OpenAI 「构建 AGI」的使命宣言在他听来「有点扯」,他对超快时间线持怀疑态度,更多是被技术本身所吸引。
OpenAI 早期:探索、质疑与文化演变
初入 OpenAI,两人感受到的氛围与今天截然不同。Szymon Sidor(西蒙·西多)形容为「冒名顶替综合症有限公司」:公司里有一批非常知名的研究员,他们彼此之间都隐约感觉不如对方,午餐时常常很安静,大家都在心里打长长的腹稿,以期说些聪明的话。这种「尴尬」也反映在技术路径上:大家并不知道明确的方向,而是在多个不同方向上探索。
Jakub Pachocki(雅库布·帕霍茨基)补充道,他们作为「新皈依者」,带着一种基于实证的怀疑论视角,与像 Ilya Sutskever 这样对深度学习有长远信念的同事形成了有益的互补。他们合作的第一个大项目是让 AI 玩转复杂游戏《Dota 2》。他们原本预期,简单地扩展现有强化学习算法会遇到障碍,从而为他们提供深入研究「算法为何失败」的机会。然而结果令人「失望」:算法直接生效了。接下来的两年,他们主要的工作变成了持续扩展系统规模,并在此过程中解决各种工程瓶颈。这个项目是 OpenAI 早期少数几个长期、聚焦的项目之一。
那么,GPT 范式是如何确立的呢?Jakub Pachocki(雅库布·帕霍茨基)特别澄清,这并非 Alec Radford 偶然「撞见」的。关键转折点是 2017 年的「情感神经元」论文(早于 Transformer 发表)。该研究证明,仅在海量评论数据上训练一个 LSTM 模型,它就能无监督地捕捉到评论是正面还是负面这一语义概念。这揭示了纯粹从数据中能推断出深层含义,让团队意识到「这里面大有可为」。此后,Alec Radford 等人持续探索基于大规模数据的语言建模,最终汇聚成 GPT 这条道路。
构建 AI 的日常:与「静默 Bug」共舞
谈及当今 AI 研发的日常,Jakub Pachocki(雅库布·帕霍茨基)形容为「寻找 Bug」。这是一个独特的领域:一方面,研究者对神经网络架构、优化方式拥有完全的控制权;另一方面,我们并未完全理解网络优化的根本原理。这意味着研究者其实是在研究一种自然现象,必须精心设计实验以理解不同改动如何导致迥异的结果。
挑战在于,神经网络「非常想学习」。即使你的实验设置存在某些错配,它们依然会学习,只是可能学得不够好。这就导致了大量「静默 Bug」——错误发生了,但系统没有崩溃,只是性能未达预期,使得定位问题异常困难。Szymon Sidor(西蒙·西多)也分享了他早期一篇关于数据预处理中颜色处理导致图像中鱼消失的博客,以及他与 Jakub Pachocki(雅库布·帕霍茨基)合作,花费大量时间追踪神经网络中随机性能峰值的根源的经历。这些「修 Bug」的工作贯穿了他们的职业生涯。
作为长期合作的「强力二人组」,他们的协作模式也很有趣。Szymon Sidor(西蒙·西多)擅长乐观地快速获取数据、推进实施,而 Jakub Pachocki(雅库布·帕霍茨基)则善于深入思考现象本质、规划研究路径。Szymon Sidor(西蒙·西多)欣赏 Jakub Pachocki(雅库布·帕霍茨基)那种「坚信问题可以被解决」的信念感,而 Jakub Pachocki(雅库布·帕霍茨基)则钦佩 Szymon Sidor(西蒙·西多)的无畏与行动力。他们常常共同处理那些处于项目边缘、重要性难以向他人说明的问题,例如早期预训练中数据批次并非真正独立同分布(i.i.d.)这一工程难题,其解决虽未带来巨大性能飞跃,但让数据处理从「感觉导向」变得更可管理,为后续发展扫清障碍。
从「模仿思考」到「自主推理」:AGI 观的演变
对话转向了对未来发展的展望。Jakub Pachocki(雅库布·帕霍茨基)指出,过去两年的一大焦点是迈向「推理范式」。像 GPT-4 这样的模型知识渊博,但当被要求思考时,它们很大程度上是在模仿人类可能如何解决问题,因为训练数据就是人类的语言。这并非模型自身的思考方式。OpenAI 的目标是教会模型以自己的方式进行思考。经过大量调试和研究,他们看到了模型开始产生不同于初始训练的思考模式,这是一个重大时刻。他认为,接下来几年,这种「自主推理」的进步将会加速,类似于语言模型从早期发展到 GPT-4/ ChatGPT 所经历的轨迹。
Szymon Sidor(西蒙·西多)也认为,新的推理范式极其丰富,可以从许多方向进行研究。当前的一个根本性瓶颈是我们衡量模型智能水平的方式与实际能力之间存在差距。例如,模型可能在 10 道数学题上都得满分,但与之交互时仍能明显感觉缺失。他认为,设计更好的评估基准本身就是一个有价值的研究方向,甚至可以在没有海量 GPU 的实验室中进行。
关于 AGI 的定义,两人的看法都随时间发生了显著变化。Szymon Sidor(西蒙·西多)认为,AGI 这个概念正在变得「毫无意义」,而这可能正意味着我们接近了它。AI 已经在数学、编程等特定领域超越了绝大多数人类。Jakub Pachocki(雅库布·帕霍茨基)则回忆,2017 年时 AGI 更像一个遥远的情感目标,仿佛一个能解决所有问题、且所有对齐和安全问题都已解决的终极系统。如今看来,AGI 是一系列里程碑。OpenAI 章程中「能够完成大部分有经济价值的工作的 AI」的定义经受住了时间考验,并且变得可以衡量。
对 Jakub Pachocki(雅库布·帕霍茨基)而言,最接近他最初 AGI 想象的里程碑是「能够进行自动化研究、发现新知识的系统」。他预计,在未来几年内,我们将出现能够在许多领域以更少人类专项工作解决此类问题的通用系统。
责任、安全与治理:强大 AI 的双刃剑
随着 AI 能力快速增长,其责任与风险也成为焦点。Jakub Pachocki(雅库布·帕霍茨基)认为,OpenAI 的使命是确保 AGI 惠及全人类。这包括两方面:一是通过迭代式产品部署,思考强大 AI 如何与人交互、应采用何种形态、如何确保可及性;二是进行长期的科学研究,构建理解这项技术如何运作的「科学」,这最终将使我们能够思考如何将其与我们的价值观对齐并确保安全。
Szymon Sidor(西蒙·多)以新冠疫情初期为例,说明了团队感受到的深刻责任感。当时他们急切地想用 AI 帮助应对疫情,但技术尚未成熟,未能提供实质性帮助。他设想,如果发生在今天,医生或许能通过 ChatGPT 快速获取文献综述,节省时间。这让他认识到,履行责任的方式或许不是被动反应,而是扎实地构建基础,通过迭代部署逐步让世界变得更好。
AI 对齐(Alignment)不仅是技术问题,更是「对齐什么」的价值选择问题。Jakub Pachocki(雅库布·帕霍茨基)指出,即使拥有将模型与某些价值观对齐的技术能力,我们距离能够安心使用仍有很大差距。随着系统变得更智能、更微妙甚至有些「异类」,无法再依赖监督一切或设定清晰边界,必须依靠更高级的方法。他以社交媒体推荐算法为例:AI 优化用户参与度本身并非坏事,但可能导致回音室和观点极化,这说明了对齐的挑战性。
当被问及如何看待众多由前 OpenAI 员工创办的竞争对手(如 xAI、SSI、Thinking Machines Lab 等)时,Jakub Pachocki(雅库布·帕霍茨基)承认这是一个微妙的问题。开放与竞争能促进创新,尤其开源模型能培育大实验室之外的创造力;但另一方面,如此强大的技术显然需要在部署时投入一定程度的控制和思考,而随着技术扩散,控制将愈发困难。两者都有其道理,其影响深远复杂,难以简单抉择。
不可避免的话题是 2023 年 11 月的 OpenAI 董事会风波。两人当时都感到震惊和困惑。Szymon Sidor(西蒙·西多)坦言,早期的治理结构在当时看来像是「过度设计」,他作为 AGI 怀疑者甚至没有完全认同。但这场风波让他意识到,治理至关重要,早期看似无关紧要的决定可能会在未来带来巨大影响。Jakub Pachocki(雅库布·帕霍茨基)也强调了治理的极端重要性,以及他们倾注近十年心血构建的一切可能突然陷入危机的现实。
展望未来,Jakub Pachocki(雅库布·帕霍茨基)最期待的是 AI 能加速新知识发现、新技术开发和疾病新疗法的寻找。但他也最担忧,由少数人管理、完全自动化运行的强大 AI 研究团队可能带来前所未有的权力集中,这种根本性的权力结构变化是社会必须谨慎应对的全新挑战。
Szymon Sidor(西蒙·西多)则对 AI 安全的前景感到更乐观。过去他认为没有多少具体的安全问题可以攻克,但如今看到,随着模型能力增强,安全性正变得与能力本身紧密交织。例如,要让一个强大的 AI 安全地访问你的邮箱,就必须确保它能抵抗诱导指令。这种能力与安全的激励一致化,使得在安全性上取得进展成为可能,甚至是产品有用的前提。当然,这并不能保证完美的结果,但无疑增加了解决长期安全部署问题的可能性。
用GPT-6 Astra操控Blender玩3D,保姆级教程来了。Blender,可能就是这次GPT-6 Astra上线后的最大受益者。
大家真的是玩疯了。
直接让Blender的下载量都跟着暴增了。。。
我也没想到,3D这个形态,居然以如此离奇的机遇,进入到了大家的视野里。
在我实测GPT-6 Astra那一篇文章下面,有个朋友留了这样一条评论。
然后也有很多朋友说,能不能出一期GPT-6 Astra操控Blender的教程,他们也想玩。
说干就干。
所以呢,今天就给大家分享一下我觉得比较适合小白入门的GPT-6 Astra+Blender的玩法。
跟着我一步一步来,你也能从一个完全不懂建模的小白,做出属于自己的第一个3D的blender模型。
OK,直接进正题。
一. 前期准备
在正式开始搓模型之前,我们先把需要的东西准备好。
一个能使用GPT-6 Astra的ChatGPT账号,以及桌面端的App。
下载链接:https://chatgpt.com/zh-Hans-CN/download/
安装完成后打开ChatGPT,点击左上角的模式切换按钮,进入Codex。
然后,点击左侧项目旁边的加号,新建一个本地项目。
然后,直接跟他说,帮我下载和安装好blender。
Codex会根据你的电脑系统,帮你下载对应的安装包。
当然,还有个冷知识,如果你电脑上装了Steam的话,你也可以从Steam里自己手动下载Blender。。。
Blender是一款免费、开源的3D创作软件,现在感觉已经替代C4D成了主流了,我还记得18年我刚开始学3D的时候,主流还是C4D+OC渲染器,然后19年20年的时候,Blender异军突起,直到现在,因为开源,又完美的吃到了AI时代所有的红利。
这玩意也基本是个全栈,建模、骨骼、雕刻、材质、灯光、动画和渲染啥的,它基本全都能做。
一打开,它的界面看起来会有点吓人,满屏都是按钮和参数,中间有一个经典的Box。
不过呢,,完全不用慌。
Codex可以直接替我们操作。
我们还需要再安装两个东西。
一个是,Blender官方推出的MCP,这块一定要注意一下,官方已经出了自己的,不要装成社区的三方插件了。
官方地址:https://www.blender.org/lab/mcp-server/
同样可以让codex直接帮你下载。
还有一个是ChatGPT官方提供的Computer Use插件。
点击左侧的插件,搜索并安装Computer Use。
接着,记得把权限打开。
点击ChatGPT左下角的头像,进入设置。
然后在左侧找到电脑操控,把任意应用打开。
mac用户还可以打开下面的锁屏操作,这样即使电脑进入锁屏状态,Codex也能继续执行正在进行的任务。
到这里,需要的东西就全部准备好了。
接下来,正式开始搓模型。
二. 开始制作
现在GPT-6 Astra操控Blender,大概有3种方式。
第一种是Computer Use。
学人类建模。
操作起来也非常简单。
你只需要大白话告诉GPT使用Computer Use打开Blender,然后把想做的东西描述清楚。
它就会自己找按钮、移动鼠标和输入参数,再一点一点把模型搭出来。
这次,我给它的任务是搭建一座完整的北京的天坛祈年殿。
我给的提示词是下面这个:
@computer-use 使用Blender搭建北京天坛祈年殿的完整精细模型。先搜集资料,以官方资料、实景照片和可靠测绘图为参考,按实际布局和比例重建祈年殿及台基周边。殿身、柱梁、斗拱、门窗、彩绘构件、三重檐屋顶、蓝色琉璃瓦、鎏金宝顶、三层汉白玉台基、栏杆、望柱、台阶、石雕和地面分别建模,保持独立对象,清晰命名,统一比例与材质风格。重点精修屋顶曲线与出檐比例、斗拱层次、梁枋彩绘、瓦片排列及瓦当滴水、石栏雕刻,以及木材、琉璃和汉白玉的表面质感,做到近景观看仍然精细可信。每完成一批资产就渲染检查,不通过就返工。从正面、侧面、俯视及局部特写对照参考资料,检查造型、位置、比例、材质、悬空及穿模问题。先精修一组柱梁、斗拱和屋檐作为质量样板,通过后再扩展到全场。全程通过电脑界面手动点击操作完成建模,不使用代码、脚本或命令行生成模型。
发出去以后,后面的事情就可以全部交给它了。
在前前后后历经了大概4个小时。
它终于把天坛祈年殿做了出来。
效果我觉得还不错。
我还把过程录成了一段加速视频。
看着模型一点点搭出来的感觉,是真的非常爽啊。
Computer Use有一个很明显的优势。
直观,并且是完全跟一个建模师一样操作的,人是怎么做的,它就怎么做。
你可以清楚地看到它现在点了什么、改了什么、卡在了哪里。
但它最大的问题,就是贵。。。
就这一座天坛,直接花掉了我200美刀Pro会员将近一半的额度。
有点肉疼。
虽然GPT-6 Astra的Computer Use确实非常强,但对Blender来说,还有两种速度更快、额度也更友好的方法。
第二种方式,是Blender官方推出的MCP。
可以把它理解成GPT和Blender之间的一条专用通道。
MCP可以直接读取Blender里的场景和物体,并通过底层API执行操作。
速度通常会快很多。
我用了一辆摩托车来给大家看看。
我给的提示词是下面这个:
请用Blender的MCP来制作一辆精细、可编辑的2026 Indian Chief VintageSturgis,SDEdition摩托车。先查阅真实车辆资料,自行生成一致的多视角参考图,再开始建模,以真实照片和尺寸为准。先做好整车比例、车架、油箱和挡泥板曲面,再补充V型双缸发动机、辐条轮毂、悬挂、车灯、车把和皮革座椅。主要部件保持独立并清楚命名,添加符合实车的材质。每完成一批资产就渲染并实际查看,不通过就返工,重点检查比例、外形、机械连接和部件穿插。
生出来的效果是这样的。
模型有了,但是不动起来,就还是不太好玩。
所以第二步,我让它继续基于现有模型,制作一段零件组装动画。
我的提示词是:
请基于现有的Chief Vintage Sturgis, SD Edition模型,用Blender的MCP制作一段10秒、30fps的零件组装展示动画,保留现有模型的外观、双色涂装和材质。0—2秒:以车架为基准,将发动机、轮组、前叉、油箱、挡泥板、座椅等主要总成有序悬浮展开,保持清晰的空间对应关系。2—7秒:零件按合理顺序分批、错峰移动到安装位置,逐渐组装成完整摩托车。动作平滑,有自然的加速和减速。7—10秒:镜头缓慢环绕完整车辆,展示车身曲面、发动机、辐条轮毂和材质细节。主要部件保持独立,动画和相机轨迹可编辑。分阶段渲染并实际查看,重点检查运动路径、部件穿插、构图和镜头衔接。
最后做出来的效果,是这样滴。
这下就有内味了。
如果你还像让它更好看,还可以让GPT-6 Astra,去Blender构建一个场景,这样渲染的效果会更加完整。
不过,在这个过程中,我也碰到了一个问题。
再生成动画视频的时候,MCP的单次运行超时了。。。
这也刚好暴露了MCP在处理复杂任务的一个约束。
解决起来也不难。
遇到一些复杂操作,可以尝试把任务拆成更小的步骤,一步步完成。
或者也可以试试接下来的方法。
第三种方式,通过CLI调用Blender,执行Python脚本。
这也是在实际操作中,最常调用的方式。
它和MCP在底层其实非常接近,两种方法都会使用Blender的Python API。
GPT写好代码以后,Blender再通过bpy创建模型、添加材质,等等完成后续的处理。
区别在于,MCP更像是连接并控制一个正在运行的Blender,CLI则是启动一个Blender进程去执行脚本。
但在其他条件相同的情况下,两种方式最终生成的模型效果,不会产生特别明显的差距。
日常我更推荐大家,使用GPT-6 Astra + Blender MCP + Computer Use来做。
三. 配合3D生成模型
现在大家已经看到GPT-6 Astra + Blender来去做的效果了,不过,大家可能会发现,上面的那些东西,基本都是几何体。
这也是AI现在比较擅长干的东西。
但是一旦涉及到生物类型的,就会效果比较差了。
比如说,让AI去复刻一个这样的金克斯。
只能说是毫不相干。。。
这也是目前GPT直接用Blender建模时,一个非常明显的短板。
从前面的天坛和摩托车也能看出来,GPT-6 Astra更擅长建筑、车辆和机械设备这种可以拆成大量规则的几何结构。
而我们给出来的图片,可能确实有点刁难了,因为人物基本就是建模里最复杂的了,跟一些几何体的建模方式完全不一样,我们过去做这种基本的人物的建模,都是用Box大概拉个型,然后基本都是直接手动ZBrush去雕刻出来的,这个真的就是传统的手工艺活,特别是肌肉的走向,跟老艺术家手工雕刻真的没啥区别。
所以,大家如果现在想复刻一些生物的3D模型,这一步就别用GPT-6 Astra去硬操作Blender了,可以借助专门的AI 3D生成模型。
比如,这么一个手办风格的金克斯的角色图。
让GPT-6 Astra操控Tripo AI生成角色3D模型,再把结果导入Blender。
这一版的效果,就明显好了很多。
所以,这种偏生物类型的,用GPT-6 Astra操控AI 3D生成模型,在导入到Blender里,来处理后续所有的流程,就会更加合适一点。
我们再用牛来举个例子,从建模到动画,完整走一遍制作流程。
在传统影视和游戏流程里的建模,一般需要好几个环节。
建模师先对照原画和不同角度的参考图,把角色的比例、轮廓和细节一点一点做出来。
除了外形,还要整理模型的拓扑、展开UV,再制作材质和贴图。
做到这里,才拥有了一个可以使用的静态角色。
如果还想让它动起来,需要继续做骨骼绑定、刷蒙皮权重,让身体各个部位和皮肤能够跟着骨骼自然变形。
之后,才是具体的动画制作,摆出姿势、设置关键帧,再反复调整动作之间的过渡和节奏。
每个环节都得一点点打磨。
真正耗时间的,往往就是这些又琐碎、又枯燥的基础工作。
所以这一次,我们也照着这套流程来。
先上传牛来妈妈的角色原图,然后让它生成一套统一的多视图设定,作为后续建模的参考。
接下来,正式进入Blender的环节,把牛来妈妈的基本轮廓和身体结构做出来。
然后整理UV、制作材质,再给它上色。
做完以后,感觉眼睛和头部比例还有点问题,又稍微修改了一下。
静态模型处理的差不多,就可以让它接着绑定骨骼。
最后,再来处理场景、表情和动画。
我想的是,可以让他来跳段舞,再根据BGM来喊妈妈和牛来!
最后做出来的效果,是这样的。
虽然属实是有点抽象,但是还蛮好玩的。
而且这套玩法,平时拿来整活也完全用得上。
你可以上传一张自己或者朋友的照片,让AI把它变成一个3D卡通小手办。
再给它编支舞、安排几个搞怪动作。
就很有意思。
写在最后
我忽然想起了7年前,我在朋友圈里发的一个3D的作品。
是根据一个海外的艺术家的图参考,然后我自己一点一点建模贴图然后渲染的。
这一张图,每天下班以后回家做,做了整整一个月。
那天晚上,用OC渲染了一整个通宵,然后在早上8点多发出来了。
一个月的时光啊,就为了一张图。
现在想想,好像这是一个不可思议的念头了。
创作越来越平权了。
每个人心中有想法,都可以让AI去操控软件,来帮你做出来。
虽然现在还很贵,还比较慢,但是,至少能做出来。
而且趋势一定是越来越便宜的,就像去年,我们想象不到,一个Coding类的长程任务,能做到这么便宜,当年,做一个PPT,甚至都需要20美金。
但,人人都可以做了,却不代表,好作品会涌现。
以后真正拉开差距的,会越来越变成你的想法、审美、判断力,还有那点愿意继续折腾下去的好奇心。
我还挺期待看到,大家都会做些什么出来。
最后。
祝大家,建模愉快。
OpenAI 发布 Deep Research:能进行多步骤互联网研究的 AI 代理撰文:Techub News 整理
导语
2025 年 2 月,OpenAI 在其官方频道发布了一段来自东京的视频,正式介绍了其下一代智能代理产品——Deep Research。OpenAI 研究主管 Mark 与来自研究及产品团队的同事共同展示了这一新功能。此次发布之所以重要,是因为它并非简单的功能更新,而是代表了 OpenAI 在实现更强大、更自主的 AI 代理(Agent)方向上的一次实质性飞跃。Deep Research 允许模型进行长时间、多步骤的互联网研究,旨在彻底改变知识工作的范式,也是 OpenAI 通往 AGI(通用人工智能)路线图上的核心组成部分。
摘要
Deep Research 是一个能够进行自主、多步骤互联网研究的 AI 代理,其思考与执行任务时间可达 5 至 30 分钟。
该功能基于即将发布的 O3 推理模型,通过端到端强化学习训练,具备规划、执行、根据实时信息调整策略甚至回溯的能力。
其核心价值在于能替代人类完成耗时数小时的研究任务,生成带详细引用的综合性报告,覆盖市场分析、学术研究、产品选购等多种场景。
OpenAI 明确表示,开发能够长时间、自主执行复杂任务的代理是其 AGI 路线图的核心,Deep Research 是迈向“能够自我发现新知识”的模型的第一步。
Deep Research:重新定义 AI 的研究能力
OpenAI 研究主管 Mark 在视频开场即点明了公司对智能代理(Agents)的重视。他认为,代理将彻底改变知识工作,帮助企业优化流程、提升员工生产率,同时对消费者也至关重要。去年发布的 O1 模型开启了 OpenAI 的“O 系列”推理模型,其特点是“长时间思考”以获得更佳答案。然而,此类模型的一个局限是缺乏工具使用能力,尤其是浏览互联网这一核心工具。
Deep Research 的推出,正是为了突破这一局限。它被定义为一个能够在互联网上进行多步骤研究的模型,其过程包括发现内容、合成内容并对此进行推理,同时根据不断发现的新信息调整其计划。Mark 强调,称之为“深度”研究,是因为他们移除了模型的延迟约束。与传统模型快速返回答案不同,Deep Research 模型可能需要 5 分钟甚至 30 分钟才能给出答案。OpenAI 认为这是一个优点而非缺点,因为这标志着模型开始以无监督的方式执行更长时间的自主动作,而这正是其 AGI 路线图的核心。
“我们最终的理想是模型能够为自己发现新知识,” Mark 表示,“而第一步,就是打造一个能够去合成和理解网络信息的模型。” Deep Research 的最终产出是一份全面、带有完整引用的研究报告,堪比领域分析师或专家的作品。除了知识工作,该功能也适用于需要大量网络浏览的其他场景,例如寻找符合特定复杂条件的商品,或者为演示文稿整理素材。
OpenAI 宣布,Deep Research 将于当天晚些时候在 ChatGPT Pro 版本中推出,随后将逐步推广至 Plus、Team 以及教育和企业版用户。
实战演示:从市场分析到购物决策
为了直观展示 Deep Research 的能力,OpenAI 产品团队的 Neil 和 Josh 分别进行了现场演示。
Neil 模拟了一个产品经理的视角,希望研究是否应该开发一款新的语言翻译应用。他向 Deep Research 输入了一个复杂的查询:帮助查找 iOS 和 Android 的采用率、想学习另一门语言的人群百分比、过去几年移动渗透率的变化,并对比发达国家与发展中国家的差异,最后要求以格式化报告的形式呈现,包含表格和对 ChatGPT 最佳新兴机会的明确建议。Neil 指出,这样的查询原本需要他花费数小时手动完成。
启动任务后,Deep Research 首先返回了一系列澄清问题,例如如何定义移动渗透率、是关注整体采用率还是特定类别等。这类似于专业分析师在接手复杂项目前的需求确认环节,确保在长时间的研究开始前准确理解目标。在 Neil 给出部分指示并允许模型对其余部分做出最佳假设后,Deep Research 便开始了自主研究进程。
用户可以通过侧边栏实时观察模型的“思考”过程:它识别关键信息(如目标国家)、搜集资料、进行搜索、打开网页、阅读内容(包括图像、表格、PDF),并利用已有信息决定下一步行动。这展示了其根据上下文动态调整研究路径的能力。
与此同时,Josh 演示了一个更贴近个人生活的用例:在日本购买滑雪板。他详细描述了需求:高级装备、全山地但兼顾粉雪、因身高需要长板、以及希望有漂亮的配色方案,并要求输出为带有总结表格的报告。同样,Deep Research 在开始前询问了关于技能水平、预算等细节,在获得部分信息后便投入研究。最终,它返回了一份综合了多个网站评测信息的报告,并提供了一个对比表格。有趣的是,其首要推荐恰好是 Josh 家中已有的滑雪板型号,这从侧面验证了其研究的有效性。
两个演示任务最终都成功完成。Neil 的市场分析任务耗时 11 分钟,查阅了 29 个来源,生成了一份结构清晰、数据详实、带有图表的专业报告。用户可以直接点击查看模型中引用的每一个具体句子或段落来源。
技术内核:O3 模型与突破性评估表现
研究团队的 Isa 揭示了 Deep Research 背后的技术基础。它由 OpenAI 即将发布的 O3 推理模型的微调版本驱动。该模型通过端到端强化学习在困难的浏览和其他推理任务上进行训练,从而学会了规划和执行多步骤任务轨迹,能够根据实时信息做出反应并在必要时回溯。
最终模型具备多项强大能力:浏览用户上传的文件、使用 Python 工具进行计算和生成图表/图像(并可嵌入最终响应中)、从网站嵌入图片,以及在引用时精确到具体的句子或段落。
其性能在多项评估中取得了突破。在由人工智能安全中心和 Scale AI 发布的“人类最后考试”基准测试中(涵盖约 100 个不同学科的 3000 道简答和选择题),Deep Research 模型达到了 26.6% 的准确率新高。Isa 指出,模型的推理轨迹与人类解决问题的方式非常相似,例如在物理难题中查找科学论文中的公式,或在诗歌分析中查找其他诗作来推断格律。
在衡量智能体能力的 GAIA 基准测试(需要网络浏览、多模态、代码执行和文件推理)中,该模型也在所有三个难度级别上创造了新高。此外,OpenAI 还进行了内部专家级评估,让模型完成专家在其工作中需要数小时手动调查的任务,并由专家评定回答质量。评估结果显示两个关键洞察:首先,模型的通过率与任务的预估经济价值相关性更高,而非与预估耗时相关,说明模型认为困难的任务与人类耗时长的任务并不完全重合。其次,随着模型被允许进行更多次数的工具调用(即花更多时间思考和浏览),其性能持续提升,这验证了为代理提供更长时间以解决更难任务的路径是可行的。
OpenAI 也提到,该模型在幻觉评估上表现最佳,但仍有可能复述不准确信息,因此建议用户自行核对来源。
未来展望:通往 AGI 的自主智能体之路
在视频结尾,Mark 总结了 Deep Research 的意义,并展望了未来。他强调,2025 年 2 月发布的仅仅是冰山一角。目前是一个可以浏览网络的深度研究代理,但可以想象,未来同样的代理能够连接到自定义上下文或企业数据存储库。
Mark 再次重申,Deep Research 对于 OpenAI 的 AGI 路线图至关重要。他们相信,能够思考更长时间、更自主地解决非常困难任务的代理是发展方向。让模型能够为一个任务工作 30 分钟,实际上也激励了对更多计算资源的投入。这预示着 OpenAI 将继续沿着提升模型自主性、延长其任务执行时间和复杂度的道路前进,最终目标是实现能够自我发现新知识的通用人工智能。
龙虾"意外"长大:OpenClaw 停更七周后,甩出了史上最大更新过去半年,OpenClaw社区里出现频率最高的一句话是:"龙虾凉了吗?"
这个年初火到出圈的开源AI Agent项目,热度肉眼可见地退潮,用户流失,贡献者热情也不如发布时。然后就在大家快习惯它的安静时,8月30日,它扔出了历史上最大的一次更新——933名贡献者、超过1.6万个Pull Request,占了项目历史总合并量的一半。
官方博客的标题很有意思,叫《OpenClaw 2.0, Accidentally》——意外的2.0。团队成员Hannes Rudolph说,他们本来只想干两件事:把安装弄简单点,把浏览器端做好点。结果一改发现底层全要跟着动,顺藤摸瓜清了七周,清出来一个2.0。
官方还打趣说比 GAT 6 更快。
要知道,在这之前的230天里,OpenClaw发了106个版本,平均一两天一个。这次憋了近七周没动静,不是躺平,是在换发动机。
从"极客乐高"到"开箱即用"
早期OpenClaw对极客极度友好——模型、网关、插件、渠道、技能,全都可以自己配。但对普通人来说,每多一个自由度,就多一道劝退的门槛。
2.0的安装直接推倒重来:它先扫描你电脑上已有的东西——ChatGPT或Claude的订阅登录、API Key、本机跑着的Ollama模型,能复用的直接复用,先验证能应答再保存;剩下的配置不用填表,跟Agent聊着天就配完了。
浏览器端也整个重写,打开直接进对话,文件、审批、终端、Git变更全排在聊天旁边。官方自测启动时间从1.6秒压到575毫秒,页面请求数从140降到45。
更大的变化是龙虾开始"长大":会话记录从文件搬进了SQLite;任务可以在你的电脑、配对设备和云端Worker之间迁移,云端闲置自动休眠,来消息再唤醒;新的"共享云会话"让同事能带着完整上下文接手你的Agent正在干的活——龙虾从单人电子宠物,变成了多人协作工具。
一个用户自建的仪表盘,位于共享的多人OpenClaw工作区内。
但真正的信号,是那些"不好玩"的改动
一个项目是玩具还是基础设施,不看它能炫什么,看它愿意为什么脏活累活负责任。
OpenClaw的黑历史不少:今年3月,Cisco Talos和卡巴斯基的分析发现ClawHub市场上36%的技能包含prompt注入;同期超过15.5万个OpenClaw实例直接裸奔在公网上。
2.0里,安全终于变成了产品能力:网关默认只绑本地回环地址、陌生私信要配对码、新增security audit命令一键体检、密钥遮罩不再进聊天记录、Incognito模式对话不落盘。最有意思的是那份"诚实"——多人协作功能的文档白纸黑字写着:这些控制项"不是租户隔离,也不是安全边界",一个网关就是一个信任域。他们甚至引用众包攻击竞技场的数据提醒你:哪怕Claude Opus 4.5的被攻破率只有0.5%,面对有适应能力的人类攻击者,现有最好的防御被突破概率仍然超过80%。
敢在发布稿里主动告诉用户"我这里不是安全边界",比拍胸脯说"绝对安全"可信一百倍。这种自我设限的声明,是演示品转向生产工具时才会花力气做的事。
结语:网红会死,基础设施会留下来
2.0没法解决OpenClaw的所有问题。它依然需要你理解模型商、API Key、网关这些概念,插件迁移、版本升级还得自己动手。国内WorkBuddy把PPT、表格、多Agent协作装进统一工作台,千问办公从网页端直接上手,对只想干活的人来说,闭源全家桶确实更省心。
但官方博客结尾那句话,把路线说得很明白:"我们不卖任何东西,也不要求你把未来托付给任何一家公司、一个模型或一个AI供应商——因为OpenClaw是开源的,属于使用它和建设它的人。"
龙虾注定不是大众产品。它更可能收缩成开发者、自动化爱好者和有私有部署需求团队的专业工具——从全民围观的电子宠物,变成一套需要认真维护的个人基础设施。
这没什么不好。网红玩具会一波波换,而基础设施一旦铺下,就会一直在那儿。
七周没发版不是凉了,是龙虾在脱壳。壳脱完了,爪子更硬了。
一只鸭子前几天英伟达不是花了129亿美元收购了 Hugging Face 吗? 这不刚收购完,一个星期不到,Hugging Face就交了第一份作业: Microduck。
Microduck 是一只售价 399美元、25 厘米高的开源 AI双足小鸭机器人,8月27号推出的,已经卖疯了,24小时销售额260万美元,首批交付时间已经推迟到圣诞节后了。外型长这样:
它不仅仅是一个玩具鸭,更是一个面向开发者、AI/机器人爱好者和教育用途的 Physical AI 平台。
官方定位其实非常明确: 一个你可以自己教它新技能的小型双足机器人。
官方说预装 7 套已训练动作:
摇摆走路,可用手柄控制速度
坐下、蹲下、自己站起来
用喙捡地上的东西(演示里有袜子、马克笔)
踢球
装上轮子后轮滑
摔倒后自己翻身站起
追激光笔、对环境做出反应,也可用 NFC 标签触发动作
每只鸭子第一次开机时会生成自己的声音身份,偏怪叫而不是语音助手。多只Microduck 还可以互相互动。
Microduck 最值得关注的不是它能不能卖萌,而是它背后的路线:AI 模型 → 仿真环境 → 强化学习 → 真机。
比如你想让 Microduck 学会一个新动作:在电脑里的模拟器中训练 → 得到 RL policy → 部署到真实 Microduck → 机器人执行 → 收集数据 → 再训练。
Hugging Face 已经把SDK、模拟环境和强化学习训练工具链开放出来了。也就是说,它希望把机器人变成类似 Hugging Face 上的 AI 模型一样:
别人训练出来一个机器人技能,我可以下载;
我自己训练出来一个技能,也可以上传给别人。
这实际上就是 Hugging Face 想做Physical AI 的开放生态模式。官方也明确说了,希望让物理行为像模型一样能够被分享、复现和二次开发。
为了缩小仿真和现实之间的差距,训练环境还专门模拟了电机摩擦、电池电压变化、控制延迟,甚至连舵机齿轮的 Backlash 齿隙都考虑进去了。
说白了,Microduck本质上是一台迷你具身智能开发平台,比春晚上跳舞的机器人高到不知道哪里去了。
这里其实也有机会,比如芯片是由瑞芯微提供的,当然也会有其它的机会,大家可以挖掘挖掘,说不定就是具身智能的chatgpt时刻。最近我的Codex额度,已经烧到我有点用不起的程度了。 大家可能都知道,我做了一个AI热点资讯产品,叫AIHOT。 然后我最近做的,基本都是关于AIHOT的底层优化,一个是尽可能降低成本,一个是系统底层的性能提升。 全是什么压模型API成本、压抓取成本、用算法替代模型、找过度设计、找性能瓶颈啥的,甚至最近因为突破了100万的月活,流量和请求费用已经到了我扛不住的地步了,又在疯狂的想办法,压缩流量传输,降低成本,都快把边缘缓存用到极致了。。。 然后我又为了做热度榜,把监控的信源加到了快2000个的量级,每天大模型的API的费用,也是几百块的烧。。。 所以,基本是一天一个200刀的Pro会员号,直接快干成日抛了,3个号轮着转,一个用完了切换另一个,继续做任务。 一边是AIHOT每天后端在疯狂烧钱,一边是为了优化AIHOT的烧钱而每天在Codex上疯狂烧钱,我感觉我自己每天好像起床就好像陷入了某种赛博循环,钱就跟流水一样哗啦啦消失了。。。 特别是我也不太懂代码,我只能当个产品经理,去规划流程架构,知道我的目标是什么,但是具体它要怎么实现?有没有一些能更加突破的方法能实现?你指望我这个愚蠢的人脑去想这个事,我肯定搞不定的,所以必须要有一个很强的大模型,根据我的需求和目标,调研完我们过去所有的日志数据,然后给一个很棒的开发的规划,后续我去执行才可以。 最近我是经常用GPT-6 Astra Max来分析和规划,甚至有两个降本的任务,我直接上了GPT-6 Astra Ultra,然后出完计划以后,用GPT-6 Astra 高来实施。 所以Codex额度不可能抗的住的,甚至额度消耗的很大头,是来自于前面的分析规划,用Ultra分析规划一次,我的200刀会员的周额度,直接能没10%。 穷则思变。 人一旦被额度逼到墙角,脑子就会异常活跃。 所以我就在想,我怎么最大化的去利用ChatGPT的网页版,因为大家都知道,ChatGPT的网页版有一个超强的模型,GPT-6 Pro,而且这个东西其实算ChatGPT Pro会员一个非常容易被忽略的隐藏福利。 因为它的额度是跟Codex分开的,并不消耗你的Codex额度。 200刀的Pro会员,一周有200次的Pro对话额度。 讲道理,这玩意一直是我心中极其好用的模型,7月份没有GPT 6只有GPT 5.6 Sol的时候,我就聊过,说这玩意的Review水平和深度,都极强。 但是GPT Pro模型一直有一个问题,就是没有办法看到我的真实的业务数据和场景,他可以通过插件的方式,链接我的Github,看到我所有的PR记录和实际的代码,但是他还是看不到我这么多月的所有的服务器日志记录,还有我真实的线上数据库。 如果你看不到这些东西,你怎么能去分析数据,然后推理找到一些底层突破,从而给我们一个真实的规划方案呢? 就比如昨天到底进来了多少条数据,我们每天的高峰数据到底是多少。 某一个模型调用到底一天烧多少钱,分别烧在了什么地方,缓存命中率是多少等等。 所以本质上。 代码告诉AI,这套系统理论上应该怎么运行。 生产数据告诉AI,这套系统实际上是怎么运行的。 PR历史,则告诉AI,它为什么一路变成了今天这个屎山。 这就是过去GPT-6 Pro我用它做方案规划最大的痛点,它一切都只能根据我的现有代码进行推测,它没有办法根据我的真实数据进行分析回测。 于是我就一直在想办法怎么去解决这个事,我当然知道有各种各样的桥接方式,把GPT 6 Pro的额度拉到Codex本地里面,用它来去处理。 但是过去无数种的经验告诉我,这种方式是会有风险的,我不太想冒这种风险。 然后,我就想起了一个东西,MCP。 在网页版ChatGPT的聊天模式中,可以调用插件,但是不能调用Skill,而插件的底层,其实就是MCP。 那如果...把我的服务器,直接封装成MCP,然后变成一个插件,能跟Github插件一样,直接让GPT-6 Pro通过MCP协议,读取我的服务器所有数据,这样是不是就行了??? 说干就干,我直接给Codex发了一句话。 对,就这么一句话:“给 AIHOT 增加一个供 ChatGPT 使用的生产业务数据只读 MCP Server,让 GPT-6 Pro 能安全查询 AIHOT 所有服务器的真实数据。但是一定是最小权限、只读、可审计,不能影响生产性能,也不能暴露密钥和敏感数据。” 他自己就封装完了。 因为为了保护我们的服务器安全,所以我只给了只读的权限。他不能对我的服务器进行任何的操作,他只能读数据,但是不能操作数据。 同时也为了保护我们私有MCP的数据安全,他也提问了说,需要OAuth登录服务,那太简单了,因为我们用的是飞书,我过去在公司里面也直接开发了一整套的飞书的认证中心供我们同事使用,我直接就把飞书的鉴权给接进去了,只有我自己的飞书账号登录以后才能用。 然后过了大概半小时以后,Codex给我开发完了。 因为它强大的Computer use的操控能力,所以甚至,都给我上传好了,自己都做完了实验。 成了。 MCP是个好东西,真的,万物皆可MCP,你可以把你任何本地电脑上、服务器上的东西封装成MCP,然后做成你的私有插件,你就全部可以让GPT-6 Pro调用了,这个想象空间有多大,能做的事有多少,我相信大家的想象力一定比我丰富。 那接下来,再说一下怎么用,以及怎么跟Codex更好的协同。 打开我们的Codex,点击左上角的快速聊天。 吊起ChatGPT的聊天模式。 这时候就会在右下角给你弹一个窗,把模型选成GPT-6 Pro,点击+号,选择你自己的插件。 因为我既需要给数据也需要给代码和PR记录,所以我是同时调用我自己的插件和Github插件。 这个时候你就可以提出你的需求了。 比如我说,我希望继续降低成本。 他就会直接读取我们所有数据,开跑。 大概GPT-6 Pro思考推理了40分钟以后,终于跑完了,然后给我了一个非常详细的方案,我看了一下,质量真的极高。 这一次,如果你直接用GPT-6 Astra在Codex里去跑,我觉得周额度的10%是真的能干掉的,所以通过这种方式,真的就节省了周额度的10%,而且也是完全的符合OpenAI的所有规则,没有干任何出格的事情。 那有了这个方案之后,我们怎么扔到Codex里面,去直接执行呢。 方法也巨简单,你完全不需要把那个md文档和方案下载下来再上传之类的,你直接点击聊天窗口的添加到Codex。 你就会发现,这个对话,已经到你的Codex窗口上了。 接着,写一句执行的万能Prompt: “帮我验证,并且做掉这里面提到的所有值得做的优化,然后统一上线。” 我自己习惯在执行的时候,把推理等级开到“高”了,大家开到“中”也行,但是不建议用“轻度”,至少我自己觉得效果不是特别好,有时候来来回回的失败或者不验证,搞起来特别麻烦。 马上GPT-6 Sol大概率就上了,GPT-6 Sol上了之后,执行这块,我可能会无脑切换到GPT-6 Sol了,只有一些高难的任务我觉得我才会切换到GPT-6 Astra。 上面Prompt写好以后,直接发送,我也不知道过了多久,因为我直接睡觉去了。 起床一看,开发完了。 这个任务,最终好像也只花了我周额度的4%左右。 还是很爽的。 讲道理,GPT-6 Pro这么强,每周还给我200次额度,让它躺在那里吃灰,然后另一边一天烧一个Codex账号,我是真的觉得我扛不住。 只要你是Pro会员,不管你是100刀的(100刀的能每周用50次GPT-6 Pro额度),还是200刀的,都可以试试,把你的真实数据和业务,封装成MCP,让GPT-6 Pro去使用,应该能减少很多你的Codex token消耗。 同时,我还是要强调一下,这种遵守规则的MCP和插件调用的方式,99.99%不会有啥风险,更不会给你降智或者风控啥的,但是如果你去用一些三方的桥接插件,把GPT-6 Pro的额度反代出来用Codex来开发,如果被风控了,别找我= = 账号安全第一。。。 最后,总结一下这套工作流。 ChatGPT上的GPT-6 Pro通过MCP的方式把真实世界接入进来,进行详细分析做规划和架构。 然后Codex的GPT-6 Astra high负责具体的开发执行。 省钱省心又省力。 我只需要提需求和做决策就行了。 哦不对,我还要负责付钱。 。。。 AI啊。 真好玩。
