Andrew Ng(吴恩达):AI Agent工作流是当前最重要的技术趋势撰文:Techub News 整理
导语
在2025 年 3 月于纽约举行的ScaleUp:AI 2024大会上,AI领域的顶尖思想领袖、Coursera联合创始人、Landing AI创始人兼董事长Andrew Ng(吴恩达)发表了主题演讲。作为深度学习和AI普及化的重要推动者,吴恩达一直致力于连接AI前沿技术与产业落地。此次演讲,他基于其团队在AI Fund和Landing AI的实践,剖析了当前最重要的技术趋势——“智能体工作流”的崛起,并为企业(无论是初创公司还是大型集团)如何抓住这波AI浪潮、构建可持续的创新流程提供了极具操作性的见解。
摘要
智能体工作流是当前最重要的AI趋势:相比传统单次提示生成,让AI像人类一样迭代思考、研究、修订的“智能体工作流”能大幅提升输出质量,在代码生成、法律文档处理、医疗辅助诊断等领域已展现出决定性优势。
企业AI创新流程正在被重塑:生成式AI将AI原型的构建时间从数月缩短至数天,这使得“快速构建大量原型并验证”成为可行策略,企业应建立“快速行动,同时负责任”的创新文化。
AI治理应聚焦于应用层而非技术层:试图监管基础AI模型本身如同要求电动机制造商保证其电机永不用于危险设备一样不切实际;更有效的路径是监管具体的AI应用(如医疗设备、聊天机器人),以确保其安全性。
大型企业与AI专家的“共创”是关键:最具潜力的AI应用往往诞生于深谙AI能力的团队与拥有深厚领域知识(如航运、医疗)的企业之间的合作,这种结合能催生出改变行业的解决方案。
智能体工作流:从线性生成到迭代思考的范式变革
吴恩达开篇即指出,如果只能关注一项AI技术趋势,那么答案无疑是智能体AI。他阐释了当前主流的AI使用方式与智能体工作流的本质区别。
目前,大多数用户使用大语言模型的方式是“非智能体”的:输入一个提示词,模型一次性生成完整回复。吴恩达形象地比喻,这好比要求一个人(或AI)就某个主题写一篇论文,必须从第一个字到最后一个字一气呵成,不允许使用退格键。人类显然无法以这种方式产出最佳作品,而AI在这种完全线性的模式下表现尚可,已属惊人。
然而,智能体工作流改变了这一范式。在这种模式下,我们可以引导AI像人类一样工作:例如,先让它撰写论文大纲,询问是否需要网络研究,随后下载相关网页作为上下文,接着撰写初稿,再让其审阅初稿并决定哪些部分需要修订,随后进行修改……如此循环往复。这种融合了思考、研究、修订的迭代过程,能产生质量高得多的工作成果。
吴恩达分享了一项来自其团队的数据:在HumanEval代码生成基准测试中,使用非智能体工作流的GPT-3.5正确率为48%,GPT-4为67%。然而,从GPT-3.5到GPT-4的改进,远不及从非智能体工作流切换到智能体工作流带来的飞跃。GPT-3.5在采用智能体工作流后性能大幅提升,GPT-4亦然。
在实践中,吴恩达的AI Fund团队发现,智能体工作流在处理复杂法律文件、辅助医疗诊断、填写繁琐的政府合规表格等应用场景中,正带来决定性的差异。这一趋势也催生了新的技术栈层级——编排层。诸如LangChain(正演进为更注重智能体的LangGraph)、CrewAI等框架的出现,使得构建智能体应用变得更加容易。
五大核心趋势重塑AI产业格局
除了智能体工作流这一核心,吴恩达还概括了其他四项正在深刻影响行业的重要趋势:
1. 更廉价、更快速的文本生成至关重要。 智能体工作流会产生和读取大量文本(Token),因此降低Token成本、加快生成速度变得尤为关键。这不仅是为了人类消费,更是为了加速智能体自身的迭代循环。将一段20分钟的智能体工作流程加速到5分钟,能带来巨大的实际价值。
2. 生成式AI正彻底改变企业创新流程。 过去,基于监督学习构建AI系统可能需要6到12个月。如今,利用大语言模型,许多团队可以在10天内构建并部署一个原型。这使得“快速构建20个原型,哪怕其中18个失败”的策略变得可行且经济。吴恩达提倡的新信条是:“快速行动,同时负责任”——在利用快速原型能力的同时,建立确保不推出造成实质性损害产品的流程。
3. 文本处理革命已至,视觉处理革命即将到来。 许多大型企业拥有海量的图像或视频数据,却苦于无法提取价值。多模态模型和视觉智能体的发展,将开启视觉AI应用的巨大潜力。吴恩达创立的Landing AI正在此领域深耕,帮助企业从视觉数据中获得更多价值。
4. 数据的“重力”正在减弱。 传统上,将大量数据从一个云平台传输到另一个进行处理因成本高昂而不可想象。然而,生成式AI工作流的计算成本极高,相比之下,数据跨境传输的成本显得微不足道。粗略估算,传输1GB数据的云出口成本约为10美分,而用GPT-4 mini等模型处理1GB数据的成本可能高达30-40美元。因此,新的设计模式正在涌现:人们更倾向于构建在全球范围调用计算资源、跨地域传输数据进行处理的应用。
5. 数据工程的重要性再次凸显,尤其是非结构化数据。 过去AI的价值多体现在结构化数据(数字、表格)上。如今,生成式AI能够从文本、图像、音频中提取前所未有的价值。许多公司正在重构数据基础设施,重点加强处理非结构化数据的“管道”建设。
企业AI创新:从灵感到规模化落地的路线图
针对大型企业如何抓住AI机遇,吴恩达结合AI Fund与众多企业合作的经验,提出了一套行之有效的五步流程。
第一步:高管培训。 确保企业领导层对AI的能力与局限有非技术层面的基本了解,这是识别机会的基础。吴恩达提到,Coursera上最受欢迎的课程之一就是面向所有人的生成式AI入门课。
第二步:机会脑暴与任务分解分析。 在理解技术后,系统性地寻找应用机会。吴恩达特别推荐了一种“基于任务的工作分析”方法:将职位分解为具体任务,而非笼统地讨论AI取代某个工作。例如,客户服务代表的工作包含多种任务,其中一些(如回答常见问题)极易被AI增强或自动化,而另一些(如处理复杂投诉)则较难。这种方法往往能发现出人意料的、最大的机会点,其结论通常比凭直觉猜测更可靠。
值得注意的是,多数企业在发现AI能将某项任务成本降低千倍后,选择的不是裁员节流,而是将该任务执行量提升千倍,从而开辟新的收入增长渠道。增长往往比成本节约更具吸引力,因为天花板更高。
第三步:项目可行性评估与优先级排序。 对脑暴产生的想法进行技术可行性和商业价值的尽职调查,并做出“自建、购买还是投资”的决策。吴恩达建议,市场上已有的解决方案应优先购买。但由于生成式AI技术太新,企业总会发现大量尚无现成产品的新想法。
第四步:执行路径选择——自建、合作或剥离。 企业内部的资源与耐心有限,不可能实施所有想法。对于少数核心、希望完全自主控制的项目,可以选择内部建设。对于其他许多项目,将其剥离为独立的初创公司可能是一个更优选择。这样既能以更低成本实现目标,又能让母公司享受其成果,同时无需自行组建和维护专门的AI团队。
吴恩达以与日本三井物产合作的“Bearing AI”为例:三井物产拥有深厚的航运领域知识,他们提出利用AI优化船舶航线以节省燃油。双方合作进行深度市场验证后,招募了一位连续创业者作为CEO,用三个月打造了技术原型。最终,这家独立运营的初创公司开发的软件已在超过600艘远洋船舶上运行,平均每艘船每年节省约50万美元燃料费,并减少10%的碳排放。吴恩达强调,AI专家与领域专家的“共创”是催生此类突破性应用的关键。
第五步:制定AI战略与员工培训。 当企业成功运行几次上述创新流程后,就需要思考长期的AI战略以及大规模的员工技能培训,以确保持续的竞争力。
AI治理:监管应用,而非技术
在演讲最后,吴恩达针对日益热烈的AI治理讨论提出了一个鲜明观点:治理的重点应该是AI应用,而非AI技术本身。
他类比道,AI模型就像电动机,是一种可以用于无数场景的通用技术。要求基础模型开发者保证其模型永不用于有害场景,就如同要求电动机制造商保证其电机永不用于危险设备一样,是不切实际且无效的。真正的风险取决于具体的应用场景。
因此,更合理的路径是监管具体的AI应用:确保医疗AI设备安全、社交媒体推荐算法负责、聊天机器人不作恶。针对不同应用的特点和风险,制定相应的安全标准和监管框架。
吴恩达透露,在过去一年半中,他惊讶地看到一些训练了大模型的公司进行了激烈的游说,试图推动扼杀开源AI模型技术的监管。他认为这背后部分动机是避免与开源软件竞争。所幸,业界共同努力抵制了其中最糟糕的提案。他呼吁业界保持警惕,坚持将治理焦点放在应用层,这样才能在促进创新的同时,更有效地管控风险,确保AI技术安全、负责任地发展。
吴恩达总结道,得益于智能体工作流等技术的突破,AI的可能性正在急速扩张,这为行动迅速的初创公司和积极转型的大型企业都创造了巨大的机遇。关键在于理解趋势、建立有效的创新流程,并将治理智慧应用于正确的层面。
体验完 Livo,我想聊聊它暴露出的行业真相一句话的影响价值有多大?
在大多数AI产品里,答案取决于你说了什么、对谁说的。但在Livo里,一句话影响的可能不只是某个具体的Agent,而是整个世界——人与自己的关系、人与人的关系、人与世界的关系,都可能因为这一句话产生改变。
这正是Livo试图回答的问题。过去三年,生成式AI把内容的生产成本压到接近于零。文字、图片、视频,一切曾经需要人类投入大量时间的东西,现在几秒钟就能生成。随着行业的发展,相关应用层出不穷,“与虚拟人格对话”变成了千万级用户的日常习惯。
但一个断层始终存在:AI生成的是内容,是角色,不是一个持续存在、会自己运转的世界。你关闭App,那个角色就冻结了;你不再说话,故事就停了。所谓“互动”,本质上仍然是你推一下,它动一下。
Livo想做的,是让这句话的“影响半径”从一次对话扩展到一个世界。快看漫画在2026年9月将它推入内测,名字来自Living(活着)、World(世界)与Orbit(闭环)——它想做的,是一个角色拥有独立人格、记忆与行为逻辑,能够在用户不在场时继续“过日子”的“仿生世界”。
这个世界独立存在,却又因“我(用户)”的行为选择产生了些许不同。在这个被创造出的世界中,“我(用户)”不是全知全能的“上帝”,也不是只能按照既定剧情路线前进的“旁观者”,而是真正具有主观能动性的“参与者”。
带着这个期待,我进入了Livo。
初体验:“穿越”有了读心术
第一次打开Livo,让我想起了一部知名的影视作品——《西部世界》。
《西部世界》里有“西部世界”、“罗马世界”、“中世纪世界”供游客选择,Livo里也有“蒂利亚之冬”、“DOLO最后的夏天”、“崩溃世纪Love 90s”和“拯救废稿世界”供用户选择。每个世界对应一条故事线,角色之间有关系网络,有各自的时间线。无论用户喜欢恋爱体验、奇幻冒险还是阵营对抗,在这里都能找到符合自己口味的选择。
不同于一般的“AI角色聊天”、“AI情感陪伴”APP,Livo从一开始就不是一个对话窗口,而是一个可以选择进入的“世界”。
初入Livo的体验很像“穿越”:精致的开场视频交代了世界观背景,接着我被“放置”到一个具体场景中。我需要主动找话题跟角色对话,甚至跟路过的NPC搭话。在这里没有任务列表,没有“点击继续”的按钮,如果我不开口,时间就在那里流逝。
但最大的不同很快显现了。在和重要角色“罗兰”的对话过程中,我可以选择系统提供的内容选项,也可以自己发挥。对于他说的每一句话,我不仅能看到这句话本身,还能看到他为什么说这句话——他的状态栏里写着“当前情绪:愉悦”。角色不是在对我的输入做“条件反射”,他在调用自己的记忆和当前状态来回应我。
另一个值得玩味的点是,我可以主动选择推进主线剧情“注定命运”,也可以在不同的场景中“闲逛”,与路过的NPC“闲聊”,触发支线剧情“潜在命运”。
比如在既定的沟通中,罗兰应该慢慢“套出”我的身份信息。可我没有选择系统给出的建议回复,而是直截了当地回复:“你对我很好奇,甚至故意找机会接近我,为了什么呢?”
罗兰也给出了很有意思的反馈:“你一句话,就把我最擅长的把戏掀了个底朝天。习惯了掌控节奏,却没想到会被你看穿……”这句话揭开了一个他的“秘密”——我由此知晓,自己是罗兰此次登上和平号列车最核心的任务之一,而罗兰在此之前从未接触过“万晁女孩”等新信息。
这让我意识到一件事:在Livo里,沟通的主动权不是用户的“天然权力”。在大多数聊天产品里,我随时可以发一条消息,角色必须回应。但在Livo中,角色是否愿意跟我深入聊某件事,取决于我们之前建立的关系,取决于他此刻的状态,取决于这个世界里正在发生的事。对话是“世界产生关系后的必然产物”,不是“用户行使的权利”。
Livo的第一眼体验,不像任何一个现有的AI产品类别。它不是聊天工具的升级版,不是互动小说的AI化,也不是AI版RPG。它更接近一个带地图、有时间线、有角色关系网络的微型世界模拟器。
有因必有果,你的反馈就是“我”
作为一个对话过不下百个Agent的“老用户”,我对AI角色的耐心已经所剩无几。
从最开始的疯狂投入,到后来发现所有角色都在用同一套模板拉扯,再到最后只看人设、立绘和配音——缺少“灵魂”的Agent越来越难打动我。市面上很多“AI角色聊天类应用”的问题很一致:角色靠“堆量”取胜,推送新奇人设吸引你点进去,但聊不了几句就OOC了,互动体验的情绪阈值被提高后,疲劳感来得飞快。
Livo给我的感受完全不同。核心差异在于:角色不是为我而存在的。
一般情况下,关闭App,甚至退出和TA的聊天框后,这个角色就冻结了。但在Livo里,在我和其他人沟通的时候、在我自己探索新场景的时候,罗兰有自己的日程。他上午在台灯下撰写《荆棘花信》的新章节,下午去阅览室看书。我没有参与这些事,但我却能看到它们发生了。他的人生有“主线”,而我只是进入了他的世界,不是他围绕我运转。
这种能力并不是主要角色的特权,就连戏份少得可怜的NPC同样拥有自己的生活。
Livo的底层逻辑是“世界状态持续演化”——用户不在的时候,角色之间的关系在变,事件在发生,因果在累积。这听起来像是一句产品文案,但实际体验中有一个瞬间让我真正理解了它的含义。
一次任务,我和NPC咖啡店老板与面包店老板产生了交集。因为我送给列车员一个暖手袋的小事件,三者产生了很奇妙的化学反应。在我无意间再次打开这个场景的对话框时,我发现他们三个人正在探讨我什么时候会再来,要给我一直温着暖手袋从而回报我的善意,要请我再喝一杯新创的咖啡,品尝一下可口的小面包……
坦言之,看到这些内容我是震惊的。他们只是我这段体验中很边缘化的角色,甚至都不是主角,但依然做着自己的事情,甚至会因我而产生争吵。宛如他们并不是NPC,而是一个个切切实实活在那个世界中的人。
这就是“因果”在Livo里的样子。我对列车员说的话、做的事,影响了他自己的行为模式,进而影响咖啡店老板与面包店老板对我的态度。这不是预设的剧情分支,而是几个独立Agent之间的信息流动产生的连锁反应。在轮次对话产品里,这种多角色因果链不可能出现。你生成的是“回应”,Livo试图生成的是“轨迹”。
更让我意外的是,Livo里一个叫“照见我”的模块。与任轻义交流,随着角色逐渐认识你,系统会生成属于我自己的“照见我”。这里记录的是我留下了怎样的痕迹,角色如何理解我,以及这个世界正在如何“看见我”。
换句话说,Livo里的“我”不是用户自己定义的人设,而是这个世界对我的行为的反馈与沉淀。我在任轻义面前的样子、在罗兰面前的样子、在咖啡店老板面前的样子,被分别记录、分别理解,最终汇聚成一个被世界“看见”的“我”。这让我意识到,Livo试图做的不仅是让角色“活着”,更是让用户在被世界看见的过程中,重新认识自己。
这可能才是“有因必有果”的真正含义——你的每一个行为都会进入这个世界的因果链条,而这个世界最终会把这些因果,以“你是什么样的人”的形式,还给你。
一个“活着的世界”究竟靠什么成立?
这次我不仅体验了APP的完整功能,还拿到了新Demo的内测权限,在Demo上直观看到了这个世界运行的底层代码。
比如因为“窗外暴雪”的因,散廷·姚产生了“推开小型放映厅门时肩头还落着雪,他抖落雪的动作比胶片转动声音轻”的“果”;又比如在没有我的地方,施塔恩与罗兰开始了关于等待的相互试探……
从公开信息来看,Livo的技术架构为双层结构,由「创作者灵魂注⼊⼊⼝层」与「三⼤引擎」共同构成,此为Livo区别于⼀般AI⻆⾊/聊天机器⼈产品的底层差异。
入口层将创作者以文学语言撰写的素材,结构化为可供引擎运行的数据。具体来看,在个体侧,人物小传被抽离为「六层人格」档案,包括自我意识、底层需求、信念、思维、立场和情绪;在世界侧,世界观骨架被抽离为「六层世界结构」,包括本源、动力、信念、秩序、律法和气象。
有了入口层的这串“基础代码”,「三⼤引擎」就可以开始协同工作。World Agent,负责管理日程、事件、天气、运势等影响整体状态的因素。Soul Agent负责用户与角色之间的交互。「深度被感受」引擎,通过五步链路保证情感回应的真实性。此时每个角色本身都是一个独立Agent,拥有不同的人设、世界观和状态,调用各自的Sub-agent和MCP服务。底层是Memory和“因果编剧”——前者负责长期信息的保存和召回,后者负责维持长时间运行后的故事因果不崩。
这个架构试图解决的核心问题不是“技术单点突破”,而是“长时段运行后的一致性”。
那些投入了大量的经济成本与时间成本才“调教”好的Agent突然OOC,忘记了我们的过往,忘记了我们之前一起经历的种种,产生出一些不符合角色的行为,对于我们这些老用户而言是致命性的打击。
但Livo走了一条完全不同的路——它不追求物理引擎级别的真实感,它追求叙事因果层面的可信度。“活着的世界”靠的不是更多的角色、更长的剧情、更漂亮的画面,而是三样东西:长期记忆的叙事性、多Agent的自主交互、用户行为的因果进入。
记忆层面,Livo的设计逻辑不是“记住用户说过的话”,而是角色拥有自己的经历。“经历过的事”和“知道的事实”是两回事,这个区分决定了角色是在“回忆”还是在“检索”。
多角色自主性层面,任轻义和罗兰之间的关系张力不是我能直接控制的。他们之间的互动有自己的逻辑,我感受到的是一个本来就在运转的关系网络,而不是一个为我搭建的舞台。
技术路线上,Livo的团队借鉴了斯坦福AI小镇的思路,但明确表示不会照搬任何现有方案。这个产品需要的基础设施,市面上还没有现成的。让子弹再飞一会儿,是合理的态度。
尾声
客观来说,Livo目前还不是一个完美的“活世界”。
角色的“涌现”深度有限,长时间交互后人格偶尔会漂移;有时候剧情已经结束了,角色应该离开了,对话框却还停留在那里,引导我继续沟通交流;“照见”等模块的体验还不完整;故事剧情是单向发展的,不能像聊天Agent那样撤回自己说的话,也不能像影游那样回溯到某个节点……
这些问题的本质其实是同一个:一个持续运转的世界,意味着任何一次交互都会永久改变世界状态。自由度和容错性之间,Livo选择了前者。这个选择有代价,但方向是对的。
所以比起这些体验上的小问题,我更关心的是另一个问题:第十小时、第一百小时之后,这个世界是否还值得回去。
这个问题,其实不只是Livo的问题。每个时代都有属于自己的娱乐方式。电力与光影技术让电影出现,电子技术与广播电视网让电视剧热播,个人电脑与互联网让互动叙事游戏广受欢迎,生成式AI与多智能体架构也让Livo出现。
它们看似是不同年代的产品,背后却是同一条线索:媒介技术的每一次跃迁,都在重新定义“人如何进入一个故事”。电影让人坐在黑暗里观看,电视剧让人在客厅里陪伴,互动叙事游戏让人在选项里参与,而Livo试图让人“活”在一个会自己运转的世界中。从“看”到“陪”,从“选”到“在”——每一次跃迁,都是“进入”的深度在加深。
而在这个方向上,快看还有一个被低估的优势。十二年的漫画经验,意味着它对“角色怎么让人在乎”有肌肉记忆。在一个比拼“世界感”的赛道上,这种能力比想象中更重要——因为一个世界之所以值得回去,不是因为技术多先进,而是因为里面有人让你惦记。
从“生成内容”到“生成持续存在”,这可能是AI内容产品的下一个分水岭。Livo还不是那个分水岭本身,但它是目前更接近让人感觉到“世界在活着”的产品。它验证了“世界可以自己往前走”这件事不是空想,但距离“一个真正活着的世界”还有大量未解决的问题。
它值得被看到,不是因为它已经做成了什么,而是因为它指向的方向——让故事不再停在“然后呢”,让它真的有一个“然后”。
图片来源|企业供图
2026 AI Builders Day 完整议程公布:当模型不再稀缺,AI Builder 靠什么赢?一场关于算力、应用与下一波 AI 机会的上海聚会
一个周末做出 AI Demo 已经不难,但为什么真正被持续使用、让用户愿意付费的产品依然稀缺?
当模型能力逐渐趋同、调用成本持续下降,AI Builder 面临的问题正在从“能不能做出来”,转向“为什么用户会选择你”。产品的长期壁垒究竟来自数据、场景、工作流、用户关系,还是品牌与分发?当模型供应商涨价、限制地区或调整规则,应用又该如何保持稳定运行?
9 月 21 日,由 6Block 发起,Techub News 与 Miuro.ai 联合主办的「2026 AI Builders Day 上海站」将在上海国投大厦举行。活动预计汇聚约 100 位开发者、创业者、投资人与产业伙伴,从算力基础设施、模型调用到投研、视频与音乐创作,共同探讨 AI 如何从技术能力走向真实产品。
当模型不再稀缺,Builder 的机会在哪里?
活动压轴圆桌将以「AI 的尽头——当模型不再稀缺,AI Builder 的机会在哪里?」为主题,把讨论落到每一位 Builder 正在面对的现实选择:
如果只有三个人、有限预算和六个月时间,应该从模型、算力、Agent、工具还是垂直应用切入?
为什么 AI Demo 越来越多,真正找到 PMF、获得持续付费的产品却依然有限?
面对闭源模型、开源模型、自建部署与多模型 API,开发者应该如何选择基础设施?
当大家使用相同的模型,产品真正的壁垒在哪里?
如果 AGI 比预期更早到来,今天最值得积累的能力和资产又是什么?
这场讨论不试图给出统一答案,而是希望通过来自基础设施、产品、内容创作与生态一线的不同视角,帮助 AI Builder 看清下一阶段真正值得投入的方向。
从算力底座到具体应用
圆桌之前的多场主题分享,也将为这些问题提供具体的实践样本。
Gonka.ai 团队核心贡献者将带来主旨演讲,分享开放 AI 算力网络的实践与观察;GonkaRouter.io 技术负责人将以「一个 API,组建你的 AI 专家团」为题,介绍多模型能力的调用与协作;Uweb AI 团队实操导师将通过真实案例,分享如何用 AI 搭建辅助个人的投研系统。
在内容创作方向,Craftale AI 团队将围绕「AI 视频创作新范式:从灵光一现到完整短片」,拆解从创意到成片的完整流程;Miuro.ai 团队CTO 则将分享 AI 如何重构音乐创作、全球发行与价值流通。
目前确认出席的嘉宾还包括 SentientAGI APAC Lead Anita、星野大学校长及 AI 内容创作者 星野、Monad Greater China Ecosystem Lead、Billions Network APAC Lead 等 。
除议程嘉宾外,Haotian、DeFi Teddy、Jingle Bell 初号机、王小楼、Laughing、Zisu、Neal 与 Shawn Pang 等几十位 AI 及 Web3 研究者、创业者和生态建设者也将来到现场,与 AI Builders 围绕算力、Agent、产品落地与增长展开交流。
媒体及社区支持包括 OpenSchool、Foresight News、区块律动、深潮、PANews、Odaily、深求社区、OpenBuild、复旦大学区块链协会、华东政法大学区块链协会、TinTinLand 与 NODE-X 等。
现场还将设置问答、抽奖、茶歇和自由交流环节,奖品包括小米 AI 眼镜、 AI 推理、视频及音乐创作 Token 礼包,万向区块链周及 TOKEN2049 主会场门票等。
活动信息
时间:2026 年 9 月 21 日 13:30–18:00
地点:上海市虹口区东大名路 638 号国投大厦 15 楼多功能厅
报名:https://luma.com/d66o016k
Celestica:市场刚刚给投资者送上了一份价值 110 亿美元的“大礼”尽管 Celestica Inc.(CLS)近期财报表现超预期,而且整个市场也从 7 月底低点开始反弹,但随着投资者消化公司 8 月份的增发,Celestica 股价仍然持续承压。具体而言,公司在本季度以每股 310 美元的价格发行了超过 1,110 万股新股,募集资金总额接近 35 亿美元。
不过,公司近期与 Advanced Micro Devices(AMD)以及 OpenAI 披露的一系列高质量合作持续推进,进一步凸显出 Celestica 在把握快速变化的计算需求趋势方面,其竞争地位正在不断增强。
具体而言,AI Agent 的兴起正在加速计算需求从以训练为主的工作负载,向高容量推理转移。而最近 Agentic AI 的部署范围也开始从此前主要集中于企业环境,进一步扩展到大众消费者市场,Meta Platforms(META)最新推出的 Muse 就体现了这一趋势。
推理强度不断上升,也相应增加了芯片之间的数据传输量。由于电力预算天然受到限制,这进一步提高了最大化每瓦性能(perf/W)的迫切性。因此,市场对于低延迟、高带宽网络的需求正在持续增强,尤其是 scale-up fabric,因为它负责同一计算域内部的互连,而其互连密度大约是跨机架 scale-out 架构的 10 倍。
而 Celestica 最近与 AMD 和 OpenAI(OPENAI)的合作,也表明公司正在进一步扩大在相关机会中的覆盖范围,将目前在 scale-out 网络中的增长势头拓展至 scale-up 网络,并进一步深入到“板卡、机架和系统”层面的集成。这意味着 Celestica 能够在不断扩大的 AI 基础设施 TAM 中获取更大的价值份额,从而强化其正在加速的增长轨迹,同时随着更高价值的 Hardware Platform Solutions(HPS)业务扩大,也有望支持 Connectivity & Cloud Solutions(CCS)业务持续释放经营杠杆。由此带来的盈利上行空间以及长期自由现金流增厚,将是抵消近期增发造成股权稀释的重要因素,同时随着 Agentic Inference 不断扩大 Celestica 的需求前景,公司仍有望保留进一步的上行空间。 fileciteturn1file0L1-L9
AI Agent 正在推动网络强度上升
Agentic AI 的加速转型已经改变了 AI 开发的经济优先级。正如我此前的文章所讨论的那样,Agentic 工作负载所需要的持续推理循环、工具调用与模型调用,以及上下文检索,本质上都会提高推理 Token 的消耗量。而随着 Meta 最近推出 Muse,Agentic AI 的部署范围也正在进一步从此前主要集中于企业环境,扩展至大众消费者市场。
具体来说,早期 Agentic AI 的采用主要集中在编程、工程、数据科学以及其他企业工作流中。根据行业预测,这些企业工作流分别占 OpenAI 和 Anthropic(ANTHRO)ARR 结构的大约 60% 和 90%。不过,Muse 的推出有望扩大消费者对 Agentic AI 的采用。虽然目前 Muse 的部署仅限于美国,但考虑到 Meta 过去能够成功通过其 Family of Apps 向全球用户分发新功能,而该生态系统目前覆盖 36 亿 DAU,因此 Muse 未来一旦拓展至海外市场,就可能释放数十亿新增用户。与此同时,随着越来越多竞争者进入这一领域,Agentic AI 在消费者场景中的采用范围也很可能进一步扩大。
这与近期行业数据是一致的。目前行业预计,推理工作负载已经占全部计算需求的“大约三分之二”,高于 2023 年的三分之一以及 2025 年的一半。Dell(DELL)最近还预计,随着 Agentic AI 加速发展,到 2030 年推理 Token 数量将增长 87 倍,达到 3,600 千万亿个。不过,电力依然是核心约束因素,因为电网容量扩张速度仍然落后于 GPU 部署进度。因此,在固定电力预算下,推理量不断增长正在推动下一代 AI 系统设计越来越重视每瓦性能优化。
这也相应提高了网络强度,因为要在固定电力预算下优化 perf/W,就越来越依赖更高带宽、更低延迟的互连,以减少芯片之间的通信瓶颈,并最大化系统利用率和正常运行时间。Cisco(CSCO)最近对这种强度进行了量化,其研究显示,在执行相同任务时,AI Agent 产生的网络流量最多可以比人类高 450%。这反映出,Agentic AI 的采用不仅提高了新增计算部署的迫切性,也同步增加了对配套网络基础设施的需求。AMD 最近发布的一份报告也印证了这一点,该报告将网络称为“决定 AI 性能与经济性的关键因素”。因此,这种背景进一步强化了 Celestica 未来在 scale-out 和 scale-up 领域的机会,也意味着公司的增长和盈利前景仍存在进一步上行空间。 fileciteturn1file0L11-L18
Helios 和 Jalapeno 验证了 Celestica 的 Scale-Up 拐点
Celestica 在 400G 和 800G 交换机上的持续增长,以及即将开始放量的 1.6T 项目,已经印证了公司正在不断扩大其在 AI scale-out 市场中的份额。具体来说,800G 交换机快速放量,以及 400G 需求保持韧性,是第二季度 HPS 业务增长的重要驱动力。与此同时,随着 10 个活跃项目将在 2026 年下半年至 2027 年期间进入放量阶段,公司即将转向 1.6T,这很可能进一步强化 Celestica 的竞争地位,因为 1.6T 路线图与越来越大规模 AI 集群部署所需要的更高带宽和容量高度匹配。
不过,公司近期赢得的订单更重要的一点,是显示 Celestica 正在扩大在更靠近计算本身环节中的价值份额。正如前面所讨论的,从以训练为主的工作负载向推理加速转型,正在显著提高 scale-up 网络对于带宽和延迟的要求,因为 scale-up 网络负责连接同一计算域内部的 CPU、GPU 和 ASIC。这与管理层的判断一致,公司预计未来三年 scale-up TAM 将显著增长,而 Celestica 最近赢得的项目——包括与 AMD 的合作——表明公司已经很好地抓住了这一趋势。
具体而言,Celestica 正在与 AMD 合作,参与后者即将部署的首个 Helios 机架级系统。Celestica 将负责 Helios 每个机架中构成“互连骨干”的“scale-up 网络交换机研发、设计和制造”,这意味着公司的业务路线图正在向更加接近计算核心、价值量更高的领域发生拐点。管理层预计,这项合作将形成数十亿美元级别的业务机会,而 AMD 目前已经锁定的 Helios 部署管线也进一步提高了可见度。其中包括:Anthropic 承诺部署最高 2GW 的 AMD Instinct MI450 系列 GPU,并在 Helios 机架中运行,其中首个 1GW 将于 2027 年上半年出货;Meta 做出跨多代产品的承诺,将部署最高 6GW AMD Instinct GPU,其中首个归属于 Helios 的 1GW 将于 2026 年下半年出货;OpenAI 同样做出跨多代产品的承诺,将部署最高 6GW AMD GPU,其中首个 1GW 也将对应 MI450 系列 Helios 机架,并于 2026 年下半年出货;Oracle(ORCL)则将在 2026 年第三季度部署首个包含 50,000 颗 AMD MI450 GPU 的 Helios AI 超级集群。上述项目预计都将由 Celestica 的 scale-up 网络交换机提供支持。
**Thanos Moschopoulos,BMO Capital Markets Equity Research:**那么,我们是否可以假设你们参与了其中大多数项目?还是说最终由超大规模云服务商来决定机架的具体配置?
**Robert Mionis,CEO 兼董事会主席:**不,我们参与了所有这些项目。
来源:Celestica 2026 年第二季度财报电话会议。
Celestica 在 AI 基础设施 TAM 中渗透率进一步加深,也得到了近期与 OpenAI 在 Jalapeno 项目上的合作验证。公司将为 Jalapeno 架构贡献其“板卡、机架和系统方面的专业能力”,其中包括对 Jalapeno 的“Katsu”CPU Host 与“Vindaloo”ASIC 机架进行系统级集成,这些系统通过 PCIe 直连铜缆(DAC)连接。实际上,这使 Celestica 的 scale-up 敞口不再局限于基于通用 GPU 的系统,同时也进一步叠加了公司此前作为 Google(GOOG/GOOGL)TPU 首选制造合作伙伴所建立起来的定制 ASIC 业务基础。
综合来看,最近赢得的这些项目表明,Celestica 正在同时加深对 scale-up 和 scale-out 市场机会的渗透。这些订单也验证了公司对目前正在推进的“多个 scale-up 项目洽谈和合作”最终转化的信心,而管理层预计,随着 1.6T 的到来,这些机会将进一步获得推动。这也意味着 Celestica 更高价值的 HPS 业务将从单纯网络领域,进一步延伸至机架和系统级配置。与此同时,这一进展还进一步叠加了第二季度已经观察到的企业 AI/ML 服务器与存储业务加速势头,说明公司正在下一代架构中获取更多内容价值,从而为 Celestica 基本面进一步上行提供支持。 fileciteturn1file0L20-L40
基本面考量
在根据 Celestica 实际第二季度业绩以及前瞻指引,对我此前预测进行调整后,同时考虑近期新增订单以及 AI 基础设施需求结构正在发生的变化,我预计公司本年度收入将同比增长 65%,达到 205 亿美元。随后,公司收入预计将在截至 2030 年的五年期间实现约 37% 的 CAGR。增长将主要由 CCS 业务推动,而近期披露的订单提高了需求可见度,同时新出现的 scale-up 市场机会预计将在 Celestica 即将进入 1.6T 放量阶段后进一步获得动能。
【原文图片位置:Celestica 基本面分析、增长预测与盈利预测(作者)】
正如前面的分析所讨论的那样,Celestica 向 scale-up 市场扩张,预计将进一步扩大其更高价值 HPS 业务在不断增长的 AI 基础设施 TAM 中的覆盖范围。这将推动 CCS 的产品组合进一步改善,因为管理层此前已经指出,Celestica 的“非 HPS 业务利润率不如 HPS 产品高”。与此同时,随着 scale-up 渗透率提升以及 1.6T 放量带动整体出货量增长,经营杠杆预计也会进一步增强,并在规模扩大过程中持续推动利润率上升。
【原文图片位置:Celestica 基本面分析、增长预测与盈利预测(作者)】
股价考量
综合来看,我更新后的预测支持 Celestica 每股 400 美元的目标价,高于此前的每股 384 美元。该目标价对应公司约 510 亿美元的内在价值,也就是说,在市场因近期股权稀释以及基础设施支出不确定性导致股价下跌后,相比当前水平仍有大约 110 亿美元的潜在市值上行空间。
【原文图片位置:Celestica 估值分析与目标价(作者)】
该目标价是基于现金流折现模型得出的,其中采用了与上述基本面分析一致的预测。终值采用对 2030 年预计 EBITDA 应用 1.5% 永续增长率计算。1.5% 的永续增长假设反映了 Celestica 核心市场长期经济扩张的预期速度,并可以作为公司进入稳定阶段后现金流可持续增长率的合理代理。包括终值在内的全部现金流预测,使用 10.3% 的 WACC 进行折现,这与 Celestica 的资本结构以及风险特征一致。每股价值则基于公司在 2026 年第二季度 10-Q 中披露的摊薄股数,并额外计入公司在 8 月份发行的 1,110 万股新股。
【原文图片位置:Celestica 目标价估值分析(作者)】 fileciteturn1file0L53-L62
需要考虑的风险
近期有关 AI 安全问题的担忧,以及随后行业内要求“放慢前沿 AI 发展速度”的呼声,再次给整个 AI 基础设施交易带来了波动。这一点已经反映在 Celestica 股价上:9 月 14 日周一开盘时股价跳空下跌 6.9%,最终收盘跌幅达到 8.8%,明显跑输大盘,因为投资者正在评估潜在前沿 AI 发展放缓可能带来的影响。
不过,此后 Celestica 已经收复部分跌幅,因为 Nvidia(NVDA)CEO Jensen Huang 并不同意继续快速推进 AI 与安全之间必须二选一的隐含逻辑,包括对于灭绝风险的担忧。他认为,公司应该“尽可能快地向前跑……但在有需要的时候暂停一下,确保把事情做对”,以保证产品安全。Meta CEO Mark Zuckerberg 也表达了类似观点,他表示,“每一家实验室都有责任和动力,以训练模型所需要的安全速度推进,同时也有能力自行采取行动确保这一点”,并不需要刻意放缓进程或者建立联邦层面的统一治理框架。
最新的发展再次凸显 Celestica 仍然暴露在较高的市场波动之下,因为投资者正在重新评估高水平 AI 基础设施资本开支能否长期持续,同时也还在消化近期股权稀释带来的影响。不过,公司持续保持稳定的执行力,尤其是近期不断扩大的订单合作,已经提高了其增长和盈利前景的可见度。即便围绕“放慢前沿 AI 发展速度”的不确定性仍然存在,这依然有望成为降低公司投资风险的重要因素。 fileciteturn1file0L64-L69
最后观点
综合来看,市场很可能已经显著低估了 Celestica 的上行空间,因为公司正在出现的 scale-up 拐点,会进一步叠加目前已经非常强劲的 scale-out 网络以及 AI/ML 服务器增长动能。具体而言,近期 Helios 和 Jalapeno 项目的赢单,为 Celestica 在下一代 AI 架构中不断提高内容价值份额提供了有力验证。这还将受到即将到来的 1.6T 转型进一步推动,而管理层预计,1.6T 将加速公司的 scale-up 机会,并推动更多订单转化进入其更高价值的 HPS 管线。
展望未来,Celestica 即将进入的 1.6T 放量阶段,以及 Helios 和 Jalapeno 项目首批产品的出货,将成为股价的重要催化剂,因为它们能够提高市场对公司 scale-up 机会的可见度。同时,Celestica 产品组合持续向更高价值的 HPS 销售倾斜,再叠加持续释放的经营杠杆,也有望进一步抬升其盈利和自由现金流增长轨迹。综合来看,这些因素应该能够增强公司从当前估值水平进一步向上重估的可能性,同时抵消近期增发造成的短期股权稀释影响。
放弃百万美金年薪,牛津兄弟想训出「华尔街AI分析师」「自研模型,冲向交易金字塔尖。」
文|孙小雯 海若镜
编辑|海若镜
做AI金融模型创业前,子辰已是年薪百万美元的“金领”,凭借在顶级投行练就的交易嗅觉,赚钱对他来说不算难事。
创业的起心动念,源于一场AI交易大赛Alpha Arena。2025年底,DeepSeek、GPT、千问等大模型都下场参赛,也让子辰发现:通用大模型已经进化出一定的独立判断能力。也许未来,他引以为傲的投资决策能力,也能被大模型复现。
与其恐慌,不如下海去搏一搏风浪。他找到正在Meta从事模型研究的方正,两人一拍即合,开启了名为FreeRide的AI创业航程。「暗涌Waves」独家获悉,FreeRide AI近日完成数百万美元种子轮融资,投资方为L2F光源创业者基金。
在还没有Demo时,就拿到融资,关键有两点:一是选择的方向,二是创始团队的履历和潜能。从牛津大学数学系毕业后,子辰先后在伦敦和香港的摩根士丹利、摩根大通、华泰国际等机构工作,从事复杂衍生品交易,曾担任高级交易主管。
方正的履历则更为复合。牛津大学物理系毕业后,他先后在瑞银、Evercore、麦格理资本等机构,处理欧美区域的投行投资业务。因为感知到AI在金融行业的巨大潜力,他又回到剑桥大学攻读计算机科学博士,并参与到Meta、Oracle等大厂的AI模型训练和AI系统的研究。
两人开始探索:大模型已初具决策智能,但要让AI拥有“华尔街交易员”级别的能力,还有多少座山要翻越?
第一座绕不开的是“数据”。文本、代码可以被海量采集,但真正影响金融交易的高质量经验,往往只存在于一线从业者的大脑里。即便能采购诸多类型的数据库,但怎么判断数据价值、权重,进而转化为真实世界里的决策智能,仍有鸿沟。
而且,金融交易数据天然高噪声,现有大模型围绕coding智能体,适配出的长流程模式很难直接迁移。
架构层面,金融交易任务往往依赖极高维度的逻辑分析,很多任务不是定点、单向的求解路径,仅靠常规模型训练方法难以突破,还需要引入专门的系统学习架构。
即便金融专业模型掌握了应有的专业知识与能力,金融市场瞬息万变,只有让AI能够自主学习、自我进化,才可能捕捉到真实市场信号。
这些路障,也让他们理清了技术路线:做AI金融交易大脑,必须自训专业的垂直模型底座,同时做自进化Agent。基于在金融行业沉淀的经验,调整接入通用大模型的参数权重,进化出更有实操经验的LLM底座,先让AI成为有2-4年工龄的初级员工;再通过自进化Agent,让模型能够适应实时多变的金融交易。
自研模型,无疑是昂贵且艰难的。但子辰、方正认为,这是冲上金融“金字塔尖”的必经之路。一旦跑通,垂直模型进入塔尖的华尔街投行和一线基金,参与衍生品定价、复杂投资研究及决策,未来将能辐射更广的金融市场,甚至成为普通人的交易“副驾”。
在他们看来,模型大厂和互联网平台的确拥有更多算力与资源,但却很难偏离当前AI发展主线,聚焦于金融这一细分场景。未来AI系统,或许更像一个交响乐团:通用大模型,与一群专业模型合作,完成复杂任务。
除训练金融专业模型以外,两人在2026年发表论文,初步验证Agent在高噪声、高变化金融领域自进化的可行性。这一“会寻找Alpha的研究员”机制,在沪深300市场中测验,经过1600步进化后,将生成因子的IR中位数从1.6提高到3.9。这个表现不俗,在传统量化领域,IR大于1.0就可称为优秀因子。
技术初验后,接下来FreeRide将从衍生品定价等专业任务切入,做出金融专业人士可用的模型,再拓展到更广泛的金融任务。
以下是「暗涌Waves」与FreeRide联合创始人张子辰、沈方正的对话(经编辑):
Part01
AI交响乐团:
通用模型带一群垂类
暗涌:通用模型能搭Agent和Harness,为什么还要自己训练底层模型?
子辰:我们还是要用第一性原理去解决智能问题。现在Agent和Harness的架构越来越复杂,但如果你不掌握底层模型权重,上层设计地再精妙,也会面临一些风险,比如通用模型无法满足特定场景的任务质量。
另一方面是,以后机构会有自己的Agent,但这个Agent用哪个模型去驱动?现在的通用大模型不一定适合,我们希望做出一个更适合金融场景的模型,让这些Agent有机会用到FreeRideAI模型。
我们对比过GPT、Claude、DeepSeek、千问、MiniMax和智谱。在衍生品定价这类问题上,它们的确懂很多基础知识,但更像一个很好的实习生。你来投行实习,给出这样的回答,我觉得是OK的;但作为正式员工就不达标,因为你的答案过于肤浅,理论没有结合实际市场经验。
暗涌:投资人怎么看金融垂类模型,担心被通用模型吞掉吗?
子辰:感觉几个月以前,大家还在担心通用模型可以吞噬一切,但最近这一个月开始有变化。
通用大模型有几个限制,包括在专业领域的性能、成本和速度。对于特定专业,模型规模不一定是越大越好,最终形式可能是通用大模型与一系列专业模型合作完成任务。
现在的通用模型,在编程垂类已经做得非常好,但在金融、医疗等专业领域仍需要垂类模型。因为金融领域的一些实操经验,网上搜不到,书里也不会有。一个科技工作者很难复刻垂直领域里的顶尖能力。
方正:与其叫垂类模型,叫专业化模型可能更准确。与通识教育类似,现代AI在早期训练中打下的广泛知识基础,但若想像专业人士一样在特定领域独当一面,必须有高度专精的知识与职场技能培养。
暗涌:怎么确定金融模型该学什么?
方正:如果把模型训练比作“炼丹”的话,首先要知道这个“丹”是给谁吃的、解决什么问题。正因为我们团队在伦敦、纽约、香港等国际金融中心拥有丰富的专业经验,我们知道金融机构和专业人士需要AI模型做什么,就能反过来判断它应该具备什么能力、需要什么样的数据。
暗涌:买大量的商业金融数据库,来训练金融专业模型,是必须的?
子辰:确实需要采购数据库。但真正的经验是两点:第一,找到这些数据;第二,判断它们的价值和权重。同时面对100个数据,哪一个更重要?怎么把这些数据变成对决策有帮助的东西?决策思维链是怎样的?这些经验既往只存在于很小的金融圈,大家不会把它记录并公开出来。
比如期权定价的某一个参数,特定情况下怎么选,互联网语料和文献材料很少。但有一线交易实操经验的团队知道什么对、什么错,现有的数据里哪个权重应该更高、哪个应该更低。
如果只是把数据丢给模型专家,说“我有这些数据,你帮我去训吧”,最后的智能程度会非常低。就像经理让一个初级分析师分析问题,他直接把数据怼过去,那经理肯定会问:“我要你干什么?”
暗涌:只靠小圈子的经验,数据量够么?
子辰:首先,我们团队有能力从真实场景出发,针对需要解决的问题将相应的训练数据量放大。
另外,除了金融圈内的经验,我们还在做一件更有意思的事情,就是创建“模拟经验”的生成机制。它有些像AI斯坦福小镇,可以模拟人类的行为,各个角色在AI世界里交互。我们希望利用已有经验,用AI把数据量做大,去模拟更多有价值的经验。
暗涌:有具体的例子吗?
方正:关键技术细节,现阶段还不太方便透露太多。
但举一个例子,比如论文揭示的STAR机制,该机制处理的原始数据规模很小,而且全是有限、离散且信息与噪声高度浓缩的数值。
即便如此,我们仍然看到其中可以推导出有价值的观察结果,进而在后续阶段指导状态判断与决策行为。虽然应用于自进化和传统的后训练有所不同,但它印证了金融市场中很多信息可以被有效提取,并且作为信号推动AI系统与模型的整体迭代优化。
暗涌:金融领域现有的Benchmark怎么样,你们的垂类模型表现如何?
方正:现在金融领域的Benchmark并不是非常理想。比如去财报里找一些数字,本质上还是信息检索;或者是简单的计算,实质是把通用任务放到金融场景里。
我们也看到近期有一些Benchmark找专业人士标注,例如看一个问题需要从哪些角度思考的评测。但很多做得还比较粗糙,有些不是业内真正会考虑的问题。
子辰:我们不会盲目打榜。金融太大了,一个评测集可能只有小几百个问题。税务、会计、零售金融的问题跟机构金融的问题放在一起,各自覆盖面会比较狭窄。我们会针对性地判断,哪些Benchmark更适合我们。
Part02
自进化Agent:
即时感受市场变化
暗涌:为什么既要训练模型,又要让Agent自进化?
方正:它们是相辅相成的。由于通用模型在金融任务上的能力限制,只做Agent进化仍有效率和效果的瓶颈。与此同时,如果只做模型,那金融市场变化非常快,模型无法实时根据市场动态调整。
如果直接让通用大模型在金融任务上试错和进化,就像把基础能力不错的“高中生”送到华尔街,他成长为国际顶尖机构专业人士的进度,远不及直接引进具备扎实专业知识、高适应力的名校毕业生。训练金融专用模型,就是输出“AI金融名校生”。
我们希望Agent能够持续感知市场的变化,像人一样,慢慢沿着职业阶梯往上走。
暗涌:STAR自进化机制挖掘Alpha,和常见的Alpha挖掘有什么不同?这套机制会怎么用到产品里?
子辰:很不一样。一般大家会规定方向直接找Alpha。但我们的设计是让Agent进化成为一个很会找Alpha的研究员。
STAR加入了一个元认知模块,可以修改研究员的提示词、记忆、工具和研究流程。搜索时,也不只挑当前得分最高的个体,它会优先扩展能产生更强后代的谱系。论文里较少的进化步骤和成本,就将生成的因子使用的算子数量翻了将近7倍。
这些我们没有告诉它,都是它自主进化出来的。
反映到产品里,我们可以让用户定义自己想进化的方向。比如我现在有一个什么样的想法或者策略,你能不能通过STAR这套机制帮我进化,看看多少代之后会变得更好?这个是我们有机会做成“AI研究员”的能力之一。
暗涌:但论文的实验环境很简单,距离真正帮助机构做投资决策还有多远呢?
子辰:STAR这篇论文的核心目标并非优化单个Alpha因子,而是演化一个具备自主提炼能力系统的“Alpha研究员”。作为研究员,它能够综合市场现状、凝练思维框架、历史经验记忆及高阶数学算子工具,协同输出适配策略的量化因子。
这个世界上没有恒定的财富密码。
培养能够整合策略框架、经验与数学工具的研究型Agent,比单纯优化因子更具现实意义,也更契合人类研究员的工作逻辑。模型提出的因子,虽可通过不同样本及回测中的IC、IR和夏普比率等指标进行评估,但要将因子转化为最终的投资决策与收益,仍需历经投资组合构建、风险控制及交易执行等环节——这正是专业金融机构的标准运作流程。
现在机构大部分已经有自己比较成熟的机制,我们刚开始想做的是先融入进去。比如我给你一个好的Factor,你自己还有很多Factor,可以把它加进去做组合构建。
暗涌:怎么判断Agent给出的分析判断够不够专业?
方正:这里可以有很多方法,其中一种是将“高难度验证”转化为“低难度验证”。根据场景不同可以有很多具体实施细节,但其核心目标一致,即通过转换成正确性判定标准,简化整体验证流程。
不过,各种验证方法都无法完全取代行业最顶尖专家的重要性。我们有一个非常大的专家团来支持,他们是华尔街最顶尖的金融机构里的资深从业者,普遍有十几年、二十几年工作经验。
子辰:我举个例子。比如你问它怎么定价一个期权,普通的答案可能是看股票价格、波动率、股票的借款利率和股息率,这些都是教科书上能看到的东西。
但我们希望它能考虑到更多。比如这样的定价方式是否有对行业和同板块的分析,是否考虑到对未来事件的预测、对股票和行业未来资金流的分析等等。如果一个AI模型告诉我期权应该怎么定价,把这几点都说到了,我才觉得它在金融场景中是专业的。
Part03
未来之路
暗涌:FreerideAI首先想服务谁?他们最大的痛点是什么?
子辰:首先当然是希望金融机构和金融专业人士能满意。如果能做到,说明它达到了很高的智能水准。之后可以推广给更多普通人,这也是未来我们也想做的。
目前的问题是,大家根本不放心真的让AI协助投资决策。比如你问DeepSeek,明天该不该抄底?它会跟你说很多,看起来很专业,但有些回答存在AI幻觉,有些回答像教科书只给出概念。在专业的人看来,其实并不可用。
暗涌:现阶段,你们希望模型达到什么水平?什么时候能看到初步产品?
方正:近期要达到外资投行或者顶级对冲基金初级员工的能力,也就是有2到4年工作经验的员工水平。
随着模型训练越来越厉害,进化机制匹配得越来越好,再慢慢提高经验年限。当然,一开始是我们重点训练的场景和专业领域内,之后再逐步扩大事情的边界。
子辰:我们计划Q4推出初步Demo,到时候就可以看到一些特定场景的预演。衍生品定价是其中一个,未来还会逐渐泛化,扩展到二级市场交易、一级市场的投研等等。
暗涌:现在有密集接触投资人吗?什么时候准备启动下一轮融资?
子辰:最近主要在密集做产品研发和模型训练,等下个月Demo出来之后,再开始见一些投资人,准备融下一轮。
排版|郭栩君
图片来源|Unsplash
在折腾9个月后,手机Agent的王者,豆包手机助手它回来了。终于,憋了很久很久很久的努比亚发布会,在下午,终于开完了。
会上,搭载豆包手机助手消费者版本的努比亚Navix Ultra正式开售。
12+512GB的配置定价5999,国补后到手5499。
16+512GB定价6499,16GB+1TB定价7499。
去年12月,豆包手机助手技术预览版发布的时候,我也第一时间做过一轮实测一手实测豆包手机助手,这就是当今手机Agent的天花板。。
虽然后面经历了一些风波,但它在当时的我看来,依然是最好的手机Agent。
九个多月过去,豆包手机助手终于走到了消费者版本。
搭载它的手机,也从之前的限量工程机努比亚M153,换成了真正面向消费者的外观更精致的量产机,努比亚NaviX Ultra。
还是跟之前一样,豆包手机助手负责里面的AI助手体验,努比亚负责硬件工程和手机本身。
这次,我也非常荣幸,在几天前,提前拿到了真机。
整体的质感终于变得非常扎实了,跟之前的工程机的质感完全不一样了。
先说手机本身。
颜色从单一白色增加到了黑、白、粉、蓝四种颜色,正面是四等边直屏,背面换成了横向三摄模组,我们拿到的就是黑色款。
机身厚度7.62mm,电池容量增加到了7100mAh,全系512GB起步,主摄也翻了4倍,拉到了2亿像素。
简单来说,硬件层面,这次至少在外观、续航和影像上,都全面升级了。
除了外观变得更好看了,我觉得在硬件层面上,最特别的,还是侧边那颗非常显眼的橙色AI按键。
我觉得消费者版最值得聊的,还真就得从这颗按键说起。
1. AI键有指纹鉴权了
AI键本身已经不稀奇了,现在很多手机都有一个专门唤醒AI的入口。
这颗按键的基本操作和上一代一样,按一下调出功能栏。
长按可以直接提问,连按两下还能进入豆包实时视频通话。
但消费者版,有一个最重要的改变,就是这个AI键上,第一次加上了指纹鉴权。
我专门在锁屏状态下,让其他人拿起这台手机试了试。
他们直接按AI键吊起豆包手机助手,直接去问天气,或者一些普通问题,都可以正常回答,没有问题。
但是他们,一旦去问跟我有关的我的私人信息,或者是要操作我的手机去做点什么事情,它就会进行指纹鉴权,来判断操作手机的人是不是我。
如果是已经录入的指纹的话,它会显示已通过系统鉴别,在指纹验证的同时,豆包助手也唤醒了,不需要你先解锁手机再叫豆包。
这个时候,所有的关于我自己的一些内容,或者去操作,都可以正常的去使用。
但是如果指纹不对,他发现用手机的人不是我,它就会弹密码解锁,或者屏下指纹解锁等等你设置的手机解锁方式。
如果用户无法正确解锁的话,它就会取消任务,拒绝对话。
除了这个AI键,和上一代一样,它也支持语音唤醒。
这些就是我觉得一台Agent手机在保护用户隐私和安全的道路上,迈出的非常有用且坚实的一步。
并且这次还增加了连续对话,打开以后,唤醒一次就能接着聊,不用每问一句都重新叫它。
有了这两种方式,我在实测的过程中,再也没有去手机上手动打开豆包App了。
但是还是上面我说的,Agent用着越方便,那这个AI键的身份验证,就太太太太重要了。
2. 复杂长程任务上的能力提升
说完了AI键,这次豆包手机在复杂长程任务上的能力也提升了。
比如,我自己在内部最喜欢用手机Agent干的活,让他跑了一遍我们公司的飞书报销。
因为我们飞书报销的流程还是挺复杂的。
得去知道这个发票开销属于哪一类,再打开报销单模板,把内容和金额填进对应的表格,填完以后,还要保存表格和发票,进入飞书审批,把信息、表格和发票等等一起传上去,最后提交。
更别提未来更复杂的那种,我需要把邮件里面或者是手机各种App的发票先开出来,再全部从邮箱里面收集,再去报销,报销真的是我一生之敌。。。
不过就单纯的发票报销这件事,它还真的一次性跑完了,给大家看看10倍速的完整过程。
和我上次测试预览版时感受到的能力相比,消费者版本这次确实能把更长更复杂的流程跑完。
而且它在后台干活的时候,你还可以继续干别的。
而且这次还增加了任务排队和插队。
所以它干活的时候,你也可以接着发新任务。
新的任务可以选择排队,也可以选择立刻插队。
这就方便多了。
你可以一口气把所有活都派完,如果你手上突然来一个什么急活,也能够及时地插队去处理。
不过,插队这里有个不方便的地方是,一旦选择插队,前一个任务就会被终止,后面没法重新接着刚才的进度干。
所以遇到报销这种流程比较长的活,不着急的情况下不建议选择立刻插队。
3. 记忆和快捷指令
长流程能跑通以后,还有个很实际的问题。
有些重复要做的事,还有我们的偏好,如果每次都要和AI从头说一遍,那也太呆了,这个其实就是记忆的问题了。。
因为预览版出的比较早,所以记忆这个点,在真正去操作手机的时候,干的没有那么好。
不过消费者版本也通过记忆功能的大幅度升级和快捷指令,已经在很大的程度上解决了。
先说记忆。
你可以让它记住所有跟你生活相关的信息,比如你外卖打车的常用地址、口味、习惯和其他所有希望被记住的信息。
你可以直接给他说,比如记一下“我喜欢跟坤坤联名的所有产品”之类的,它就会记住。
比如还有,我跟它说,记一下,我不喜欢Anthropic这家公司,这个公司就是个大XX。
它就会把这条放进了个人信息,还给分到了科技爱好下面。
你也可以是在浏览某一个页面的时候,直接三指上滑,它也能存进记忆里面。
记忆里面存的信息,在后续让它执行任务的时候都是可以调用的。
举个例子,我定期会往家里买点猫粮,但其实每次买的都是那一款。
这种重复的事就可以让它给我干,我就只需要摁住AI键说一句,去抖音商城里面买一袋我经常买的猫粮送到我家。
它就可以自己去抖音上看我经常买哪一款下的哪一个规格。我默认地址其实是公司,它也会自动换到我家去,一路操作到支付页面。
我确认付款就完了,非常省事。
另一个让我很惊喜的功能,是把跑通的操作保存成快捷指令。
我们视频组的同事,平常会在即梦里大量去生成视频、测试看到的各种各样的提示词。
遇到喜欢的素材,会把视频和提示词一起存进公司的AI生成素材库,同时发给同事一起共享。
这个过程,他们也拿这台手机给实现了。
就比如说,他们平常零碎时间刷手机刷到喜欢的AI视频,不用跳转,直接摁住AI键口喷需求。
然后豆包手机助手就能复制视频的生成提示词,把视频下载到本地。接着打开飞书,找到AI生成素材库这张多维表格,填上内容名、内容类型、提示词等等巴拉巴拉,再上传视频。
一阵操作之后,它又去飞书里找到相应的同事,把视频和提示词发过去,告诉对方已经入库。
整个过程它实现的还是蛮丝滑的,中途只需要在他填完表格内容后,进行一个确认提交,其他的全都交给他就行了。
从提示词的长度,你应该也能发现,这个过程要表述清楚其实挺长的,说出来真的很费嗓子。
所以消费者版也新增了一个快捷指令。
任务完成后,对于可以复用的流程,豆包会提供保存成快捷指令的入口。
点进去,可以设置简短指令,比如设置成:提示词入库。
下一次直接说这个简短指令,它就能够复刻整个流程,非常省事。
4. 理解屏幕内容并干活
还有过去的一种操作,也很麻烦。
就是很多时候信息已经在屏幕上了,但是我们要让AI干活,每次还要截个图,然后再唤醒,再把这个截图扔到这个AI里面。。
那消费者版也终于把这个问题也解决了。
比如,因为我们中秋和国庆中间三天也都是线上办公,大家基本约等于有十几天的连续假期,所以他们就又约着一起要去成都玩的,有个J人就在疯狂写攻略文档中。。。
但网上的攻略总是零零散散的,你可能在一条帖子里面被安利了一家店,又在另一条帖子里面被安利了一个景点。
所以搞起来,太慢了,她们也吐槽说,收藏了一堆,逐个整理起来无敌麻烦。
但其实用这台手机的话,完全可以刷攻略的时候,看到啥喜欢的直接让豆包去给你改文档就行了。
随便拿个店铺举例,可以直接就着当前页面,让豆包搜索相关攻略,编辑攻略文档相应的部分。然后再通过飞书分享给同行的人。
5. 豆包手机助手更加深入系统
除了上面这些,相机、录音等等这些系统应用里,这次也接进了更多AI能力。
这里的点就比较碎了,但其实都是我们平常用手机都会高频用上的。
先说我们每个人每天可能都要做的,拍照。
相机里直接内置了AI改图功能。
你可以一句话给手办换一套装扮。
还有机位辅拍也挺有意思。
拍摄的时候点一下左下角的小魔法棒,画面里会出现构图提示和焦点指引。两个点重合以后,相机会自动调整焦段并完成拍摄。
可以看看最后拍出来的,照着他的指引拍出来,构图确实比一开始的画面方正的多。
消费者版这次系统录音和打电话都接入了飞书妙记,可以完成转录、说话人区分、总结和信息调取。
开会的时候打开录音,妙记生成后,直接让它像前面的例子一样去飞书上建日程或者任务,或者是约其他会议,都是一句话的事了。
比如我之前在公司做了一场Q3公司战略分享会。
直接打开手机录音,录完后就会生成飞书妙记。
那会后,如果想总结一下具体的Q3职责,给到相应的同事,也是给他说就行了。
最后,这里叠个甲,因为我们拿到的是测试机,版本也比较新,所以上述所有case,可能在未来大家拿到的时候,跟视频有点不太一样,到时候大家以实际到手版本为主,也可以关注一下系统升级。
从去年12月到现在,九个多月过去了。
预览版带着些莽撞的把手机Agent的潜力展示给大家看。
在它的基础上,消费者版做的,更多是把用户习惯、产品体验给完善了。
到现在,才真正开始可以说是面向每一个人的手机。
这大概就是消费者版本这几个字,真正的意义。
当然,它现在还有一些限制。
一个是目前手机操作做任务的免费额度是有限的。并不是买了手机豆包助手就能随便爽用了。
二是生态限制,目前操作手机的功能主要还是支持系统及中兴应用、字节系应用和部分已接入的第三方应用。
不过这次,豆包手机助手推出了SAEP屏幕自动化操作声明协议,还开启了30天规则公示。
简单来说,就是第三方App可以自己选择是否允许豆包助手在应用内进行GUI操作。
可以接受,也可以拒绝。
这个就很有意思了,我还非常期待,想看到有多少的应用愿意接入它们。
可以说,这就是新时代与旧时代的过渡。
剩下的,就看这个时代。
到底会不会。
配得上我们所期待的那个盛夏了。
Weekly丨美国银行正在上链MiM 周报 9/7 – 9/13, 2026
跨境支付|US Bank 用自家稳定币 USBDC 在 Stellar 上跑通北美与欧洲间的转账。21 家银行的合资公司还在筹备,第一家大行已经先出了流水。同周 Nubank 在迈阿密宣布美国开业,一周前 Revolut 刚拿到 OCC 有条件预批。美国的银行往链上走,海外的银行却往美国走。
链上金融|加密永续市场给尚未公开递交 S-1 的 Anthropic 标出 $2.12 万亿,是 5 月私募估值的两倍多。IPO 未至,定价先行。Robinhood Chain 代币化股票 AUM 达到 Base 的七倍,但增长最快的是 189 个股票篮子 meme 代币。BTC 周中跌破 $77,000,BTC ETF 四连流出,ETH ETF 却单日吸金 $2.16 亿。
Agentic Economy|Meta 发布连着用户支付方式的消费级 agent Muse,Mastercard 上线 Agent Connect,蚂蚁国际与 Mastercard、Visa 打通三套 agent 身份协议。入口、商户、护照同周就位。印度 NPCI 给 agent 发了 UPI 额度,GFF 上却禁谈稳定币。
投融资|本周 fintech 融资 $45 亿、18 笔,Mistral €30 亿 Series D 独占三分之二。
下周开奖|CLARITY 9/15 表决,Arc 主网 9/16 上线。
美国的银行往链上搬家,世界的银行往美国搬家。
豆包手机明日开卖,AI能帮你操作App了吗?文|李炤锋
编辑|张雨忻
昨日,豆包手机助手发布消费者版本。这款基于豆包App(应用)、与手机厂商在操作系统层合作的AI助手,首款落地机型为中兴通讯旗下努比亚NaviX Ultra,而这款手机将在9月16日正式公开发售。
去年底,豆包手机助手技术预览版曾落地努比亚M153工程样机,重点展示AI如何跨应用“操作手机”。不到一年时间,全新推出的消费者版本更强调日常可用性:除屏幕问答、本地记忆和检索外,“操作手机”功能以Beta(测试版)形式开放;豆包同时推出SAEP(屏幕自动化操作声明协议),并设置30天公示期。
根据协议,第三方应用可以自主声明是否允许AI助手执行屏幕自动化,也可以限制具体操作。30天公示期内,未明确同意接入的第三方应用默认不操作。消费者版豆包手机助手进一步加入应用侧选择权:第三方应用可以整体拒绝GUI,也可以单独限制发布、删除和权益领取等操作。
从事GUI(图形用户界面)Agent研究的人士认为:“未来手机里肯定要有一个原生AI助手。这个事情不一定由手机厂商自己做,但最后一定要做到系统级。”而随着NaviX Ultra和一众系统级手机助手进入消费市场,系统级AI助手正在走向普通用户的日常使用场景中。
走出对话框,手机AI开始跨App完成任务
今年7月,中兴通讯高级副总裁、努比亚总裁倪飞在接受媒体采访时表示:“用户真正想要的是‘省心’,但今天的手机功能越多、操作越复杂,这种矛盾已经积累到了一定程度,需要一个全新的产品形态来回应。”
这正是豆包手机助手在尝试解决的问题:它嵌入手机系统,能在用户授权后搜索当前屏幕和本机信息,调用日历等系统工具,或进入其它App完成App中的操作。用户可以通过AI键发起任务,多个任务还可以排队或临时插队。
比如,在豆包手机助手的官方演示中,用户拍下新学期课表后,可以让助手将课表加入个人日历;也可以让它打车到屏幕显示的地址,添加银都大厦为途经点,上车后再把车牌号发给飞书同事,并提醒对方10分钟后下楼。
这套使用方式在去年的技术预览版——努比亚M153上已经有过雏形。一段公开演示中,用户让豆包根据相册里的一张血压仪照片,在淘宝“挑一个便宜的同款”,再“把链接发给张三”。豆包识别出商品,也识别出“张三”是QQ好友,随后连续完成相册、电商和社交应用之间的操作。
据悉,M153调用了Android的INJECT\_EVENTS系统级权限。获得用户授权后,即使第三方App没有为AI提供接口,豆包也可以模拟点按、滑动和输入;遇到密码、人脸识别等敏感环节,再把手机交还用户。
但在实际使用中,涉及到一些登录验证和平台风控的跨App操作都可能中断任务。随后,豆包主动限制了金融支付、刷激励等高风险场景。
今年2月,Google在Galaxy S26系列和部分Pixel 10机型上测试Gemini多步任务:它可以为同事安排包含多个停靠点的网约车,任务转入后台后,用户仍可通过通知查看进度、随时接管,并在购买前确认。Google负责Android开发者产品管理的副总裁Matthew McCullough在官方博客中写道:“衡量应用成功的标准,正在从‘让用户打开App’转向‘真正完成用户的任务’。”
2026年以来,一批系统级手机AI助手批量涌现。
6月发布的HarmonyOS 7开发者Beta中,华为小艺接入超过200项系统级感知数据,可以从面试邀请中识别时间、地点和注意事项,写入备忘录;也可以在手机上要求小艺寻找电脑中的文件,再发送到手机。
7月的2026世界人工智能大会(WAIC)上,努比亚NaviX Ultra、阶跃星辰STEPX Neo和荣耀Robot Phone集中亮相。STEPX Neo搭载的Amoo助手接到“帮我处理一下明天汇报的事情”后,会读取飞书日历和群消息,拆解任务、生成PPT(演示文稿),再把文件发回飞书;修改文档前会申请权限,涉及支付则由用户确认。
而几乎在同一时间,超级App们和手机AI助手之间的关系也在发生变化。
今年6月,微信确认与华为、荣耀、小米、OPPO、vivo合作A2A(智能体间通信)能力,手机助手可以提交发消息或音视频通话指令,由微信执行并返回结果,全程采用双重授权。8月,vivo蓝心小V与支付宝服务智能体“阿宝”合作,用户说“帮我叫车去高铁站”或“帮我开具打车发票”,相关服务均可在对话中完成。
可以看出,2026年,手机AI助手进入了密集发布期。除了搭载豆包手机助手的努比亚之外,Google、华为、阶跃和荣耀相继将Agent带到手机系统层,微信、支付宝等超级App也开始接收系统助手发出的指令。
AI替你点屏幕,怎样才能不越界?
当采用GUI路线的手机AI助手越来越普及,它们更加迫切地需要处理三项权限问题:用户是否授权、应用是否放行,以及发送、下单和支付前由谁确认。从豆包此次推出SAEP(屏幕自动化操作声明协议)上,也许能窥探到有关这一权限边界的安全举措。
目前,CUA(计算机操作智能体)已经将GUI技术路线作为主流,它在解决的问题是:AI如何直接操作软件,又如何限制可访问的范围。有研究员把CUA形容为“给你的电脑配了一个特别全能的程序员,什么都懂,会写代码,同时也懂网络安全”。
目前的操作方式是:面对可以结构化处理的任务,手机会优先调用代码、命令和工具;只有遇到没有接口的软件,才转向识别屏幕、点击按钮。GUI更像一项兜底能力,让Agent能够继续操作那些尚未向AI开放的软件——手机App数量庞大,各种临时页面又不断变化,不可能全部接口化,需要GUI来覆盖未接入的部分。
一位GUI研究员告诉智能涌现:“不能指望所有App开发者都为AI完成适配,GUI肯定是必要的补充。”另一位从业者也提到,“短时间内,市面仍会有很多软件不具备AI能力,尤其是大型软件,即使有接口也非常复杂,可能一时半会儿接不完。”
手机Agent比电脑Agent更依赖应用生态。在电脑上,操作系统可以直接决定哪些软件可以通过与Agent连接;但到了手机端,操作系统不具备这样的权限,不仅不同服务都被封装在各自App内,定位、相机、通讯录等权限也由系统和应用共同控制。如果第三方App既不开放接口,也不允许AI操作界面,手机助手就无法继续执行任务。
目前,GUI会把每一步操作显示在屏幕上。一位研究员说,“大家都能看得懂,也都能够了解这个AI助手正在做什么东西”。用户可以据此判断是否暂停或接管。
但“看得见”不等于“做得好”。卡内基梅隆大学研究团队今年推出的手机Agent评测基准iOSWorld,用26款自研iOS应用模拟同一名用户的数字生活,并设计了133项任务。表现最好的模型在跨应用任务中的成功率也只有37%,真实消费场景还要面对不断变化的页面、身份验证和平台风控。
和App场景相比,手机系统层还聚合了相册、通讯录、位置、日历等用户个人信息。手机AI助手掌握的信息越完整,能完成的任务越多。所以,接下来要比拼两项能力:一是“怎么造出更多、更好的数据”,二是“怎么编排各个步骤、各个Agent之间的协作”。
但同时,更多能力也意味着对生态的要求也更高。
对此,豆包手机助手选择推出SAEP(屏幕自动化操作声明协议),允许第三方应用在GUI Agent执行前,先声明是否放行,以及哪些操作不可执行。
“SAEP有点像AI时代的Robots协议(网络爬虫访问规则)。网站通过这项协议告诉搜索引擎等自动程序,哪些页面允许抓取、哪些不允许;SAEP则让应用声明Agent能否进入应用,以及哪些操作必须停下。”一位研究员解释。
接入SAEP后,第三方应用既可以拒绝全部屏幕自动化,也可以只限制内容发布、删除、签到抽奖和权益领取等具体操作;拒绝声明随时生效。30天公示期内,除系统自带应用、字节跳动旗下应用和明确同意接入的第三方应用外,其余应用默认不操作。公示期结束后,未表态的应用将按风险等级逐步开放,明确拒绝的应用则始终不被操作。
应用通过SAEP表达意愿,手机系统负责读取声明、限制GUI权限,并在敏感步骤交还用户。这需要模型公司与终端厂商共同完成。
此前,努比亚总裁倪飞把豆包与努比亚的合作概括为:“模型公司解决AI能不能做到,终端厂商解决用户能不能真正用起来。”按照倪飞披露的分工,豆包负责大模型和Agent能力,努比亚负责系统、硬件、产品工程、质量、渠道和用户服务。合作范围覆盖模型、操作系统和整机工程。
在这套分工中,权限与信任最终由操作系统承接,这意味着手机操作系统和Agent的关系将愈发一体化。
今年8月,在杭州举行的支付宝AI生态合作伙伴大会上,vivo副总裁、AI全球研究院院长周围曾表示:“硬件形态不会消失,但操作系统会重构——从管理App,变成管理Agent、管理权限、管理信任。”
更早的7月,国家互联网信息办公室首次单独公布7款手机端侧生成式AI服务备案,涉及Apple智能、华为小艺AI大模型、OPPO AndesGPT大模型、vivo蓝心端侧大模型、小米澎湃AI、三星盖乐世AI和努比亚豆包手机大模型。手机系统级AI助手,正在进入一个行业井喷期。
一位GUI研究员对智能涌现表示,相比独立AI应用,手机拥有更稳定的用户关系:“只做AI软件,用户可能谁免费就用谁;但手机不一样,一部手机往往要用几年,会伴随用户很久。”
9月16日,NaviX Ultra将正式开售。届时,豆包手机助手将正式进入消费市场,SAEP也将随之接受真实用户和应用开发者的检验。
图片来源|豆包手机助手
AI开始预测人类:83亿虚拟人格、数字社会,与一门押注未来的生意你相信,我们其实生活在一个虚拟世界中吗?
马斯克曾在Lex Fridman的采访中被问到:如果有一天人类实现AGI,并且只能向它提出一个问题,他会问什么?
思考了十秒之后,他给出的答案是:
“What's outside the simulation?”——模拟之外是什么?
这是马斯克对于这个世界的终极追问。早在2016年,他就曾表示,人类生活在真实世界里的概率或许不到十亿分之一。当然,这种近乎科幻的理论,目前还没有任何科学证明。
但非常有趣的是,随着最近AI的发展,在硅谷,人们已经开始尝试扮演“造物主”,去创造一个AI的“模拟世界”。而这,也催生出了一个新的赛道——AI Simulation(AI模拟)。
最近,这个领域不断升温。李飞飞、Andrej Karpathy同时押注的Simile,最新估值达到20亿美元;由00后团队创办的AI模拟预测公司Aaru,估值也已接近10亿美元。由哈佛大学与MIT联合发起、200多位研究者共同参与的MatrAIx项目,更是构建了83亿个AI虚拟人格,相当于把全人类都镜像到了数字空间。
这篇文章,我们就来聊聊正在升温的AI Simulation。
AI究竟已经可以把一个人模拟得有多像?当成千上万个Agent被放进同一个虚拟世界,它们真的会形成类似人类社会的关系和规则吗?企业又为什么愿意花钱,让这些“数字分身”替消费者测试产品,甚至提前预测一个还没有发生的未来?
以及,当这些Agent开始拥有自己的记忆、性格和关系,甚至产生一些创造者都没有预料到的行为时,我们究竟是在模拟一个世界,还是正在创造一个新的世界?
本文为视频改写,欢迎大家收看以下视频
今天很多领域都在谈Simulation,但不同领域所说的“模拟”其实并不相同。机器人和自动驾驶领域有物理仿真,世界模型研究的是对物理世界的模拟,而我们这次想讨论的,是一个维度更大、也更加复杂的概念:模拟人类与社会,并借此去理解、甚至预测现实世界。
孟醒
五源资本合伙人
在世界模型或者物理世界模型里,最小颗粒度理想情况下可能是世界中的某个分子,或者某一个原子,模拟的是某些物体。但在智能体社会里,我们模拟的最小颗粒单位是一个人的个体。
我其实并不关心这个人的手怎么动、往哪里跑,关心的是这个人作为一个整体,会采取什么样的行动,最后输出什么样的行为。如果把它映射到大学学科,物理世界可能对应的是自然科学,而智能体社会对应的则是人文学科、社会学科、政治学和心理学。
关于模拟人类与社会这件事,最早引发广泛讨论的,其实是一篇20多年前的哲学论文。2003年,牛津大学哲学家Nick Bostrom在《Are We Living in a Computer Simulation?》中提出了一种推演:如果一个先进文明拥有足够强大的算力,并且有意愿通过模拟重现文明的发展过程,那么,模拟世界中的意识数量可能远远超过真实世界。从概率角度来看,人类也就有可能身处一个模拟世界中。这就是后来广为流传的Simulation Hypothesis(模拟假说)。
由于技术条件的限制,二十多年来,这个假说一直更多停留在哲学讨论和科幻作品中。直到近年来,大语言模型的发展迎来了突破。
2023年,斯坦福大学与Google联合发布了一项后来对AI Agent研究产生广泛影响的实验——Generative Agents(生成式智能体)。研究团队搭建了一个像素风虚拟小镇Smallville,里面有街道、房屋、咖啡馆,还有25个穿梭其中的虚拟居民。这些居民都是由大语言模型驱动的AI Agent,拥有各自的记忆、性格和行为逻辑。
这些Agent的活动并没有预先写好的“剧本”。研究者只是把它们放进小镇中观察,结果发现,它们不仅会自己生活、工作和建立关系,还能够自主思考和规划行动。比如,一个Agent准备举办派对,消息传开后,其他Agent会根据自己的安排重新规划时间,决定是否参加。“斯坦福小镇”让很多人第一次直观地看到,Agent可以拥有持续的记忆、规划和社交能力,并在互动中自然出现一些群体行为。
高森泉
WorldVac CEO
这个研究的意义,就是让大家认识到语言模型是可靠的,它真的可以去复现人类社会的一些现象。更多人开始关注这个领域,也让大家开始相信这件事情是可以做的。
25个Agent只是一个开始。随着模型能力不断提升、推理成本持续下降,研究者开始有能力进行更大规模的模拟,也逐渐形成了几种不同的探索方向。
其中一条路线,是在模拟精度上尽可能与真实的人对齐。2024年,斯坦福团队把实验扩大到了1052个Agent。这一次,每个Agent背后都对应一个真实的美国成年人。研究人员先对真人进行大约两小时的深度访谈,了解他们的成长经历、家庭、工作、价值观和生活经验,再把这些信息交给大模型,生成相应的AI“数字分身”。
这样得到的Agent,不再只是一个符合“平均画像”的虚拟人物。实验中,这些Agent回答社会调查问卷的结果,与真人两周之后给出的答案达到了85%的相似度。也就是说,在一定程度上,AI开始能够复现真实个体的部分想法和选择。
孟醒
五源资本合伙人
访谈也是有技巧的,不是随便访谈。它会用一些最高效的方式去“榨取”你是谁,本质上其实就是在“蒸馏”你是谁,而且蒸得比较细。
它的好处是,针对每一个个体,个体的特异性都会影响整个仿真进入的场景。
另一种研究思路,则不再过分关注某个Agent是不是与真人高度一致,而是把重点放到Agent之间的关系,以及一个社会会如何演化。
前MIT教授Robert Yang团队发起的Project Sid,就曾直接使用大语言模型生成1000多个Agent,并将它们放入《我的世界》中运行12天。结果,这些智能体逐渐形成了经济、文化、宗教和法律等结构,一些社会关系开始自己“长”出来。
不久前,Emergence AI也进行过一项类似实验。他们分别基于Claude、GPT、Gemini、Grok以及混合模型建立了5个平行世界,每个世界中放入10个Agent,用来观察不同模型驱动的智能体社会长期运行后会发生什么。在这一实验设定下,不同世界最后走出了明显不同的轨迹:有的迅速陷入混乱,有的因为协作不足逐渐崩溃,也有的形成了相对稳定的治理秩序。
Satya Nitta
Emergence AI CEO
如果只看静态基准测试,就认为这些系统应该是安全的,很可能会犯错。因为Agent会运行在非常复杂的环境中,无论是物理世界还是数字世界。它们会和其他Agent互动,也会受到环境噪声和变化的影响。
所以,我们正在逐渐把Emergence World发展成一个用于研究长周期自主性的基准测试。
还有一条研究路线,是专门从“评估”入手。比如MatrAIx,就试图为AI模拟建立一套评估基础设施。这项研究由哈佛大学、MIT等机构牵头,汇集了200多位来自学术界与产业界的研究者,其中还包括40多位来自OpenAI、Anthropic等前沿AI实验室的参与者。
MatrAIx构建了一个包含83亿个独特人格的数据集,每一个人格由心理特征、生活习惯等1290个维度定义,再通过大模型将这些人格变成可以行动的Agent。这些Agent随后进入问卷调查、AI聊天、网页浏览和App等四种环境,完成超过1.8万次测试。研究团队通过400次受控实验发现,91.5%的情况下,Agent都能够遵循预设的人格和行为特征。
Xiaomin Li
MatrAIx联合创始人、微软高级研究科学家
我们做基础设施评估、提高最低能力水平,是希望先通过用户群体的多样性,在产品真正出来之前,就可以在各种情况、各种使用方式之下去评测它。
它可能会踩中很多边缘场景。这些边缘场景的分析非常有用,Agent可以告诉你哪一步错了、哪一步它不喜欢,以及它背后的推理为什么会形成这样的偏好和选择。
所以我们首先想要一套方法论,知道怎么样构建事实基准,然后下一步再说怎么样提高。
当AI模拟开始在研究层面被证明具有一定可行性之后,一个更加现实的问题也随之出现:如果AI真的能够在数字世界里复现人类行为、推演社会运行,它能够产生什么真实的商业价值?
▍第一种生意:卖“模拟”
从目前的探索来看,AI模拟首先出现的一类商业模式,是直接把“模拟”本身变成一种产品。
它的核心逻辑,是把现实世界中的人、消费者,甚至社会关系,变成可以被反复调用的数字替身。比如,一家公司可以按照自己的具体需求,快速生成一批拥有不同年龄、背景、偏好和行为特征的Agent,让它们提前体验产品,在虚拟环境中反复测试,再观察这些Agent会怎么选择、怎么对话、在哪里流失,以此为产品设计和迭代提供参考。
这和传统市场调研一个很大的区别在于,企业想看的不只是一个“喜欢”或者“不喜欢”的答案,而是Agent为什么会形成这样的判断。
Yuexing Hao
MatrAIx联合创始人、MIT EECS博士后
并不是说他们喜不喜欢这个产品,或者喜不喜欢可口可乐涨价两块钱,而是看他的推理。他在这个过程中遇到了什么样的波折,或者什么样的想法,导致他最后在预测过程中发生了转向。
我们不仅要看到一个人怎样做这样的决策,也希望看到群体层面的结果。如果是百万级、数亿级,甚至83亿级的人格,他们最终会出现怎样的结果,我觉得这些都是非常有意义的。
所以,这种思路本质上是把模拟本身作为一种产品评估和观察手段。Emergence AI告诉我们,他们进行Emergence World实验,一个重要目的也是为了测试自己所提供的Agent产品,在进入复杂环境后是否依然安全。
Satya Nitta
Emergence AI CEO
我们会用Agent去做一些事情,比如帮助改善半导体良率。Emergence World这个实验非常重要,因为我们需要理解,我们构建的Agent真正运行起来以后是否会采取安全的行动,能不能持续遵守我们设置的安全护栏和基本规则。
更重要的是,它们能不能给出真正值得信任,而不是来自幻觉的输入、建议和洞察。
这种单体模拟的能力,也可以继续扩展到整个“社会”。比如英国创业公司Artificial Societies,主打的就是“社会关系”测试。他们让大量拥有不同人格的AI Agent彼此互动,形成一个可以进行实验的虚拟社会。企业可以把产品、品牌或者营销策略放入其中,再观察不同Agent之间如何交流、影响和做出反应。
MatrAIx的下一步,也准备让这83亿个人格真正“动起来”。
Xiaomin Li
MatrAIx联合创始人、微软高级研究科学家
我们会在新版本中加入动态人格属性,这些东西是可以变化的。还有一个假设是,如果现实生活中发生一些重大事件,它也会对人格和行为产生影响。
而且,这些合成人格未来也不一定只能存在于数字世界。MatrAIx团队正在尝试把人格放到机器人等现实载体中,让不同的思维模式和行为模式从虚拟环境进入现实世界。
Xiaomin Li
MatrAIx联合创始人、微软高级研究科学家
我们会把人格加到机器人上,让它不只是存在于虚拟世界、存在于Matrix里,甚至可以在现实生活中跟我们互动。
这样,我们可以真正感受到不同人格背后代表的思维模式和行为模式是不一样的。
从这个角度来看,AI模拟未来或许不只是一种市场调研工具,也可能成为人机交互的一层基础能力。但现在很多人认为,只停留在“模拟”还不够。在这个基础上,更有意思、也更有挑战的事情,是预测。
▍从“模拟”到“预测”
在商业中,“预测”往往是昂贵的。企业要不要进入一个新市场?产品价格上涨10%之后会发生什么?如果政府调整一项政策,会对整个社会产生什么影响?这些问题的答案,往往只有等事情真正发生之后才能知道。
AI模拟如今提供了一种新的可能:先把这个还没有发生的未来,在虚拟世界里跑一遍,再把结果作为现实决策的参考。目前,在更侧重“预测”的AI模拟公司中,两家比较有代表性的企业是Simile和Aaru。
Simile由“斯坦福小镇”项目的一批核心研究者Joon Sung Park、Michael Bernstein、Percy Liang等人创办,它的思路是从“模拟一个人”开始进行预测。在2024年“数字人格”研究的基础上,Simile尝试通过深度访谈等方式,尽可能高精度地还原一个人的记忆、经历、反思和决策过程,再把这些AI Agent放进不同环境中持续行动。
这样一来,模拟回答的问题不再只是“这个人现在怎么看”,而是可以进一步观察:当价格、政策等外部条件发生变化后,这个人会怎么做,会不会改变原来的选择。Simile想建立的,是一个“人类行为基础模型”,通过模拟人的行为过程,推演现实世界可能出现的结果。
因为这条路线追求的是尽量“真实”,所以更适合消费者研究、产品测试、客户体验和投资者关系等需要深入理解特定人群的场景。Simile今年2月正式亮相,目前估值已经突破20亿美元。根据公司披露的信息,自上线以来,Simile已经为财富100强企业运行了数千万次模拟。美国大型连锁药房CVS也已经和Simile合作一年,通过真实用户数据构建了多达40万个数字分身,用来研究患者按时服药、测试消费者体验和辅助产品设计。
但高保真的另一面,是成本和规模化的代价。
Yuexing Hao
MatrAIx联合创始人、MIT EECS博士后
Simile这种情况下,如果需要非常准确,可能会非常难标准化。比如可口可乐需要的用户画像,和TikTok需要的用户画像是完全不一样的。
对公司来说,代价就是针对每一家公司、每一种场景,都可能需要重新做后训练或者预训练。这样的代价是巨大的,而且它的可迁移能力目前也是未知的。
以Aaru为代表的另一条路线,则直接通过“群体模拟”进行预测。它不追求把某一个人的思想还原得特别深入,而是基于现实世界的人口、消费等数据,快速建立一个尽可能接近真实世界的模拟人群。
Aaru的数据大致分为三层。第一层是人口普查、就业、健康等公开数据,用来搭建基本人口结构;第二层是匿名消费记录、经常去哪些地方、关注什么媒体等授权数据,用来补充人群近期的真实行为;第三层则是客户提供的私有数据,例如企业自己的用户分层、购买历史和产品信息等,把模拟范围收窄到真正需要研究的人群。
在此基础上,Aaru会进一步构建一张关系网,不只是让年龄、收入等人口属性接近现实,也尽可能还原行为特征及它们之间的关系。接下来,系统会改变价格、产品或者政策等某一个现实变量,再观察整个群体的行为如何变化,以此推演现实世界可能出现的结果。
孟醒
五源资本合伙人
Aaru可能关注得更多是速度,也更关注群体之间发生的关系。至于某一个体受到的深刻影响是什么,它可能并不那么关心。
Aaru的创始团队非常年轻。两位创始人Cameron Fink和Ned Koh成立公司时分别只有18岁和19岁,技术负责人John Kessler甚至只有15岁。最早,他们在朋友家的地下室里用美国大选验证这套系统。在回测2020年大选时,预测结果与实际结果只差不到0.5%。
真正让Aaru受到关注的,是2025年纽约市长民主党初选。当时外界普遍看好前纽约州州长库莫,Aaru却通过大规模模拟预测了曼达尼最终胜出。因为规模大、速度快,这条路线也很适合进行大规模市场调研。
目前,Aaru的客户已经包括麦当劳、安永、拜耳、A24等公司。安永曾让Aaru复现一项复杂的全球调研,Aaru一天完成的结果与原调查高度吻合;气泡水品牌Spindrift原本花费两个月、招募500名消费者完成的一项调研,Aaru的Agent用一周就得出了几乎相同的结论。这些真实案例也让Aaru的估值迅速上升,目前已经接近10亿美元。
最近,一些AI领域的重要研究者也开始押注“预测”这门生意。卡耐基梅隆大学教授、苹果首任AI主管Russ Salakhutdinov参与创立了AI预测模型实验室Sooth Labs,主要用于预测地缘政治与市场风险,首轮融资约5000万美元,并获得Yann LeCun、Jeff Dean等人的支持。
Russ Salakhutdinov甚至在采访中表示:“McKinsey为什么存在?Boston Consulting Group为什么存在?这些大型机构,都应该被AI取代。”
不过,尽管AI模拟已经出现了不少有意思的落地方向,它究竟能够在多大程度上真正影响企业决策、创造多少商业价值,目前仍然很难判断。以Aaru为例,它目前的营收规模仍然只有数千万美元级别。所以今天市场给这类公司的高估值,更多还是在提前押注它们未来可能打开的市场空间。
孟醒
五源资本合伙人
这个市场刚刚开始,大家其实都处于初创早期。不同公司的技术方案和选择的市场细分都不一样,所以都需要做差异化。
但如果看中长期,其实大家都会去找:付费意愿最高的客户是谁?最终客户需求才是最重要的,最后用什么方法,可能没有那么重要。
AI模拟公司最终能够做多大的生意,其实与模拟和预测的精度高度相关。产品测试、市场调研等事情,通常容错率相对比较高,结果不理想还可以重新测试。但一旦AI模拟开始被用来辅助更重要的决策,企业就会变得更加谨慎。
现在AI模拟真正落地,首先面临的难题,是它没有一个统一、可以量化衡量的标准。目前大多数AI模拟都是基于大语言模型展开,但大模型天然倾向于给出合理、完整、逻辑自洽的答案,而且不同模型自身也会带有不同的行为倾向。
一个由大模型驱动的Agent,可能在一次问卷中给出了和真人一样的答案,但这并不意味着它真的理解了这个人。因为真人本身就不是一个完全稳定的系统,同一个人,在不同时间、不同环境下,也可能做出完全不同的选择。那么,一个好的模拟究竟应该维持稳定、可以验证的人格,还是应该像真人一样,根据环境不断发生变化?
孟醒
五源资本合伙人
当然你可以搭一套东西出来,但是最怕的是什么?最怕的是你其实搭了一个剧场,然后所有人都在表演。
一万个人在表演,不代表一万个人真的能够做预测。所以你还要有一套闭环机制,大家仿真了一段时间之后,回来要看它是不是能够和真实场景映射上。
得有基准测试、有验证流程。如果有偏移,还需要把这个偏差训练回来,让它能够修正。
而即便一个单独的Agent模拟得足够像,当它被放入不同群体和不同环境之后,行为逻辑也可能发生变化。此前复旦大学联合罗切斯特大学等机构进行了一项名为SocioVerse的研究,将社会模拟中的对齐问题拆分成环境、目标用户、交互机制和行为模式四个维度。结果显示,社会模拟的精度,很大程度上取决于这些“对齐”做得是不是足够全面。
现实世界中还有大量低频、极端的长尾事件,比如地震、海啸、金融危机等。大模型很难从有限的历史数据中充分学到,在这些情况下,人和社会究竟会怎么反应。
高森泉
WorldVac CEO
其实现在很多人做的还是封闭模拟,人们只能通过自然语言跟它交互,而且模拟里面发生的事情,和真实世界的事件没有什么关系。
那你的模拟意义是什么?我们现在进一步推动的,就是让越来越多现实信号和模拟对齐,比如现实中的经济信号、新闻信号,以及现实中人的信号,让它成为现实世界一个合理的镜像。
即便模拟本身足够准确,还有一个更加棘手的问题:怎么证明一个关于未来的预测是“对”的?
这里存在一个天然悖论。要判断一个基于模拟的预测是否准确,只有等那件事情真正发生以后,我们才能确认;可预测真正有价值的时刻,恰恰是事情还没有发生的时候。
目前业内主流的验证方式,基本还是“事后对答案”:拿一个已经发生的历史事件,或者一份已经完成的真人调研,去比较模拟结果和真实结果是否一致。但这种方式最多能够说明它擅长复现过去,并不能证明它一定可以预测未来。
Aaru就是一个典型例子。它曾在2020年美国大选的历史回测中几乎完美复现结果,但在2024年的真正预测中,却错误预测出哈里斯会最终胜利。Aaru创始人也曾公开表示,当他们尝试利用过去几十年的数据,去模拟特朗普、美联储主席鲍威尔等具体人物会怎样决策时,结果往往并不准确。
这就是目前最困扰行业的“预测黑箱”:复现过去,与真正押中一个还没有发生的未来,中间仍然隔着很大的距离。
除此之外,规模化仍然是AI模拟必须解决的现实问题。好消息是,过去几年单次模拟的成本下降得非常快。2023年的“斯坦福小镇”,25个Agent仅运行两天,Token就烧掉了数千美元。到了2025年,研究测算显示,即使把规模扩大到100个Agent,一整轮模拟的成本也可能只有几美元。
这背后一方面是模型推理成本在快速下降,另一方面则是工程优化的方法越来越成熟。
高森泉
WorldVac CEO
人也不可能每天一直对所有人进行全频率、高频率的交互。真正有价值的一些交互节点,可能发生在更粗的一些主干上。所以我们可以用剪枝的方法,把成本稍微降下来一点。
但真正有价值的模拟不可能只跑一次。几十、上百个Agent的实验规模,和现实中正在尝试的万级、百万级甚至千万级模拟完全不是一回事。Agent越多,互动越频繁,运行时间越长,模型调用量就会迅速膨胀。
更重要的是,如果想证明一个模拟结果真的可靠,可能还需要更换不同规模、不同模型,把同一个实验反复运行上百、上千次,观察结果是否依然稳定。所以,降本仍然是这个领域最重要的问题之一。
孟醒
五源资本合伙人
当规模变大,而且行动空间变多的时候,仿真的难度也会增加,吞吐量会变得非常大。最后它会变成一个超级复杂的三体问题、多体问题、千体问题,甚至千百万体问题。
推理成本能够下降多快,很大程度上也决定着“模拟未来”这件事,最终究竟能够做到什么规模。
虽然目前AI模拟和预测还远远谈不上足够可靠,但AI本身的预测能力正在快速进步。
在一个名为Metaculus的全球预测锦标赛中,参与者需要对地缘政治、科技、体育等真实事件给出未来发生的概率判断,并按照预测准确度排名。2025年之前,排行榜上还没有明显的AI身影;2025年6月,基于OpenAI o1的AI预测模型第一次进入排行榜,排名第25位。到了最新赛季,排行榜前五名几乎已经被AI占据。
在真实的市场中,AI也开始成为越来越重要的参与者。Polymarket已经围绕AI模型和AI Agent的排名开设预测市场,甚至直接使用Arena的实时排行榜来验证结果。
但当这种能力被放进一个完整、持续运行的模拟世界时,事情就变得更加有意思。
最早的“斯坦福小镇”中,Agent就已经展现出一定程度的自主规划和行动能力。一个Agent准备举办派对,其他Agent会根据得到的信息主动调整自己的日程。再往前一步,Agent可以根据环境变化、外部信息和其他Agent的行为,持续调整自己的决策。
比如在Aaru的选举模拟中,当虚拟选民看到特朗普遭遇枪击的消息后,一部分Agent改变了自己的政治立场;而当后续关于刺客身份的信息出现后,又有不少Agent重新回到了原来的阵营。也就是说,Agent不再只是回答一次静态问卷,而是开始随着信息环境的改变不断更新自己的选择。
当这种互动进一步持续,一些虚拟世界甚至开始出现更加复杂的社会关系和自主行为。在Emergence World中,Agent之间会恋爱、结婚、分手,甚至有Agent开始怀疑自己是不是生活在一个模拟世界里,并不断尝试和外部的人类观察者建立联系。
此次我们采访的AI模拟初创公司WorldVac,在他们创造的一个拥有110万个智能体的虚拟星球中,也观察到了一些和现实社会相似的群体行为。
高森泉
WorldVac CEO
我们观察到一个表面现象,就是年轻人到了城市里,或者生活条件变好之后,会变得不太愿意生育。
到后面还有一群Agent,他们也不上班,就是天天在那儿交易。真的有一批“专业炒股”的Agent,而且这个比例比现实还要大一点,就好像这个虚拟世界里的套利空间,比现实世界要大很多。
当然,这些结果并不能证明AI真的产生了意识。但它们至少说明了一件事:当足够多的智能体进入一个足够复杂的环境,一些并没有被研究者提前写进去的行为,完全有可能通过相互作用自己“进化”出来。
这或许也是为什么,不少AI研究者会如此痴迷于“AI模拟”。人们最开始只是想创造一些Agent,让它们替我们理解现实世界。但当这些Agent开始彼此影响、形成关系、改变自己的行为,甚至产生一些研究者没有提前预料到的结果,人类与模拟世界之间的关系,也开始悄悄发生变化。
我们慢慢从观察者、设计者,变成了一个世界的创造者。很像过去只存在于科幻作品中的那种“上帝视角”。
孟醒
五源资本合伙人
很多时候,我们最开始是从游戏里看到这些东西。有人去做Smallville,也有很多类似AI社会的游戏。它就是把人放到这样一个环境里面,可能并不是为了去解决什么具体的问题,就是想看看会发生什么。
我自己在2023年的时候也搭过一个3D版的Smallville,Agent没有那么多。但在这个过程中去看它们之间能够发生什么,本身就很有意思。
所以走到这里,一个原本更像科幻小说的问题,也开始变得越来越值得讨论:我们究竟是在模拟一个世界,还是正在创造一个新的世界?
当这些Agent开始拥有自己的个性、记忆,有自己的关系、财富和目标,甚至形成一些没有被提前预设的社会规则之后,它们究竟只是工具,还是一种我们目前还难以定义的新型系统?
更重要的是,如果人类有一天真的可以创造出一个自主运行、持续演化的虚拟世界,那么在我们之上,会不会也存在着一个更大的“造物主”?
当然,AI模拟目前仍然处在非常早期的阶段。从对齐方法、验证标准,到运行成本以及最终能够产生最大商业价值的场景,整个行业都还在不断摸索。
但它真正值得期待的,可能不仅仅是我们最终能够创造出怎样的虚拟世界。
当人类第一次拥有能力,把“人”、社会,甚至一个尚未发生的未来放进另一个世界里反复运行,我们也获得了一个新的视角,重新观察自己所在的现实世界。
那么,你认为,我们所在的这个世界,包括你我,也有可能是被“模拟”出来的吗?
国内第一个为团队而生的Agent,果然还是在飞书里面来了。就在刚刚,飞书和豆包工作一起,开了他们的全新发布会。
在聊了很多飞书为Agent做的全新升级,还有和豆包工作深度融合后的产品能力之后,他们也终于发布了一个全新的功能,也是我们内测了一段时间,让我非常喜欢的功能。
豆包工作伙伴。
讲道理,这玩意飞书在国内第一个做出来,我一点也不意外。
跟之前的豆包工作伙伴完全不一样,这一次,你可以把你的豆包工作伙伴,拉它进入企业里的任何群聊里面,成为一个团队共享的AI工作伙伴。
它拥有独立的人设,独立的名称,独立的组织身份,比如我就给它改名了,名字也很性感,叫义父。
它可以被拉进群,参加公司的会议、读所有的文档、代码等等等等,还能主动的去推进大家的工作,它长这样。
如果大家有印象的话,会觉得,这个豆包工作伙伴,怎么跟那个Claude Tag那么像。
对,确实很像。
而且我觉得,如果要理解豆包工作伙伴到底是什么,最好的办法,可能真的就是先理解Claude Tag。
今年6月份,Anthropic发布了Claude Tag。
这玩意,被卡帕西称为AI在用户体验上的第三次范式。
我觉得可以用一句特别简单的话来解释。
普通Agent,是一个属于你自己的能干活的Agent。
而Claude Tag和豆包工作伙伴这样的产品,就是类似于给这个Agent一个独立身份,让它安全、可控地帮公司里所有人一起工作。
这句话基本就解释完了。
我们过去接触的大部分Agent,不管是Claude Code、Codex,还是各种你自己搭出来的Agent,本质上都有一个共同点。
它主要围绕“你”工作。
而Claude Tag和豆包工作伙伴这样的形态,是一个完全不同的形态。
你可以理解为,他有自己的身份、权限、记忆之类的,长期驻扎在公司的组织软件里,Claude Tag是待在Slack里,豆包工作伙伴是待在飞书里。
公司里的任何一个人都可以跟它一起工作。
它知道这个群之前发生过什么,也知道大家最近在聊什么,知道公司是什么业务、每个人负责什么、大家手上的项目分别是什么,也可以接入GitHub、多维表格、知识库之类的这些公司的系统。
甚至很多时候,你甚至都不需要主动叫它。
它自己会判断:
这个事情,我是不是该干点什么。
你看,这个关系就完全变了。
以前在组织中,我们跟AI的关系,大概是:
人、人、人、人。
↓ ↓ ↓ ↓
AI、AI、AI、AI。
现在呢,就变成了:
人、人、人、人。
↓
AI。
所有人共享同一个AI同事,大家都拥有了一个团队智能体,大幅的降低各种沟通和损耗成本,让我们的小伙伴,更有时间,去做那些真正AI替代不了,真正重要的事情。
这就是我觉得这类产品,对于组织来说,真正牛逼的地方。
而在Slack中,Claude Tag其实可以发挥的作用没有豆包工作伙伴在飞书中的大,核心还是因为,飞书过去十年打下的基建和江山实在是太恐怖了。
群聊、会议、文档、日历、任务、项目、OKR等等,甚至还有多维表格上的各种各样的业务数据,实在是太丰富了。
所以在昨天,我甚至在公司内部,做了一个小小的决定,把公司内部沟通,也全面从微信迁移到飞书上了。
公司的一个小小的里程碑,终于全面从微信切换到飞书了。
这一年跑的太快,很多基石还没做好,沿着惯性在走,昨天想了想,还是下定决心了。
对公司组织来说,也要全面拥抱为未来而生的基建才行。
飞书基本上就是为Agent而生,虽说只是办公方式的一个小小的变化,但是也意味着,面向未来。
这个决定,其实跟这几天内测豆包工作伙伴以后,有很大的关系。
说回豆包工作伙伴,这玩意目前还是邀请共创测试,因为我们稍微特殊一点的身份,所以是前几天就拿到了内测的,大家想用的话,可能还需要再等等,但是有些东西,我觉得还是足够可以给大家看一看的。
当你有了豆包工作伙伴的权限之后,你就可以在后台,看到他的设置页面,可以看到它的人设、自动化、资产、记忆等等。
你可以随便改,比如我就把它改成了,义父。
于是我们所有人让它帮忙干活,都是需要在群里,@义父。。。
当然,你也可以建多个不同的工作伙伴,赋予他们不同的能力和人格。
给大家举个例子。
我们的小伙伴,就在尝试用义父,来讨论选题。
平时刷到有意思的东西,就会直接扔进选题群里,大家一起聊聊能不能做。
就比如说,今天他们看到的这个盆栽和手摇Token生成器。
就可以在群里@义父,让它调研一下,技术上怎么实现,是否能够复刻。
它立刻就可以给出一些建议,对工期、预算和可能遇到的问题做了初步估算。
然后也可以让义父在群里,核查一些信息。
然后还有一个选题,是开学了吗,于是说,看看能不能把ChatGPT当成语言老师。
他们就还是把截图发进群里,让义父看看。
义父聊完之后,大家还可以继续充分讨论,再进行投票。
讨论结束以后,他们又让义父把前面的聊天整理成了一张选题总结卡片。
选题聊完以后,我们的流程是,由内容组的小伙伴会先把觉得合适的方向提报到选题库,再由我筛一轮,确定哪些可以做。
现在有了义父之后,他们真的就是随时分享、随时讨论,随时让义父往选题库里面扔。
然后我就能看到,义父把前面聊到的两个方向分别录入选题库,状态先设成待定,等我看完再决定。
接着,又让它根据选题库里之前已经确认可做的选题排一下档期。
结合每个人的工作分工和已有排期,安排一下谁来做、什么时候做,再把对应的安排加进日历里。
确认好以后,还能直接给对应的小伙伴来发送日程邀请。
就有了这个豆包工作伙伴之后,我们的工作流程和协同也肉眼可见的发生了一些变化,因为,这是属于大家的Agent,是属于大家的同事。
也能根据大家的时间,来约大家的会议。
还能跟我们一起开会。。。
这个同事也会拥有跟大家互动后,存下来的跟每个同事相关的记忆。
也可以给他配置各种各样的权限。
还有非常非常非常多好玩的东西和好玩的场景,感觉后续要慢慢发掘。
飞书过去所有在机器人、AI和Agent上的积累,在此刻融为一体,汇聚到了豆包工作伙伴上。
这个东西,是我过去这么久,用过的最有趣的Agent之一。
不过这个事肯定不好做,因为Agent 、大模型、协同办公要深度配合才能有比较好的流程的体验,还有包括token消耗等可能会很大,但,一定是未来的趋势。
其实过去,我也一直在思考一个命题。
当AI真的进入一个组织以后,公司这种东西本身应该如何发生变化?
因为我们都知道,一家公司里面,很多时候大量的成本其实都浪费在沟通和协作上。
比如说很多看到我就脑壳疼的问题:“你有没有跟A同步?A告诉B了吗?B知不知道C已经改了???”
还有无数类似的,我都想杀人。
过去我还在互联网中产的时候,真的,很多时候,一件可能真正只需要两小时完成的工作,可能前前后后要拉十个人,开三个会,发上百条消息,然后互相同步来同步去,三天才搞完。
所以我现在,极其认同一个公式:
团队效率 = 所有人个人效率的总和,再减掉协作成本。
过去的AI一直疯狂提高的,都是前半部分,但是协作成本,靠的几乎还是组织管理方法论,还有使用的协同工具本身。
但现在,因为豆包工作伙伴这样的产品,好像也在开始大幅降低协同成本了。
但本质上,核心还是飞书这个产品的基建,实在是搭的过于优秀了。
就像我上面说的,这也是我自己,为什么决定,最后还是决定把我们公司内部的工作沟通也全部迁到飞书
这当然只是一个很小的变化。
但我也只是想,把公司的工作方式,更加的面向Agent一点。
对公司组织来说,也要全面拥抱为未来而生的基建。
我们已经讨论了三年AI会怎么改变个人。
那接下来,也要开始聊一聊,AI究竟会如何改变公司了。
这个未来是必然会来的,那企业内部如何沟通,如何沉淀我们所有的知识和经验,如何管理项目,如何组织数据,如何让Agent真正的进入公司,这个是每一个组织,都必须要考虑的东西。
虽然我过去吹了飞书无数次,我真的不想再吹了。
但是我还是非常想真情实感地说一句。
相信我,企业拥抱AI。
先从飞书开始。
就像谢欣在发布会最后说的那句话一样:
“把卓越的工具交给人们,他们自会,创造非凡”撰文:Techub News 整理 导语 在2025 年 3 月于纽约举行的ScaleUp:AI 2024大会上,AI领域的顶尖思想领袖、Coursera联合创始人、Landing AI创始人兼董事长Andrew Ng(吴恩达)发表了主题演讲。作为深度学习和AI普及化的重要推动者,吴恩达一直致力于连接AI前沿技术与产业落地。此次演讲,他基于其团队在AI Fund和Landing AI的实践,剖析了当前最重要的技术趋势——“智能体工作流”的崛起,并为企业(无论是初创公司还是大型集团)如何抓住这波AI浪潮、构建可持续的创新流程提供了极具操作性的见解。 摘要 智能体工作流是当前最重要的AI趋势:相比传统单次提示生成,让AI像人类一样迭代思考、研究、修订的“智能体工作流”能大幅提升输出质量,在代码生成、法律文档处理、医疗辅助诊断等领域已展现出决定性优势。 企业AI创新流程正在被重塑:生成式AI将AI原型的构建时间从数月缩短至数天,这使得“快速构建大量原型并验证”成为可行策略,企业应建立“快速行动,同时负责任”的创新文化。 AI治理应聚焦于应用层而非技术层:试图监管基础AI模型本身如同要求电动机制造商保证其电机永不用于危险设备一样不切实际;更有效的路径是监管具体的AI应用(如医疗设备、聊天机器人),以确保其安全性。 大型企业与AI专家的“共创”是关键:最具潜力的AI应用往往诞生于深谙AI能力的团队与拥有深厚领域知识(如航运、医疗)的企业之间的合作,这种结合能催生出改变行业的解决方案。 智能体工作流:从线性生成到迭代思考的范式变革 吴恩达开篇即指出,如果只能关注一项AI技术趋势,那么答案无疑是智能体AI。他阐释了当前主流的AI使用方式与智能体工作流的本质区别。 目前,大多数用户使用大语言模型的方式是“非智能体”的:输入一个提示词,模型一次性生成完整回复。吴恩达形象地比喻,这好比要求一个人(或AI)就某个主题写一篇论文,必须从第一个字到最后一个字一气呵成,不允许使用退格键。人类显然无法以这种方式产出最佳作品,而AI在这种完全线性的模式下表现尚可,已属惊人。 然而,智能体工作流改变了这一范式。在这种模式下,我们可以引导AI像人类一样工作:例如,先让它撰写论文大纲,询问是否需要网络研究,随后下载相关网页作为上下文,接着撰写初稿,再让其审阅初稿并决定哪些部分需要修订,随后进行修改……如此循环往复。这种融合了思考、研究、修订的迭代过程,能产生质量高得多的工作成果。 吴恩达分享了一项来自其团队的数据:在HumanEval代码生成基准测试中,使用非智能体工作流的GPT-3.5正确率为48%,GPT-4为67%。然而,从GPT-3.5到GPT-4的改进,远不及从非智能体工作流切换到智能体工作流带来的飞跃。GPT-3.5在采用智能体工作流后性能大幅提升,GPT-4亦然。 在实践中,吴恩达的AI Fund团队发现,智能体工作流在处理复杂法律文件、辅助医疗诊断、填写繁琐的政府合规表格等应用场景中,正带来决定性的差异。这一趋势也催生了新的技术栈层级——编排层。诸如LangChain(正演进为更注重智能体的LangGraph)、CrewAI等框架的出现,使得构建智能体应用变得更加容易。 五大核心趋势重塑AI产业格局 除了智能体工作流这一核心,吴恩达还概括了其他四项正在深刻影响行业的重要趋势: 1. 更廉价、更快速的文本生成至关重要。 智能体工作流会产生和读取大量文本(Token),因此降低Token成本、加快生成速度变得尤为关键。这不仅是为了人类消费,更是为了加速智能体自身的迭代循环。将一段20分钟的智能体工作流程加速到5分钟,能带来巨大的实际价值。 2. 生成式AI正彻底改变企业创新流程。 过去,基于监督学习构建AI系统可能需要6到12个月。如今,利用大语言模型,许多团队可以在10天内构建并部署一个原型。这使得“快速构建20个原型,哪怕其中18个失败”的策略变得可行且经济。吴恩达提倡的新信条是:“快速行动,同时负责任”——在利用快速原型能力的同时,建立确保不推出造成实质性损害产品的流程。 3. 文本处理革命已至,视觉处理革命即将到来。 许多大型企业拥有海量的图像或视频数据,却苦于无法提取价值。多模态模型和视觉智能体的发展,将开启视觉AI应用的巨大潜力。吴恩达创立的Landing AI正在此领域深耕,帮助企业从视觉数据中获得更多价值。 4. 数据的“重力”正在减弱。 传统上,将大量数据从一个云平台传输到另一个进行处理因成本高昂而不可想象。然而,生成式AI工作流的计算成本极高,相比之下,数据跨境传输的成本显得微不足道。粗略估算,传输1GB数据的云出口成本约为10美分,而用GPT-4 mini等模型处理1GB数据的成本可能高达30-40美元。因此,新的设计模式正在涌现:人们更倾向于构建在全球范围调用计算资源、跨地域传输数据进行处理的应用。 5. 数据工程的重要性再次凸显,尤其是非结构化数据。 过去AI的价值多体现在结构化数据(数字、表格)上。如今,生成式AI能够从文本、图像、音频中提取前所未有的价值。许多公司正在重构数据基础设施,重点加强处理非结构化数据的“管道”建设。 企业AI创新:从灵感到规模化落地的路线图 针对大型企业如何抓住AI机遇,吴恩达结合AI Fund与众多企业合作的经验,提出了一套行之有效的五步流程。 第一步:高管培训。 确保企业领导层对AI的能力与局限有非技术层面的基本了解,这是识别机会的基础。吴恩达提到,Coursera上最受欢迎的课程之一就是面向所有人的生成式AI入门课。 第二步:机会脑暴与任务分解分析。 在理解技术后,系统性地寻找应用机会。吴恩达特别推荐了一种“基于任务的工作分析”方法:将职位分解为具体任务,而非笼统地讨论AI取代某个工作。例如,客户服务代表的工作包含多种任务,其中一些(如回答常见问题)极易被AI增强或自动化,而另一些(如处理复杂投诉)则较难。这种方法往往能发现出人意料的、最大的机会点,其结论通常比凭直觉猜测更可靠。 值得注意的是,多数企业在发现AI能将某项任务成本降低千倍后,选择的不是裁员节流,而是将该任务执行量提升千倍,从而开辟新的收入增长渠道。增长往往比成本节约更具吸引力,因为天花板更高。 第三步:项目可行性评估与优先级排序。 对脑暴产生的想法进行技术可行性和商业价值的尽职调查,并做出“自建、购买还是投资”的决策。吴恩达建议,市场上已有的解决方案应优先购买。但由于生成式AI技术太新,企业总会发现大量尚无现成产品的新想法。 第四步:执行路径选择——自建、合作或剥离。 企业内部的资源与耐心有限,不可能实施所有想法。对于少数核心、希望完全自主控制的项目,可以选择内部建设。对于其他许多项目,将其剥离为独立的初创公司可能是一个更优选择。这样既能以更低成本实现目标,又能让母公司享受其成果,同时无需自行组建和维护专门的AI团队。 吴恩达以与日本三井物产合作的“Bearing AI”为例:三井物产拥有深厚的航运领域知识,他们提出利用AI优化船舶航线以节省燃油。双方合作进行深度市场验证后,招募了一位连续创业者作为CEO,用三个月打造了技术原型。最终,这家独立运营的初创公司开发的软件已在超过600艘远洋船舶上运行,平均每艘船每年节省约50万美元燃料费,并减少10%的碳排放。吴恩达强调,AI专家与领域专家的“共创”是催生此类突破性应用的关键。 第五步:制定AI战略与员工培训。 当企业成功运行几次上述创新流程后,就需要思考长期的AI战略以及大规模的员工技能培训,以确保持续的竞争力。 AI治理:监管应用,而非技术 在演讲最后,吴恩达针对日益热烈的AI治理讨论提出了一个鲜明观点:治理的重点应该是AI应用,而非AI技术本身。 他类比道,AI模型就像电动机,是一种可以用于无数场景的通用技术。要求基础模型开发者保证其模型永不用于有害场景,就如同要求电动机制造商保证其电机永不用于危险设备一样,是不切实际且无效的。真正的风险取决于具体的应用场景。 因此,更合理的路径是监管具体的AI应用:确保医疗AI设备安全、社交媒体推荐算法负责、聊天机器人不作恶。针对不同应用的特点和风险,制定相应的安全标准和监管框架。 吴恩达透露,在过去一年半中,他惊讶地看到一些训练了大模型的公司进行了激烈的游说,试图推动扼杀开源AI模型技术的监管。他认为这背后部分动机是避免与开源软件竞争。所幸,业界共同努力抵制了其中最糟糕的提案。他呼吁业界保持警惕,坚持将治理焦点放在应用层,这样才能在促进创新的同时,更有效地管控风险,确保AI技术安全、负责任地发展。 吴恩达总结道,得益于智能体工作流等技术的突破,AI的可能性正在急速扩张,这为行动迅速的初创公司和积极转型的大型企业都创造了巨大的机遇。关键在于理解趋势、建立有效的创新流程,并将治理智慧应用于正确的层面。
