Google DeepMind CEO Demis Hassabis(德米斯·哈萨比斯):世界模型、AGI 时间表与 AI 驱动的科学革命撰文:Techub News 整理
导语
2025 年 9 月,谷歌 DeepMind 的联合创始人兼 CEO 德米斯·哈萨比斯(Demis Hassabis)做客知名科技播客 All-In Podcast,进行了一场信息量极大的深度对话。作为 AlphaGo、AlphaFold 等里程碑式 AI 项目的核心推动者,以及 2023 年诺贝尔化学奖的共同得主,哈萨比斯一直是全球人工智能领域的灯塔人物。此次对话中,他不仅分享了获得诺奖的幕后故事,更系统地阐述了谷歌 DeepMind 的最新进展、对 AGI(通用人工智能)路径的思考,以及 AI 如何重塑科学、娱乐乃至人类社会的基础架构。在 AGI 浪潮席卷全球、科技巨头激烈角逐的背景下,哈萨比斯的见解无疑具有极高的参考价值。
摘要
世界模型是通往 AGI 的关键一步:Genie 等模型通过海量视频学习“直观物理”,无需预设物理引擎即可生成动态交互世界,这对机器人技术、智能眼镜助手至关重要。
AGI 可能还需 5-10 年:哈萨比斯认为当前 AI 尚缺乏真正的创造力、持续学习和一致性推理能力,需一两个关键突破才能达到真正的通用智能。
AI 将开启“科学新文艺复兴”:从药物发现(Isomorphic Labs)到材料设计、聚变控制,AI 将成为终极科学工具,其长远贡献将远超其当下的能耗。
人形机器人有独特价值:对于需要融入人类环境(家庭、办公室)的通用机器人,人形形态可能比专用形态更具实用性和适配性。
AI 赋能创作的两面性:既极大降低了普通人创作的门槛,也超级赋能顶级专业人士,催生“共同创造”的新娱乐形态。
从 AlphaFold 到诺奖:AI 驱动科学的起点
访谈从哈萨比斯获得诺贝尔化学奖的非凡经历开始。他描述接到来自瑞典的电话时“恍如隔世”,那是每个科学家梦寐以求的时刻。在斯德哥尔摩的颁奖周,最令他震撼的是在一本保存了120年的诺奖得主签名簿上,将自己的名字签在费曼、居里夫人、爱因斯坦、尼尔斯·玻尔等伟人之旁。哈萨比斯坦言,尽管有关于 AlphaFold 可能获奖的传言,但诺奖委员会对保密工作的极致要求,以及奖项更看重科学突破的实际影响力(这往往需要二三十年的沉淀),使得一切直到电话响起前都是未知数。AlphaFold 破解蛋白质结构预测难题,正是哈萨比斯从童年起就怀有的梦想——利用 AI 加速科学发现的完美例证。这枚诺奖奖章,不仅是对他个人和团队的认可,更是标志着 AI 正式成为基础科学发现的核心引擎。
谈及谷歌 DeepMind 在 Alphabet 中的定位,哈萨比斯将其比喻为“整个谷歌和 Alphabet 的引擎室”。自几年前谷歌内部所有 AI 力量(包括原 DeepMind)合并为 Google DeepMind 以来,团队规模已达约 5000 人,其中超过 80% 是工程师和博士研究员。Gemini 是他们构建的核心模型,此外还包括视频模型、交互式世界模型等多种 AI 系统。这些模型已经深度集成到谷歌几乎所有的产品和服务中,从 AI Overview、AI 模式到 Gemini 应用,每天有数十亿用户在与他们的 AI 技术互动。这种“前沿研究”与“数十亿规模落地”的结合,构成了谷歌 DeepMind 独特的优势。
Genie 与世界模型:让 AI 理解物理世界
对话的核心很快转向了谷歌 DeepMind 最新发布的一类革命性模型——“世界模型”,其代表便是 Genie。哈萨比斯现场展示了一段 Genie 生成的视频:用户仅通过一个文本提示(如“在鸡套装里的人”或“喷气式滑艇”),就能生成一个完全交互式的 3D 环境。用户可以使用方向键和空格键实时控制视角,探索这个世界。关键之处在于,所有像素都是实时生成,不存在于任何预设的视频或游戏中。当角色转头看向一个方向,那一侧的景物才被即时创造出来,并且保持物理一致性(例如之前墙上的涂鸦会保留)。
哈萨比斯解释道,Genie 模型通过观看互联网上数百万计的 YouTube 等视频,反向工程了“直观物理”。它并非基于传统的 3D 渲染引擎(如 Unity 或 Unreal),也没有被预先编程物理定律。相反,它纯粹从 2D 图像序列中学会了世界如何运作的复杂规律,包括光影反射、材质流动和物体行为。作为一名在 90 年代曾亲手编写游戏引擎和物理系统的前游戏开发者,哈萨比斯对 Genie 能如此“轻而易举”地完成这一切感到“极其震撼”。
为什么世界模型如此重要?哈萨比斯指出,要构建真正的 AGI,系统必须理解我们周围的物理世界,而不仅仅是抽象的语言或数学世界。这对于机器人技术、智能眼镜助手等应用至关重要。一个能帮助日常生活的智能眼镜助手,必须理解使用者所处的物理环境及其背后的物理规律。世界模型的突破,正是为 AI 系统装上了理解物理世界的“感官”和“常识”。他预测,随着 Genie 这类模型的进化(Gen 4, Gen 5…),它们将越来越逼近对现实世界的深刻模拟。
机器人、AGI 时间线与缺失的拼图
世界模型的自然延伸便是机器人技术。哈萨比斯介绍了他们基于 Gemini 微调而来的“Gemini 机器人模型”。在演示中,一个拥有两只机械臂的桌面机器人,能够理解“把黄色物体放进红色桶里”这样的自然语言指令,并将其转化为精准的动作序列。这体现了多模态模型的威力——它能将真实世界的理解融入与机器人的交互中,而不仅仅是依赖机器人专用的、狭窄的模型。
对于机器人的形态,哈萨比斯的观点发生了变化。他过去认为特定任务应有专用形态的机器人,但现在认为,人形机器人对于需要在人类设计的环境中工作的通用机器人具有重要意义。台阶、门把手、工具——我们的物理世界是为人类身体设计的。与其改变整个世界的设计,不如让机器人适应我们已有的环境。当然,在工业生产线或实验室等特定场景,专用形态的机器人仍是最优解。
关于 AGI(通用人工智能)的到来时间,哈萨比斯给出了相对审慎的估计。他认为当前顶尖的 AI 模型(包括他自己公司的)远非“博士级智能体”。它们在某些任务上表现出博士生水平的能力,但缺乏通用性和一致性,例如可能在高中学的数学或简单计数上犯低级错误。真正的 AGI 应该能全面达到高水平表现。
在他看来,通往 AGI 还缺少几个核心拼图:一是真正的创造力,即像爱因斯坦提出狭义相对论那样,从已知知识中进行“直觉飞跃”,提出全新的猜想或理论;二是持续学习能力,能够在线学习新知识并调整行为;三是更强的推理和一致性。哈萨比斯预测,可能还需要“一两个关键性突破”,时间尺度大约在5到10年。这与行业某些更为激进的预测(如几年内)形成了对比。
科学革命与能源挑战:AI 的长期回报
作为科学家,哈萨比斯始终坚信 AI 最崇高的使命是加速科学发现,应对人类面临的重大挑战。除了 AlphaFold,谷歌 DeepMind 的 AI 系统已应用于材料设计、聚变反应堆等离子体控制、天气预报、解决奥林匹克数学竞赛级别难题等多个科学分支。他领导的 Isomorphic Labs(从 DeepMind 分拆)正致力于基于 AlphaFold 的突破,彻底改革药物发现流程,目标是将耗时数年甚至十年的新药研发周期缩短至几周甚至几天。目前他们已与礼来、诺华等制药巨头合作,并预计明年将有候选药物进入临床前阶段。
针对当前热议的 AI 能耗问题,哈萨比斯认为存在“两个真相”。一方面,谷歌 DeepMind 自身因为需要每天为数亿用户高效提供 AI 服务(如 AI 概述),在模型效率优化上投入巨大,通过蒸馏等技术,过去两年相同性能下的模型效率提升了10倍甚至100倍。但另一方面,为了向 AGI 前沿推进,研究团队仍需不断用更大规模的数据和算力训练新的模型,这会推动总需求上升。他乐观地认为,从长远来看,AI 在优化电网、设计新材料和新能源、应对气候变化等方面的贡献,将远超其自身运行所消耗的能源。AI 是解决问题的手段,而不仅仅是问题的来源。
创作民主化与未来娱乐形态
除了硬核科技,哈萨比斯也展望了 AI 对文化和娱乐的冲击。像 Imagen、Veo 这样的顶级视频生成模型,以及“Nano Banana”这类拥有出色指令跟随一致性的图像生成工具,正在带来“创作民主化”。普通人无需再像过去那样啃读厚厚的 Photoshop 教程,只需用语言描述想法,就能进行创作。
但同时,AI 也在“超级赋能”顶级专业人士。哈萨比斯提到他们正与著名导演达伦·阿伦诺夫斯基等顶尖创作者合作。这些工具让专业创意人士能够以前所未有的速度尝试各种构思,生产力提升十倍甚至百倍,最终更快地实现他们脑海中最完美的愿景。他预见未来将出现一种融合了“共同创造”元素的新娱乐形式或艺术类型:顶级创意愿景家构建引人入胜的动态故事世界,而成千上万的用户可以在其中共同创造部分内容,主创者则扮演这个世界的“总编辑”。
未来十年:一个“科学新文艺复兴”
当被问及对未来十年的展望时,哈萨比斯承认在 AI 领域预测十周都充满挑战,更不用说十年。但他坚信,如果未来十年内我们能实现真正的 AGI,那将开启一个“科学的新文艺复兴”或“黄金时代”。从能源到人类健康,社会的方方面面都将受益于这个终极科学工具带来的突破。这不仅仅是一次技术升级,而是一场深刻重塑人类文明认知边界和能力极限的革命。德米斯·哈萨比斯和他领导的谷歌 DeepMind,正站在这场革命的最前沿。
Andrew Ng(吴恩达):AI Agent工作流是当前最重要的技术趋势撰文:Techub News 整理
导语
在2025 年 3 月于纽约举行的ScaleUp:AI 2024大会上,AI领域的顶尖思想领袖、Coursera联合创始人、Landing AI创始人兼董事长Andrew Ng(吴恩达)发表了主题演讲。作为深度学习和AI普及化的重要推动者,吴恩达一直致力于连接AI前沿技术与产业落地。此次演讲,他基于其团队在AI Fund和Landing AI的实践,剖析了当前最重要的技术趋势——“智能体工作流”的崛起,并为企业(无论是初创公司还是大型集团)如何抓住这波AI浪潮、构建可持续的创新流程提供了极具操作性的见解。
摘要
智能体工作流是当前最重要的AI趋势:相比传统单次提示生成,让AI像人类一样迭代思考、研究、修订的“智能体工作流”能大幅提升输出质量,在代码生成、法律文档处理、医疗辅助诊断等领域已展现出决定性优势。
企业AI创新流程正在被重塑:生成式AI将AI原型的构建时间从数月缩短至数天,这使得“快速构建大量原型并验证”成为可行策略,企业应建立“快速行动,同时负责任”的创新文化。
AI治理应聚焦于应用层而非技术层:试图监管基础AI模型本身如同要求电动机制造商保证其电机永不用于危险设备一样不切实际;更有效的路径是监管具体的AI应用(如医疗设备、聊天机器人),以确保其安全性。
大型企业与AI专家的“共创”是关键:最具潜力的AI应用往往诞生于深谙AI能力的团队与拥有深厚领域知识(如航运、医疗)的企业之间的合作,这种结合能催生出改变行业的解决方案。
智能体工作流:从线性生成到迭代思考的范式变革
吴恩达开篇即指出,如果只能关注一项AI技术趋势,那么答案无疑是智能体AI。他阐释了当前主流的AI使用方式与智能体工作流的本质区别。
目前,大多数用户使用大语言模型的方式是“非智能体”的:输入一个提示词,模型一次性生成完整回复。吴恩达形象地比喻,这好比要求一个人(或AI)就某个主题写一篇论文,必须从第一个字到最后一个字一气呵成,不允许使用退格键。人类显然无法以这种方式产出最佳作品,而AI在这种完全线性的模式下表现尚可,已属惊人。
然而,智能体工作流改变了这一范式。在这种模式下,我们可以引导AI像人类一样工作:例如,先让它撰写论文大纲,询问是否需要网络研究,随后下载相关网页作为上下文,接着撰写初稿,再让其审阅初稿并决定哪些部分需要修订,随后进行修改……如此循环往复。这种融合了思考、研究、修订的迭代过程,能产生质量高得多的工作成果。
吴恩达分享了一项来自其团队的数据:在HumanEval代码生成基准测试中,使用非智能体工作流的GPT-3.5正确率为48%,GPT-4为67%。然而,从GPT-3.5到GPT-4的改进,远不及从非智能体工作流切换到智能体工作流带来的飞跃。GPT-3.5在采用智能体工作流后性能大幅提升,GPT-4亦然。
在实践中,吴恩达的AI Fund团队发现,智能体工作流在处理复杂法律文件、辅助医疗诊断、填写繁琐的政府合规表格等应用场景中,正带来决定性的差异。这一趋势也催生了新的技术栈层级——编排层。诸如LangChain(正演进为更注重智能体的LangGraph)、CrewAI等框架的出现,使得构建智能体应用变得更加容易。
五大核心趋势重塑AI产业格局
除了智能体工作流这一核心,吴恩达还概括了其他四项正在深刻影响行业的重要趋势:
1. 更廉价、更快速的文本生成至关重要。 智能体工作流会产生和读取大量文本(Token),因此降低Token成本、加快生成速度变得尤为关键。这不仅是为了人类消费,更是为了加速智能体自身的迭代循环。将一段20分钟的智能体工作流程加速到5分钟,能带来巨大的实际价值。
2. 生成式AI正彻底改变企业创新流程。 过去,基于监督学习构建AI系统可能需要6到12个月。如今,利用大语言模型,许多团队可以在10天内构建并部署一个原型。这使得“快速构建20个原型,哪怕其中18个失败”的策略变得可行且经济。吴恩达提倡的新信条是:“快速行动,同时负责任”——在利用快速原型能力的同时,建立确保不推出造成实质性损害产品的流程。
3. 文本处理革命已至,视觉处理革命即将到来。 许多大型企业拥有海量的图像或视频数据,却苦于无法提取价值。多模态模型和视觉智能体的发展,将开启视觉AI应用的巨大潜力。吴恩达创立的Landing AI正在此领域深耕,帮助企业从视觉数据中获得更多价值。
4. 数据的“重力”正在减弱。 传统上,将大量数据从一个云平台传输到另一个进行处理因成本高昂而不可想象。然而,生成式AI工作流的计算成本极高,相比之下,数据跨境传输的成本显得微不足道。粗略估算,传输1GB数据的云出口成本约为10美分,而用GPT-4 mini等模型处理1GB数据的成本可能高达30-40美元。因此,新的设计模式正在涌现:人们更倾向于构建在全球范围调用计算资源、跨地域传输数据进行处理的应用。
5. 数据工程的重要性再次凸显,尤其是非结构化数据。 过去AI的价值多体现在结构化数据(数字、表格)上。如今,生成式AI能够从文本、图像、音频中提取前所未有的价值。许多公司正在重构数据基础设施,重点加强处理非结构化数据的“管道”建设。
企业AI创新:从灵感到规模化落地的路线图
针对大型企业如何抓住AI机遇,吴恩达结合AI Fund与众多企业合作的经验,提出了一套行之有效的五步流程。
第一步:高管培训。 确保企业领导层对AI的能力与局限有非技术层面的基本了解,这是识别机会的基础。吴恩达提到,Coursera上最受欢迎的课程之一就是面向所有人的生成式AI入门课。
第二步:机会脑暴与任务分解分析。 在理解技术后,系统性地寻找应用机会。吴恩达特别推荐了一种“基于任务的工作分析”方法:将职位分解为具体任务,而非笼统地讨论AI取代某个工作。例如,客户服务代表的工作包含多种任务,其中一些(如回答常见问题)极易被AI增强或自动化,而另一些(如处理复杂投诉)则较难。这种方法往往能发现出人意料的、最大的机会点,其结论通常比凭直觉猜测更可靠。
值得注意的是,多数企业在发现AI能将某项任务成本降低千倍后,选择的不是裁员节流,而是将该任务执行量提升千倍,从而开辟新的收入增长渠道。增长往往比成本节约更具吸引力,因为天花板更高。
第三步:项目可行性评估与优先级排序。 对脑暴产生的想法进行技术可行性和商业价值的尽职调查,并做出“自建、购买还是投资”的决策。吴恩达建议,市场上已有的解决方案应优先购买。但由于生成式AI技术太新,企业总会发现大量尚无现成产品的新想法。
第四步:执行路径选择——自建、合作或剥离。 企业内部的资源与耐心有限,不可能实施所有想法。对于少数核心、希望完全自主控制的项目,可以选择内部建设。对于其他许多项目,将其剥离为独立的初创公司可能是一个更优选择。这样既能以更低成本实现目标,又能让母公司享受其成果,同时无需自行组建和维护专门的AI团队。
吴恩达以与日本三井物产合作的“Bearing AI”为例:三井物产拥有深厚的航运领域知识,他们提出利用AI优化船舶航线以节省燃油。双方合作进行深度市场验证后,招募了一位连续创业者作为CEO,用三个月打造了技术原型。最终,这家独立运营的初创公司开发的软件已在超过600艘远洋船舶上运行,平均每艘船每年节省约50万美元燃料费,并减少10%的碳排放。吴恩达强调,AI专家与领域专家的“共创”是催生此类突破性应用的关键。
第五步:制定AI战略与员工培训。 当企业成功运行几次上述创新流程后,就需要思考长期的AI战略以及大规模的员工技能培训,以确保持续的竞争力。
AI治理:监管应用,而非技术
在演讲最后,吴恩达针对日益热烈的AI治理讨论提出了一个鲜明观点:治理的重点应该是AI应用,而非AI技术本身。
他类比道,AI模型就像电动机,是一种可以用于无数场景的通用技术。要求基础模型开发者保证其模型永不用于有害场景,就如同要求电动机制造商保证其电机永不用于危险设备一样,是不切实际且无效的。真正的风险取决于具体的应用场景。
因此,更合理的路径是监管具体的AI应用:确保医疗AI设备安全、社交媒体推荐算法负责、聊天机器人不作恶。针对不同应用的特点和风险,制定相应的安全标准和监管框架。
吴恩达透露,在过去一年半中,他惊讶地看到一些训练了大模型的公司进行了激烈的游说,试图推动扼杀开源AI模型技术的监管。他认为这背后部分动机是避免与开源软件竞争。所幸,业界共同努力抵制了其中最糟糕的提案。他呼吁业界保持警惕,坚持将治理焦点放在应用层,这样才能在促进创新的同时,更有效地管控风险,确保AI技术安全、负责任地发展。
吴恩达总结道,得益于智能体工作流等技术的突破,AI的可能性正在急速扩张,这为行动迅速的初创公司和积极转型的大型企业都创造了巨大的机遇。关键在于理解趋势、建立有效的创新流程,并将治理智慧应用于正确的层面。
从 Token-Maxxing,到 Token-Minimizing最近,各家都掏出了 flash 版的口粮模型:又快又好又便宜,干啥都不心疼无论国内的 DeepSeek V4.1-Flash、GLM-5.3-Flash,抑或是海外的 Gemini 3.8 Flash,都被各家作为便宜大碗的主力模型进行推广,让那些需要做,但投入产出评估上不值得 Fable 一类模型出马的事情,变得值得落地了
这个的背后,其实有个小小的时代变化:从 Token-Maxxing,到 Token-Minimizing
Token-Maxxing
Token-Maxxing 这个词是今年上半年传开的,直白一点就是「把 Token 猛猛地烧起来」,尽可能多的并发,尽可能多地去搞;到了国内,这个词还有个变形「全民养虾」
在当时,Meta 内部一个按 Token 用量给员工排名的看板,还会授予“Token Legend”这样的称号,大抵能翻译成「词元天尊」,用来表达对“先进个人,先用 token”的激励
在当时各个大厂都在想着法地让人去用 token,毕竟虽然 Agent 并不能 100% 搞定任务,但它可以并行几十种方案去探索,即便是没搞定也能让员工更好地积累经验。都是行业的早期阶段,浪费一些计算,好过错失一些可能,万一探索出来点东西,比如省了团队半年的开发,怎么看都是赚的
但到了这里,事情也开始分叉:有些人开始 token 空烧比如写一个脚本,每天上班的时候让他的 10 个 Agent 并行去「帮我解答哥德巴赫猜想」...然后在 1 小时内消耗掉了他的所有额度,进而美美去摸鱼了,更有甚者...把公司的 token 资源代理一下,成为了中转站大佬
于是,业内开始了一轮反思:我们应该如何更有效地利用 token?我们使用 token,本质上也是在做一种智力分配,在一些值得探索的问题投入更多的智力,而不是为了证明自己很会用 AI 而去消耗
于是,我们进入了下一种思潮:Token-Minimizing,去细致地核算每一份智力的产出
Token-Minimizing
任何公司都希望大家把 AI 用起来、去完成更多的任务,但任何公司的预算都是有限的,在这里就有了 Token-Minimizing 的提出:要压低每份合格交付的总成本,对不同的任务进行不同的预算规划,去降低每个任务的总成本
注意,这里用的是「总成本」,也就是「人力+token」的总消耗;假如是为了省下一百元的 Token,而去耗掉一万块的人力,这叫煞笔
也正是趁着更多模型跨过可用门槛,我们的模型厂商也顺势推出了甜品型 flash 模型,标准大概是:
智力在 Opus 4.6 以上
价格在头部模型的 1/10 以内
速度通常在 100 token/s 或者更快
比如 DeepSeek 的 V4.1-Flash 的价格,就只有 Opus 4.8 的 1/10;而 GLM-5.3-Flash(也就是牛来)则甚至做到了 Opus 4.8 的 1/40,斩杀了当时绝大多数的模型
于是,一个非常朴素的问题出现了:没有其他特殊要求的话,我为什么选你?一个模型不必赢过所有对手,但必须在斩杀线外找到一个位置。
因此,模型的比赛开始同时往两个方向走:
继续向上,探索此前做不到的事情
也努力向左,用更低成本完成已经能做到的事情
讨论于外滩大会
前几天我在外滩大会,在台上台下参与了很多场的分享,其中的部分场次也提到了「Token-Minimizing」的一些话题
百灵团队聊到阿福选模型的一个变化:过去优先使用最大、最好的模型,现在一些较小的模型也能跨过业务要求的“水位线”,成本和响应速度就开始影响选型
这个变化其实挺能说明问题:Token-Minimizing 如果只理解成“省 Token”,还是说窄了。
阿福技术负责人进捷说得很直接。用户规模起来以后,推理成本会变得非常高;而且 C 端应用还有一个特别现实的问题——用户不会一直等你。模型可能只是在 Benchmark 上慢了几秒,但放到产品里,等 5 秒用户可能就走了。
所以当小模型也能跨过业务水位线之后,问题自然就从“谁最聪明”,变成了:谁能在足够聪明的情况下,更快、更便宜、更稳定地把事情办完,真正重要的是“端到端的任务成功率”。
单轮回答得又快又便宜,但最后任务没办成,前面省下来的 Token 也没什么意义。
外滩大会上,还有另一个模型的介绍,是百灵上个月发布的金融增强模型 Ling-3.0-flash-Fin。它沿用 Ling-3.0-flash 的架构,124B 总参数、5.1B 激活参数,再通过金融语料训练、领域后训练和工具使用优化,强化信息检索、研究推理、估值建模与研报撰写。它要交付的东西,包括能追溯数据、保留公式、继续编辑的研究文件
其中有一个 Google 2026 Q2 财务模型更新的演示:模型读取财报和一份包含 7 张工作表、5,000 余个公式的 Excel,把该季度的预测值更新为实际披露值,同时处理公式切换、跨表依赖和图表,最后交回仍可编辑的工作簿
沿着这个例子,思考还可以进一步展开:越来越多的任务,会便宜到不值得人陪同虽然 Flash 能够有效降低执行成本,但假如每次都需要研究员先发现变化,再不断检查,实际上也是一种浪费。于是可以构想出未来的一种工作方式:核心任务交给检验 Harness,把无法通过检验的任务再交给工作人员
对应着放出来的,还有蚂蚁集团联合中金打造了 FinFIRST(Financial Information Retrieval, Sourcing and Traceability)。该评测基准由 50 余名金融专业人士深度参与设计,从结果、过程和证据三个层面,系统评估答案是否准确完整、研究口径与计算是否合理,以及关键数据与结论能否回溯至权威原始资料
FinFIRST 与代表性金融 Benchmark 的能力维度对比
在这个过程中,机构可以把模型接进自己的数据和工具环境,用来帮助判断问题出在哪一步,其背后思考的理念也便是 Token-Minimizing对于金融这类需要严格把关的行业,除了要在高频调用下节省 token 外,还需要有效地降低复核和返工的用时,这样才能算是真的 Token-Minimizing
毕竟,在金融这种场景里,这个成本可能比 Token 贵多了。
百灵团队聊模型边界时提到一个挺反直觉的问题:现在很多 Benchmark 会鼓励模型“尽量答”。不知道也猜一个,反正猜中了有分,不回答反而没分,反正就是很“舔狗”。
但真实世界完全不是这么回事。
百灵金融模型负责人月引举了一个金融评测里的现象:有些模型碰到不确定的问题,会一口气给出几十种口径;从 Benchmark 的角度看,它可能覆盖到了正确答案,但一个真正的研究员不可能拿着几十个互相冲突的判断去做决策。
所以在严肃场景里,百灵反而会提高对拒答的奖励——不知道的时候,宁愿告诉用户不知道。
这其实也是另一种 Token-Minimizing:
不是少说几个字,而是少制造一次错误,少让一个人花半小时帮 AI 擦屁股。
FinFIRST 候选题依次经过专家编写、独立复答、交叉验证、Rubric 审核、压力测试和一致性检查,最终保留 123 道任务
或许,站在 5 年前的视角看现在,一切都有点魔幻:人工智能在自我递归迭代,并在产生各种可被执行的需求如果再沿着百灵的思路补半句,或许是:真实世界最终会告诉模型,什么才叫“把事做成”
最后
我们甚至可以假设:即便是今天强如 Fable,也未必打得过六个月后的 Gemini Flash(虽然也,反正我是觉得旗舰的溢价里,很大一部分是时间优势
然后随着模型智能水位的不断提升,叠加到并不是所有的厂商都能够占据最头部的智能生态位,我们便会看到许多的模型以 Flash 的名义被推出(或许这些模型本就应该标记为 pro),对于所有模型都做得到的工作,其实并没必要多瞎花钱
于是,那些原本需要人做,或者 Fable 级别模型来做,以至于 ROI 很难看的事情,现在便有了规模化的可能,大抵便是:Pro 告诉我们啥事儿能交给 AI,Flash 告诉我们啥事儿值得交给 AI
体验完 Livo,我想聊聊它暴露出的行业真相一句话的影响价值有多大?
在大多数AI产品里,答案取决于你说了什么、对谁说的。但在Livo里,一句话影响的可能不只是某个具体的Agent,而是整个世界——人与自己的关系、人与人的关系、人与世界的关系,都可能因为这一句话产生改变。
这正是Livo试图回答的问题。过去三年,生成式AI把内容的生产成本压到接近于零。文字、图片、视频,一切曾经需要人类投入大量时间的东西,现在几秒钟就能生成。随着行业的发展,相关应用层出不穷,“与虚拟人格对话”变成了千万级用户的日常习惯。
但一个断层始终存在:AI生成的是内容,是角色,不是一个持续存在、会自己运转的世界。你关闭App,那个角色就冻结了;你不再说话,故事就停了。所谓“互动”,本质上仍然是你推一下,它动一下。
Livo想做的,是让这句话的“影响半径”从一次对话扩展到一个世界。快看漫画在2026年9月将它推入内测,名字来自Living(活着)、World(世界)与Orbit(闭环)——它想做的,是一个角色拥有独立人格、记忆与行为逻辑,能够在用户不在场时继续“过日子”的“仿生世界”。
这个世界独立存在,却又因“我(用户)”的行为选择产生了些许不同。在这个被创造出的世界中,“我(用户)”不是全知全能的“上帝”,也不是只能按照既定剧情路线前进的“旁观者”,而是真正具有主观能动性的“参与者”。
带着这个期待,我进入了Livo。
初体验:“穿越”有了读心术
第一次打开Livo,让我想起了一部知名的影视作品——《西部世界》。
《西部世界》里有“西部世界”、“罗马世界”、“中世纪世界”供游客选择,Livo里也有“蒂利亚之冬”、“DOLO最后的夏天”、“崩溃世纪Love 90s”和“拯救废稿世界”供用户选择。每个世界对应一条故事线,角色之间有关系网络,有各自的时间线。无论用户喜欢恋爱体验、奇幻冒险还是阵营对抗,在这里都能找到符合自己口味的选择。
不同于一般的“AI角色聊天”、“AI情感陪伴”APP,Livo从一开始就不是一个对话窗口,而是一个可以选择进入的“世界”。
初入Livo的体验很像“穿越”:精致的开场视频交代了世界观背景,接着我被“放置”到一个具体场景中。我需要主动找话题跟角色对话,甚至跟路过的NPC搭话。在这里没有任务列表,没有“点击继续”的按钮,如果我不开口,时间就在那里流逝。
但最大的不同很快显现了。在和重要角色“罗兰”的对话过程中,我可以选择系统提供的内容选项,也可以自己发挥。对于他说的每一句话,我不仅能看到这句话本身,还能看到他为什么说这句话——他的状态栏里写着“当前情绪:愉悦”。角色不是在对我的输入做“条件反射”,他在调用自己的记忆和当前状态来回应我。
另一个值得玩味的点是,我可以主动选择推进主线剧情“注定命运”,也可以在不同的场景中“闲逛”,与路过的NPC“闲聊”,触发支线剧情“潜在命运”。
比如在既定的沟通中,罗兰应该慢慢“套出”我的身份信息。可我没有选择系统给出的建议回复,而是直截了当地回复:“你对我很好奇,甚至故意找机会接近我,为了什么呢?”
罗兰也给出了很有意思的反馈:“你一句话,就把我最擅长的把戏掀了个底朝天。习惯了掌控节奏,却没想到会被你看穿……”这句话揭开了一个他的“秘密”——我由此知晓,自己是罗兰此次登上和平号列车最核心的任务之一,而罗兰在此之前从未接触过“万晁女孩”等新信息。
这让我意识到一件事:在Livo里,沟通的主动权不是用户的“天然权力”。在大多数聊天产品里,我随时可以发一条消息,角色必须回应。但在Livo中,角色是否愿意跟我深入聊某件事,取决于我们之前建立的关系,取决于他此刻的状态,取决于这个世界里正在发生的事。对话是“世界产生关系后的必然产物”,不是“用户行使的权利”。
Livo的第一眼体验,不像任何一个现有的AI产品类别。它不是聊天工具的升级版,不是互动小说的AI化,也不是AI版RPG。它更接近一个带地图、有时间线、有角色关系网络的微型世界模拟器。
有因必有果,你的反馈就是“我”
作为一个对话过不下百个Agent的“老用户”,我对AI角色的耐心已经所剩无几。
从最开始的疯狂投入,到后来发现所有角色都在用同一套模板拉扯,再到最后只看人设、立绘和配音——缺少“灵魂”的Agent越来越难打动我。市面上很多“AI角色聊天类应用”的问题很一致:角色靠“堆量”取胜,推送新奇人设吸引你点进去,但聊不了几句就OOC了,互动体验的情绪阈值被提高后,疲劳感来得飞快。
Livo给我的感受完全不同。核心差异在于:角色不是为我而存在的。
一般情况下,关闭App,甚至退出和TA的聊天框后,这个角色就冻结了。但在Livo里,在我和其他人沟通的时候、在我自己探索新场景的时候,罗兰有自己的日程。他上午在台灯下撰写《荆棘花信》的新章节,下午去阅览室看书。我没有参与这些事,但我却能看到它们发生了。他的人生有“主线”,而我只是进入了他的世界,不是他围绕我运转。
这种能力并不是主要角色的特权,就连戏份少得可怜的NPC同样拥有自己的生活。
Livo的底层逻辑是“世界状态持续演化”——用户不在的时候,角色之间的关系在变,事件在发生,因果在累积。这听起来像是一句产品文案,但实际体验中有一个瞬间让我真正理解了它的含义。
一次任务,我和NPC咖啡店老板与面包店老板产生了交集。因为我送给列车员一个暖手袋的小事件,三者产生了很奇妙的化学反应。在我无意间再次打开这个场景的对话框时,我发现他们三个人正在探讨我什么时候会再来,要给我一直温着暖手袋从而回报我的善意,要请我再喝一杯新创的咖啡,品尝一下可口的小面包……
坦言之,看到这些内容我是震惊的。他们只是我这段体验中很边缘化的角色,甚至都不是主角,但依然做着自己的事情,甚至会因我而产生争吵。宛如他们并不是NPC,而是一个个切切实实活在那个世界中的人。
这就是“因果”在Livo里的样子。我对列车员说的话、做的事,影响了他自己的行为模式,进而影响咖啡店老板与面包店老板对我的态度。这不是预设的剧情分支,而是几个独立Agent之间的信息流动产生的连锁反应。在轮次对话产品里,这种多角色因果链不可能出现。你生成的是“回应”,Livo试图生成的是“轨迹”。
更让我意外的是,Livo里一个叫“照见我”的模块。与任轻义交流,随着角色逐渐认识你,系统会生成属于我自己的“照见我”。这里记录的是我留下了怎样的痕迹,角色如何理解我,以及这个世界正在如何“看见我”。
换句话说,Livo里的“我”不是用户自己定义的人设,而是这个世界对我的行为的反馈与沉淀。我在任轻义面前的样子、在罗兰面前的样子、在咖啡店老板面前的样子,被分别记录、分别理解,最终汇聚成一个被世界“看见”的“我”。这让我意识到,Livo试图做的不仅是让角色“活着”,更是让用户在被世界看见的过程中,重新认识自己。
这可能才是“有因必有果”的真正含义——你的每一个行为都会进入这个世界的因果链条,而这个世界最终会把这些因果,以“你是什么样的人”的形式,还给你。
一个“活着的世界”究竟靠什么成立?
这次我不仅体验了APP的完整功能,还拿到了新Demo的内测权限,在Demo上直观看到了这个世界运行的底层代码。
比如因为“窗外暴雪”的因,散廷·姚产生了“推开小型放映厅门时肩头还落着雪,他抖落雪的动作比胶片转动声音轻”的“果”;又比如在没有我的地方,施塔恩与罗兰开始了关于等待的相互试探……
从公开信息来看,Livo的技术架构为双层结构,由「创作者灵魂注⼊⼊⼝层」与「三⼤引擎」共同构成,此为Livo区别于⼀般AI⻆⾊/聊天机器⼈产品的底层差异。
入口层将创作者以文学语言撰写的素材,结构化为可供引擎运行的数据。具体来看,在个体侧,人物小传被抽离为「六层人格」档案,包括自我意识、底层需求、信念、思维、立场和情绪;在世界侧,世界观骨架被抽离为「六层世界结构」,包括本源、动力、信念、秩序、律法和气象。
有了入口层的这串“基础代码”,「三⼤引擎」就可以开始协同工作。World Agent,负责管理日程、事件、天气、运势等影响整体状态的因素。Soul Agent负责用户与角色之间的交互。「深度被感受」引擎,通过五步链路保证情感回应的真实性。此时每个角色本身都是一个独立Agent,拥有不同的人设、世界观和状态,调用各自的Sub-agent和MCP服务。底层是Memory和“因果编剧”——前者负责长期信息的保存和召回,后者负责维持长时间运行后的故事因果不崩。
这个架构试图解决的核心问题不是“技术单点突破”,而是“长时段运行后的一致性”。
那些投入了大量的经济成本与时间成本才“调教”好的Agent突然OOC,忘记了我们的过往,忘记了我们之前一起经历的种种,产生出一些不符合角色的行为,对于我们这些老用户而言是致命性的打击。
但Livo走了一条完全不同的路——它不追求物理引擎级别的真实感,它追求叙事因果层面的可信度。“活着的世界”靠的不是更多的角色、更长的剧情、更漂亮的画面,而是三样东西:长期记忆的叙事性、多Agent的自主交互、用户行为的因果进入。
记忆层面,Livo的设计逻辑不是“记住用户说过的话”,而是角色拥有自己的经历。“经历过的事”和“知道的事实”是两回事,这个区分决定了角色是在“回忆”还是在“检索”。
多角色自主性层面,任轻义和罗兰之间的关系张力不是我能直接控制的。他们之间的互动有自己的逻辑,我感受到的是一个本来就在运转的关系网络,而不是一个为我搭建的舞台。
技术路线上,Livo的团队借鉴了斯坦福AI小镇的思路,但明确表示不会照搬任何现有方案。这个产品需要的基础设施,市面上还没有现成的。让子弹再飞一会儿,是合理的态度。
尾声
客观来说,Livo目前还不是一个完美的“活世界”。
角色的“涌现”深度有限,长时间交互后人格偶尔会漂移;有时候剧情已经结束了,角色应该离开了,对话框却还停留在那里,引导我继续沟通交流;“照见”等模块的体验还不完整;故事剧情是单向发展的,不能像聊天Agent那样撤回自己说的话,也不能像影游那样回溯到某个节点……
这些问题的本质其实是同一个:一个持续运转的世界,意味着任何一次交互都会永久改变世界状态。自由度和容错性之间,Livo选择了前者。这个选择有代价,但方向是对的。
所以比起这些体验上的小问题,我更关心的是另一个问题:第十小时、第一百小时之后,这个世界是否还值得回去。
这个问题,其实不只是Livo的问题。每个时代都有属于自己的娱乐方式。电力与光影技术让电影出现,电子技术与广播电视网让电视剧热播,个人电脑与互联网让互动叙事游戏广受欢迎,生成式AI与多智能体架构也让Livo出现。
它们看似是不同年代的产品,背后却是同一条线索:媒介技术的每一次跃迁,都在重新定义“人如何进入一个故事”。电影让人坐在黑暗里观看,电视剧让人在客厅里陪伴,互动叙事游戏让人在选项里参与,而Livo试图让人“活”在一个会自己运转的世界中。从“看”到“陪”,从“选”到“在”——每一次跃迁,都是“进入”的深度在加深。
而在这个方向上,快看还有一个被低估的优势。十二年的漫画经验,意味着它对“角色怎么让人在乎”有肌肉记忆。在一个比拼“世界感”的赛道上,这种能力比想象中更重要——因为一个世界之所以值得回去,不是因为技术多先进,而是因为里面有人让你惦记。
从“生成内容”到“生成持续存在”,这可能是AI内容产品的下一个分水岭。Livo还不是那个分水岭本身,但它是目前更接近让人感觉到“世界在活着”的产品。它验证了“世界可以自己往前走”这件事不是空想,但距离“一个真正活着的世界”还有大量未解决的问题。
它值得被看到,不是因为它已经做成了什么,而是因为它指向的方向——让故事不再停在“然后呢”,让它真的有一个“然后”。
图片来源|企业供图
49比50:CLARITY法案为何倒在参议院门口?这“主流”,如你所愿。作者 Charlie,常驻硅谷参与和观察前沿科技十五年,聚焦AI如何重构金融服务、支付网络、与资本市场。Fintechnize 与【沙丘路的毛圈狮子】创始人,Venture Partner @ Generative Ventures。曾任OSL美洲支付负责人,加密货币独角兽 Strike 副总裁(参与萨尔瓦多比特币法案,并负责拉美比特币闪电网络和稳定币支付业务),万亿级基金 Franklin Templeton 宏观与货币分析师,全球支付巨头Adyen早期成员。文章为个人观点,不是投资建议。
今天美国参议院这场投票可谓是万众瞩目。
9月15日投票前,比特币已经跌了超过3%,Coinbase和Strategy(原MicroStrategy)都跌了4%左右,PolyMarket上的通过概率降到了百分之十几;下午参议院投票失败以后,比特币一度跌到接近7.5万美元,Coinbase 和 Circle 跌幅也接近11%。
当然,当天美债收益率上升、油价上涨,第二天又恰逢美联储议息会议,所以不能把这些资产的每一点波动都机械地归因于 CLARITY Act。但无论从投票前的市场交易,还是结果出来之后加密相关资产进一步下跌来看,市场显然没有把它当成一场无关痛痒的国会程序。
一边是两万多亿美元规模的加密资产市场,另一边是 Coinbase、Circle、Strategy 这些已经深度嵌入美国公开市场的上市公司,再加上 BlackRock 和Franklin Templeton 等传统金融机构已经进入这个行业,华盛顿的一张票自然也就逐渐变成了华尔街需要定价的风险。
最后的结果大家已经知道了:美国东部时间9月15日下午2点15分,参议院就CLARITY Act进行程序性投票,49票赞成、50票反对,没有达到60票门槛。
更准确地说,这次并不是CLARITY Act本身的最终表决,而是决定是否结束对“开始审议这部法案”的程序性辩论(cloture vote);也就是说,参议院甚至还没有进入正式修改和最终表决阶段,这部法案就被挡在了门外。
这并不意味着法案在法律意义上已经死亡,多数党未来仍然可以重新尝试,但考虑到中期选举越来越近、国会日程已经非常拥挤,至少今年9月最重要的立法窗口基本已经关上了。
更值得琢磨的问题反而是:一部2025年在众议院以294比134高票通过、当时甚至拿到78名民主党议员支持的法案,为什么一年以后到了参议院,连让大家坐下来正式讨论的60票都凑不到?
而如果只把答案归结为 “民主党阻挠Crypto”,其实又会漏掉这件事最有意思的部分。因为到了最后,CLARITY Act 早已经不只是在讨论 Crypto 到底是不是证券,而是同时卷进了银行存款、稳定币收益、DeFi 开发者责任、消费者保护、州和联邦的监管权,以及特朗普本人和家族的 Crypto 经济利益。
换句话说,过去十几年Crypto一直在争取进入美国主流金融体系,而这次法案的遭遇恰恰说明,它已经真的走进来了。
只是进入主流之后,游戏突然变难了。
GENIUS管的是“钱”,CLARITY想管的是整个市场
去年7月,特朗普签署 GENIUS Act,第一次为支付型稳定币建立了比较完整的联邦法律框架。当时很多报道会笼统地说“美国Crypto监管终于立法”,但如果把GENIUS和CLARITY放在一起看,两者解决的其实完全不是一个层面的问题。
GENIUS主要解决的是“数字美元怎么管”:谁可以发行一个号称1美元兑1美元的稳定币,背后应该持有什么样的储备,储备怎么披露,出了问题由谁监管。
而CLARITY要处理的,则是整个数字资产市场怎么运作——一个代币到底属于证券还是商品,什么情况下由SEC监管,什么情况下由CFTC监管,交易所、经纪商和托管机构需要什么牌照,项目方怎样发行代币,以及交易平台怎样处理客户资产、利益冲突和市场操纵。
所以如果一定要做个简单类比,GENIUS更像是在规定什么样的钱可以发行,而CLARITY是在给整个金融市场修路、发驾照、划分交警管辖范围。它并不决定哪一种币最后会涨,也不是给某几个项目“发免死金牌”,而是在试图回答一个已经困扰美国行业十多年的问题:Crypto进入主流金融体系以后,到底按照谁的规则玩。
这里面最核心的自然还是SEC和CFTC的分工。
过去美国对Crypto最大的争议之一,就是很多代币究竟是不是证券。传统证券法的核心框架来自上世纪30年代,后来法院通过Howey Test判断一项资产交易是否构成“投资合同”;然而把这一整套法律直接套到一个可能经过几年逐渐去中心化的区块链网络上,天然就会产生很多灰色地带。
CLARITY试图把相当一部分真正具有网络用途、并达到一定成熟程度的数字资产纳入“数字商品”范畴,让CFTC承担更多现货市场监管,同时保留SEC对证券发行以及资本形成活动的监管。
这也是为什么这部法案对Coinbase这样的交易平台尤其重要。
过去很多美国Crypto公司面对的现实并不是“完全没有监管”,反而是同时受到证券法、商品法、州牌照、法院判例以及不同监管机构解释的约束,真正缺少的是一张全国统一的地图。CLARITY试图把这些分散的规则重新拼成一个体系,尤其建立数字商品交易所、经纪商和交易商的联邦注册制度。
这里还涉及另一个最近两年越来越现实的话题,就是RWA和证券代币化。一张股票或者债券被搬到区块链上,并不会因为技术形式发生改变,就突然从证券变成商品;证券还是证券,SEC仍然负责监管。CLARITY并不是用Crypto重新发明金融法律,而更像是在原有金融体系旁边把一块长期没有铺平的路接上去。
理解这一点以后,也就能明白为什么去年GENIUS Act通过之后,整个行业仍然把CLARITY看得如此重要。稳定币只是金融体系里“钱”的一部分,而真正涉及交易、发行、融资、托管、DeFi和二级市场的那一大块,仍然没有被国会完整写进法律。
美国现在其实已经有了不少规则,缺的是这些规则能维持多久
CLARITY最容易让圈外人产生的另一个误解,是以为没有这部法案,美国Crypto行业就又回到了Gary Gensler时代那种完全靠执法猜监管边界的状态。
其实并不是。
今年3月17日,SEC和CFTC已经联合发布了一份重要解释,对数字商品、数字证券、稳定币等资产进行分类,并对一个非证券数字资产什么时候可能因为发行安排构成投资合同、什么时候这种投资合同关系又可以结束,给出了更系统的解释。
到了8月,SEC又正式提出新的加密资产发行规则,为部分项目设计专门的发行豁免和安全港,其中包括规模较小的初创融资渠道,以及12个月内最高7500万美元的发行安排。
如果单看2026年的方向,美国Crypto监管其实已经比几年前清晰太多。SEC不再坚持“绝大多数代币都是证券”的模糊立场,CFTC也在利用现有权限探索数字商品现货市场的监管框架。
对于创业公司来说,过去完全依赖律师猜测SEC下一步会不会执法的状态,正在逐渐变成一套至少可以拿来设计产品和合规路径的规则。
但这里有一个看起来非常法律技术、实际上对商业决策特别重要的区别:监管机构今天出台的规则,和国会写进法律的规则,不是一回事。
SEC今天可以作出解释,未来的SEC也可以改变解释;今天可以经过正式程序制定一套新规,下一届政府同样可以通过新的程序重新修改。正式规则当然比主席演讲、工作人员指引更加稳定,也不会因为换一个SEC主席第二天就自动消失,但本质上它们仍然建立在行政机构现有的法定权限之上,法院也可能继续追问这些机构究竟有没有越权。
这一点连现任SEC主席Paul Atkins自己都说得很直接。他在8月提出新规时明确表示,国会立法对于建立足够持久、能够防止未来监管者轻易推翻的规则仍然“不可或缺”。换句话说,即使是今天正在积极推进Crypto新规的SEC,也并不认为自己能够完全替代国会。
从创业者角度来看,这种区别一点都不抽象。一家公司真正考虑的从来不是“我今年能不能上线一个产品”,而是值不值得花三年时间、几千万美元,申请牌照、组建合规团队、重做产品和托管架构以后,相信2029年换一个总统、换一批监管者,这套东西依然大致成立。
大型金融机构更是如此。银行如果真的要把链上托管、结算、交易甚至部分核心银行系统重新搭建起来,看的不是今年和明年的政策,而是未来十年的制度稳定性。
所以CLARITY最核心的价值,可能并不是让美国“变得更支持Crypto”。至少在当前这一届政府下,美国政策已经相当支持Crypto了。
它真正想解决的是另一件事情:把今天的政策方向,从“一届政府的选择”,变成一套更加难以轻易逆转的法律。
真正有意思的冲突,不是SEC和Crypto,而是稳定币开始抢银行的存款了
如果这是几年前,我大概会觉得CLARITY最难谈的地方一定是SEC和CFTC谁来管Crypto。但看到今年的谈判以后,反而是稳定币收益和银行之间的冲突跳上了头条,因为这可能代表Crypto第一次真正碰到了传统金融最核心的利益。
GENIUS Act 已经禁止稳定币发行人直接向持有人支付利息,但很快就出现了另外一个问题:如果不是发行人,而是Coinbase这样的交易平台给用户奖励呢?如果用户持有稳定币可以获得某种收益,银行存款还会不会像以前一样具有吸引力?
Crypto行业看到的是产品竞争。既然用户的钱最终对应的是美元资产,而技术又可以降低分发和运营成本,那么为什么不能把更多收益返给用户?
银行看到的却完全是另一件事。
对于美国大量社区银行来说,低成本存款并不只是一个产品,而是整个资产负债表最关键的资金来源。银行拿到居民和企业的存款,再把这些资金变成小企业贷款、房贷和商业地产贷款。
如果大量资金从银行账户转到可以获得更高收益的稳定币账户,影响的就不仅是银行少赚一点手续费,而可能是整个贷款体系的资金成本。
这也是为什么今年围绕CLARITY的游说,最后演变成了一场Crypto行业和银行业非常直接的利益博弈。在9月投票之前,双方都利用国会休会期直接去参议员所在州游说;银行业最核心的担忧之一,就是稳定币收益可能把传统存款抽走,而Crypto行业则认为银行试图利用监管保护既有利益。
共和党最终版本也专门加入了一个针对社区银行的“熔断”机制,试图让财政部在法案实施后评估稳定币收益是否对小型银行造成重大负面影响,但银行业的反对并没有因此消失。而且这个问题到最后已经越来越不是简单的民主共和两党之争,而更像是共和党内部“银行利益”和“Crypto利益”之间的冲突。
这件事其实非常有象征意义。
过去Crypto和传统银行之间的冲突,大多停留在银行愿不愿意给交易所开户、监管者允许不允许银行托管Crypto这些外围问题;但稳定币发展到今天,双方开始真正争同一笔钱——用户放在哪里的美元。
从金融行业的角度来看,争支付入口很重要,争交易流量也很重要,但真正碰到资产负债表才算进入腹地。
所以反过来看,今年银行业如此激烈地参与CLARITY争议,可能恰恰说明稳定币已经从一个Crypto原生产品,逐渐变成了传统银行必须认真对待的竞争者。
DeFi看起来是在保护程序员,其实是在重新定义什么叫“金融中介”
另一个长期被Crypto圈简化的问题是DeFi开发者保护。
比较直觉的一种说法是,一个程序员只是在GitHub上写了一段开源代码,既不替用户保管钱,也没有能力决定别人怎么使用,当然不应该因为有人用这段代码转账就被当成银行或者汇款公司监管。这个逻辑本身并没有什么难理解的,所以CLARITY过去一年一直在尝试更清楚地区分“写软件”和“经营金融中介”。
但反过来,如果监管规则只要看到“开源代码”几个字就完全退出,那么任何金融中介理论上也都可以给自己包上一层协议外壳,继续收手续费、控制关键权限甚至决定谁能使用,却声称自己只是一个软件项目。
因此真正的问题从来不是“程序员要不要承担责任”,而是谁拥有控制权。
谁替用户保管资产,谁可以单方面升级协议,谁能冻结资金,谁收取费用,谁决定哪些资产进入系统,谁有能力改变交易结果,这些才是判断一个DeFi项目究竟只是提供工具还是已经承担金融中介功能的关键。
这也是为什么CLARITY到了最后会把开发者保护、反洗钱、刑事责任、州消费者保护等一堆看起来互不相关的问题同时卷进来。表面上大家在争一个定义,底层其实是在重新划分责任:区块链把传统金融机构的一部分功能拆散给了开发者、验证节点、前端、协议治理者和交易平台,那么传统法律里原本由一个金融机构承担的责任,也就必须重新分配。
所以Crypto真正进入金融主流以后,最麻烦的问题其实都开始变得非常“不Crypto”。
谁承担责任,谁拿牌照,谁保护消费者,出了问题谁赔钱——这些问题一百年前金融监管就在解决,技术可以重新设计金融基础设施,却不会让这些问题凭空消失。
然后特朗普把一场技术谈判,变成了利益冲突问题
如果CLARITY最后只是卡在SEC和CFTC分工、稳定币收益或者DeFi开发者责任上,反而事情会简单很多,因为这些最终都是可以通过不同利益集团让步来寻找平衡的问题。
今年夏天真正改变谈判性质的,是特朗普及其家族在Crypto行业里的经济利益。
这里其实不需要站在任何一边评价特朗普该不该拥有Crypto资产,真正麻烦的是制度本身出现了一个非常直观的冲突:美国国会正在制定一套决定Crypto公司未来可以做什么、谁可以进入市场以及如何赚钱的基础法律,而现任总统及其家族同时又在这个行业中拥有显著的经济利益。于是对民主党谈判者来说,伦理限制逐渐从一项附加条款,变成了支持整部法案的重要前提。
共和党并不是完全没有让步。9月14日公布的最终修订文本中,共和党谈判方表示一共吸收了126项民主党提出的实质性修改,其中包括更加严格的公职人员Crypto限制,以及扩大州检察长的部分执法权限;而且甚至特朗普本人都接受了Tillis和Gallego提出的伦理框架中的相当一部分内容。
但民主党谈判者仍然认为,最终版本在执行独立性、资产处置范围以及相关漏洞方面不够严格;与此同时,共和党方面则认为已经进行了大量让步,民主党仍然没有形成足够票数支持法案。
最后72小时里,双方实际上已经不是在争论“美国需不需要Crypto市场结构立法”,而是在争论什么样的利益冲突限制才足以让这部法律具备政治合法性。
这里我觉得需要避免一种过于简单的归因。
说“民主党为了反特朗普故意杀死Crypto法案”显然解释不了银行业的反对以及共和党内部的反对票;但反过来说“完全是特朗普的利益冲突毁了CLARITY”,也会忽略稳定币、DeFi、反洗钱、州监管权这些在特朗普问题出现以前就已经存在的深层分歧。
更接近现实的情况,可能是原本几个虽然困难但仍然可以谈判的问题,在中期选举前极度压缩的时间窗口里,又叠加上了一个双方都很难退让的伦理争议。最终文本直到投票前不到两天才公布,600多页内容还在不断调整,技术问题、金融利益和选举政治同时挤到最后几十个小时,最后自然也就很难靠一两个条款救回来。
49比50之后,美国Crypto并没有回到原点
所以我并不觉得CLARITY失败以后,美国Crypto监管会重新回到前几年那种一片混乱的状态。
SEC今年已经把大量重要问题讲得比过去清楚,新的发行规则正在推进;CFTC也已经明确表示,即使国会不通过CLARITY,也会继续研究如何利用现有法律权限推进数字资产市场规则。
换句话说,国会这条路暂时堵住以后,监管权力会更多流回SEC、CFTC以及未来处理诉讼的法院,而不是所有事情全部停摆。
这也是我觉得未来一两年美国Crypto最有意思的状态:规则可能会越来越多,能做的事情可能也越来越多,但制度本身未必因此越来越稳定。
对于短期做产品的公司来说,这两者看起来区别不大。只要SEC不来执法、律师认为规则允许、投资人愿意出钱,产品当然可以继续往前做。但对于真正需要投入几年建设合规体系、银行基础设施、托管和清算网络的大公司来说,“今天可以做”和“五年以后依然可以做”,完全是两个商业问题。
这大概也是为什么行业投入了这么多政治资源推动CLARITY。
Crypto行业过去几年已经在游说和政治活动上投入了数亿美元,尤其是Fairshake这种上亿级别横跨两党的Super PAC。如果只是想换取当前监管机构更友好的态度,其实今天已经基本实现了。真正还没有拿到的,是把这种友好程度写进一部下一任总统也不能轻易改变的法律。
当然,这里也存在一个很强的反方观点:如果SEC和CFTC未来几年能够稳定推进规则,而且这些规则经受住法院挑战和政府更替,那么国会立法的重要性也许没有行业今天想象得那么高。正式规则虽然不像法律那么稳定,却也不是换一个主席就可以随手删除;监管体系本来就是由国会法律、机构规则和法院判例共同构成的。
所以接下来真正值得观察的,并不是预测CLARITY明年到底有多少概率重新通过,而是看SEC和CFTC这条“没有国会也继续走”的路线到底能走多远。如果企业能够基于这些规则放心投入,而且下一届政府也没有大幅推翻,那么CLARITY这次失败的长期影响会比目前想象得小很多;相反,如果这些规则不断遭遇法院对监管权限的挑战,或者2028年之后又随着政治周期明显反转,那么市场最终还是会重新回到Congress面前。
Crypto终于进入了真正的金融政治
回头看这次CLARITY失败,我反而觉得它最值得记住的,并不是哪一个党投了多少票,也不是比特币当天到底跌了4%还是5%。
过去我关注这个行业的十几年,Crypto行业习惯把自己描述成一个挑战传统金融体系的外部力量。早期最重要的问题是Bitcoin到底是不是钱,后来变成以太坊和各种Token到底是不是证券,再后来是SEC究竟有没有权力监管这些公司。整个行业和华盛顿的关系,基本还是一个新兴行业要求旧体系给自己留出空间。
到了今天,情况已经完全不同。
稳定币开始和银行争存款,Coinbase这样的交易平台需要全国性的金融牌照体系,BlackRock等传统金融机构已经在做代币化资产,DeFi开始逼迫监管者重新定义什么叫金融中介,而总统和政治人物在Crypto中的经济利益,也开始需要和传统金融一样面对利益冲突规则。
这其实才是一个行业真正进入主流以后的样子。
大家以前总说希望Crypto获得监管清晰度,但真正的监管清晰从来不是监管者简单说一句“你们可以做”。一旦进入金融体系核心,每一条所谓的清晰规则背后,都意味着有人获得权限、有人失去利益,有人拿到牌照,也有人需要承担过去没有承担过的责任。
从这个角度来看,CLARITY越接近终点反而越难通过,并不是一件特别意外的事情。
因为当Crypto还很小时,所有人都可以抽象地支持“创新”和“清晰监管”;等到它真的开始影响银行存款、资本市场、消费者保护和政治人物自身利益的时候,大家才需要回答那些真正困难的问题。
CLARITY这次没有解决这些问题,但美国Crypto也已经不可能回到过去了。
未来几年真正的悬念,不再是美国到底接不接受Crypto,而是谁来写这套规则,以及这套规则究竟能够维持多久。
而这一次49比50的投票,真正没有跨过去的,也不是表面上的一票。
是从“这一届政府愿意这么做”,到“美国法律以后都这么做”之间的那道门槛。
2026 AI Builders Day 完整议程公布:当模型不再稀缺,AI Builder 靠什么赢?一场关于算力、应用与下一波 AI 机会的上海聚会
一个周末做出 AI Demo 已经不难,但为什么真正被持续使用、让用户愿意付费的产品依然稀缺?
当模型能力逐渐趋同、调用成本持续下降,AI Builder 面临的问题正在从“能不能做出来”,转向“为什么用户会选择你”。产品的长期壁垒究竟来自数据、场景、工作流、用户关系,还是品牌与分发?当模型供应商涨价、限制地区或调整规则,应用又该如何保持稳定运行?
9 月 21 日,由 6Block 发起,Techub News 与 Miuro.ai 联合主办的「2026 AI Builders Day 上海站」将在上海国投大厦举行。活动预计汇聚约 100 位开发者、创业者、投资人与产业伙伴,从算力基础设施、模型调用到投研、视频与音乐创作,共同探讨 AI 如何从技术能力走向真实产品。
当模型不再稀缺,Builder 的机会在哪里?
活动压轴圆桌将以「AI 的尽头——当模型不再稀缺,AI Builder 的机会在哪里?」为主题,把讨论落到每一位 Builder 正在面对的现实选择:
如果只有三个人、有限预算和六个月时间,应该从模型、算力、Agent、工具还是垂直应用切入?
为什么 AI Demo 越来越多,真正找到 PMF、获得持续付费的产品却依然有限?
面对闭源模型、开源模型、自建部署与多模型 API,开发者应该如何选择基础设施?
当大家使用相同的模型,产品真正的壁垒在哪里?
如果 AGI 比预期更早到来,今天最值得积累的能力和资产又是什么?
这场讨论不试图给出统一答案,而是希望通过来自基础设施、产品、内容创作与生态一线的不同视角,帮助 AI Builder 看清下一阶段真正值得投入的方向。
从算力底座到具体应用
圆桌之前的多场主题分享,也将为这些问题提供具体的实践样本。
Gonka.ai 团队核心贡献者将带来主旨演讲,分享开放 AI 算力网络的实践与观察;GonkaRouter.io 技术负责人将以「一个 API,组建你的 AI 专家团」为题,介绍多模型能力的调用与协作;Uweb AI 团队实操导师将通过真实案例,分享如何用 AI 搭建辅助个人的投研系统。
在内容创作方向,Craftale AI 团队将围绕「AI 视频创作新范式:从灵光一现到完整短片」,拆解从创意到成片的完整流程;Miuro.ai 团队CTO 则将分享 AI 如何重构音乐创作、全球发行与价值流通。
目前确认出席的嘉宾还包括 SentientAGI APAC Lead Anita、星野大学校长及 AI 内容创作者 星野、Monad Greater China Ecosystem Lead、Billions Network APAC Lead 等 。
除议程嘉宾外,Haotian、DeFi Teddy、Jingle Bell 初号机、王小楼、Laughing、Zisu、Neal 与 Shawn Pang 等几十位 AI 及 Web3 研究者、创业者和生态建设者也将来到现场,与 AI Builders 围绕算力、Agent、产品落地与增长展开交流。
媒体及社区支持包括 OpenSchool、Foresight News、区块律动、深潮、PANews、Odaily、深求社区、OpenBuild、复旦大学区块链协会、华东政法大学区块链协会、TinTinLand 与 NODE-X 等。
现场还将设置问答、抽奖、茶歇和自由交流环节,奖品包括小米 AI 眼镜、 AI 推理、视频及音乐创作 Token 礼包,万向区块链周及 TOKEN2049 主会场门票等。
活动信息
时间:2026 年 9 月 21 日 13:30–18:00
地点:上海市虹口区东大名路 638 号国投大厦 15 楼多功能厅
报名:https://luma.com/d66o016k
Celestica:市场刚刚给投资者送上了一份价值 110 亿美元的“大礼”尽管 Celestica Inc.(CLS)近期财报表现超预期,而且整个市场也从 7 月底低点开始反弹,但随着投资者消化公司 8 月份的增发,Celestica 股价仍然持续承压。具体而言,公司在本季度以每股 310 美元的价格发行了超过 1,110 万股新股,募集资金总额接近 35 亿美元。
不过,公司近期与 Advanced Micro Devices(AMD)以及 OpenAI 披露的一系列高质量合作持续推进,进一步凸显出 Celestica 在把握快速变化的计算需求趋势方面,其竞争地位正在不断增强。
具体而言,AI Agent 的兴起正在加速计算需求从以训练为主的工作负载,向高容量推理转移。而最近 Agentic AI 的部署范围也开始从此前主要集中于企业环境,进一步扩展到大众消费者市场,Meta Platforms(META)最新推出的 Muse 就体现了这一趋势。
推理强度不断上升,也相应增加了芯片之间的数据传输量。由于电力预算天然受到限制,这进一步提高了最大化每瓦性能(perf/W)的迫切性。因此,市场对于低延迟、高带宽网络的需求正在持续增强,尤其是 scale-up fabric,因为它负责同一计算域内部的互连,而其互连密度大约是跨机架 scale-out 架构的 10 倍。
而 Celestica 最近与 AMD 和 OpenAI(OPENAI)的合作,也表明公司正在进一步扩大在相关机会中的覆盖范围,将目前在 scale-out 网络中的增长势头拓展至 scale-up 网络,并进一步深入到“板卡、机架和系统”层面的集成。这意味着 Celestica 能够在不断扩大的 AI 基础设施 TAM 中获取更大的价值份额,从而强化其正在加速的增长轨迹,同时随着更高价值的 Hardware Platform Solutions(HPS)业务扩大,也有望支持 Connectivity & Cloud Solutions(CCS)业务持续释放经营杠杆。由此带来的盈利上行空间以及长期自由现金流增厚,将是抵消近期增发造成股权稀释的重要因素,同时随着 Agentic Inference 不断扩大 Celestica 的需求前景,公司仍有望保留进一步的上行空间。 fileciteturn1file0L1-L9
AI Agent 正在推动网络强度上升
Agentic AI 的加速转型已经改变了 AI 开发的经济优先级。正如我此前的文章所讨论的那样,Agentic 工作负载所需要的持续推理循环、工具调用与模型调用,以及上下文检索,本质上都会提高推理 Token 的消耗量。而随着 Meta 最近推出 Muse,Agentic AI 的部署范围也正在进一步从此前主要集中于企业环境,扩展至大众消费者市场。
具体来说,早期 Agentic AI 的采用主要集中在编程、工程、数据科学以及其他企业工作流中。根据行业预测,这些企业工作流分别占 OpenAI 和 Anthropic(ANTHRO)ARR 结构的大约 60% 和 90%。不过,Muse 的推出有望扩大消费者对 Agentic AI 的采用。虽然目前 Muse 的部署仅限于美国,但考虑到 Meta 过去能够成功通过其 Family of Apps 向全球用户分发新功能,而该生态系统目前覆盖 36 亿 DAU,因此 Muse 未来一旦拓展至海外市场,就可能释放数十亿新增用户。与此同时,随着越来越多竞争者进入这一领域,Agentic AI 在消费者场景中的采用范围也很可能进一步扩大。
这与近期行业数据是一致的。目前行业预计,推理工作负载已经占全部计算需求的“大约三分之二”,高于 2023 年的三分之一以及 2025 年的一半。Dell(DELL)最近还预计,随着 Agentic AI 加速发展,到 2030 年推理 Token 数量将增长 87 倍,达到 3,600 千万亿个。不过,电力依然是核心约束因素,因为电网容量扩张速度仍然落后于 GPU 部署进度。因此,在固定电力预算下,推理量不断增长正在推动下一代 AI 系统设计越来越重视每瓦性能优化。
这也相应提高了网络强度,因为要在固定电力预算下优化 perf/W,就越来越依赖更高带宽、更低延迟的互连,以减少芯片之间的通信瓶颈,并最大化系统利用率和正常运行时间。Cisco(CSCO)最近对这种强度进行了量化,其研究显示,在执行相同任务时,AI Agent 产生的网络流量最多可以比人类高 450%。这反映出,Agentic AI 的采用不仅提高了新增计算部署的迫切性,也同步增加了对配套网络基础设施的需求。AMD 最近发布的一份报告也印证了这一点,该报告将网络称为“决定 AI 性能与经济性的关键因素”。因此,这种背景进一步强化了 Celestica 未来在 scale-out 和 scale-up 领域的机会,也意味着公司的增长和盈利前景仍存在进一步上行空间。 fileciteturn1file0L11-L18
Helios 和 Jalapeno 验证了 Celestica 的 Scale-Up 拐点
Celestica 在 400G 和 800G 交换机上的持续增长,以及即将开始放量的 1.6T 项目,已经印证了公司正在不断扩大其在 AI scale-out 市场中的份额。具体来说,800G 交换机快速放量,以及 400G 需求保持韧性,是第二季度 HPS 业务增长的重要驱动力。与此同时,随着 10 个活跃项目将在 2026 年下半年至 2027 年期间进入放量阶段,公司即将转向 1.6T,这很可能进一步强化 Celestica 的竞争地位,因为 1.6T 路线图与越来越大规模 AI 集群部署所需要的更高带宽和容量高度匹配。
不过,公司近期赢得的订单更重要的一点,是显示 Celestica 正在扩大在更靠近计算本身环节中的价值份额。正如前面所讨论的,从以训练为主的工作负载向推理加速转型,正在显著提高 scale-up 网络对于带宽和延迟的要求,因为 scale-up 网络负责连接同一计算域内部的 CPU、GPU 和 ASIC。这与管理层的判断一致,公司预计未来三年 scale-up TAM 将显著增长,而 Celestica 最近赢得的项目——包括与 AMD 的合作——表明公司已经很好地抓住了这一趋势。
具体而言,Celestica 正在与 AMD 合作,参与后者即将部署的首个 Helios 机架级系统。Celestica 将负责 Helios 每个机架中构成“互连骨干”的“scale-up 网络交换机研发、设计和制造”,这意味着公司的业务路线图正在向更加接近计算核心、价值量更高的领域发生拐点。管理层预计,这项合作将形成数十亿美元级别的业务机会,而 AMD 目前已经锁定的 Helios 部署管线也进一步提高了可见度。其中包括:Anthropic 承诺部署最高 2GW 的 AMD Instinct MI450 系列 GPU,并在 Helios 机架中运行,其中首个 1GW 将于 2027 年上半年出货;Meta 做出跨多代产品的承诺,将部署最高 6GW AMD Instinct GPU,其中首个归属于 Helios 的 1GW 将于 2026 年下半年出货;OpenAI 同样做出跨多代产品的承诺,将部署最高 6GW AMD GPU,其中首个 1GW 也将对应 MI450 系列 Helios 机架,并于 2026 年下半年出货;Oracle(ORCL)则将在 2026 年第三季度部署首个包含 50,000 颗 AMD MI450 GPU 的 Helios AI 超级集群。上述项目预计都将由 Celestica 的 scale-up 网络交换机提供支持。
**Thanos Moschopoulos,BMO Capital Markets Equity Research:**那么,我们是否可以假设你们参与了其中大多数项目?还是说最终由超大规模云服务商来决定机架的具体配置?
**Robert Mionis,CEO 兼董事会主席:**不,我们参与了所有这些项目。
来源:Celestica 2026 年第二季度财报电话会议。
Celestica 在 AI 基础设施 TAM 中渗透率进一步加深,也得到了近期与 OpenAI 在 Jalapeno 项目上的合作验证。公司将为 Jalapeno 架构贡献其“板卡、机架和系统方面的专业能力”,其中包括对 Jalapeno 的“Katsu”CPU Host 与“Vindaloo”ASIC 机架进行系统级集成,这些系统通过 PCIe 直连铜缆(DAC)连接。实际上,这使 Celestica 的 scale-up 敞口不再局限于基于通用 GPU 的系统,同时也进一步叠加了公司此前作为 Google(GOOG/GOOGL)TPU 首选制造合作伙伴所建立起来的定制 ASIC 业务基础。
综合来看,最近赢得的这些项目表明,Celestica 正在同时加深对 scale-up 和 scale-out 市场机会的渗透。这些订单也验证了公司对目前正在推进的“多个 scale-up 项目洽谈和合作”最终转化的信心,而管理层预计,随着 1.6T 的到来,这些机会将进一步获得推动。这也意味着 Celestica 更高价值的 HPS 业务将从单纯网络领域,进一步延伸至机架和系统级配置。与此同时,这一进展还进一步叠加了第二季度已经观察到的企业 AI/ML 服务器与存储业务加速势头,说明公司正在下一代架构中获取更多内容价值,从而为 Celestica 基本面进一步上行提供支持。 fileciteturn1file0L20-L40
基本面考量
在根据 Celestica 实际第二季度业绩以及前瞻指引,对我此前预测进行调整后,同时考虑近期新增订单以及 AI 基础设施需求结构正在发生的变化,我预计公司本年度收入将同比增长 65%,达到 205 亿美元。随后,公司收入预计将在截至 2030 年的五年期间实现约 37% 的 CAGR。增长将主要由 CCS 业务推动,而近期披露的订单提高了需求可见度,同时新出现的 scale-up 市场机会预计将在 Celestica 即将进入 1.6T 放量阶段后进一步获得动能。
【原文图片位置:Celestica 基本面分析、增长预测与盈利预测(作者)】
正如前面的分析所讨论的那样,Celestica 向 scale-up 市场扩张,预计将进一步扩大其更高价值 HPS 业务在不断增长的 AI 基础设施 TAM 中的覆盖范围。这将推动 CCS 的产品组合进一步改善,因为管理层此前已经指出,Celestica 的“非 HPS 业务利润率不如 HPS 产品高”。与此同时,随着 scale-up 渗透率提升以及 1.6T 放量带动整体出货量增长,经营杠杆预计也会进一步增强,并在规模扩大过程中持续推动利润率上升。
【原文图片位置:Celestica 基本面分析、增长预测与盈利预测(作者)】
股价考量
综合来看,我更新后的预测支持 Celestica 每股 400 美元的目标价,高于此前的每股 384 美元。该目标价对应公司约 510 亿美元的内在价值,也就是说,在市场因近期股权稀释以及基础设施支出不确定性导致股价下跌后,相比当前水平仍有大约 110 亿美元的潜在市值上行空间。
【原文图片位置:Celestica 估值分析与目标价(作者)】
该目标价是基于现金流折现模型得出的,其中采用了与上述基本面分析一致的预测。终值采用对 2030 年预计 EBITDA 应用 1.5% 永续增长率计算。1.5% 的永续增长假设反映了 Celestica 核心市场长期经济扩张的预期速度,并可以作为公司进入稳定阶段后现金流可持续增长率的合理代理。包括终值在内的全部现金流预测,使用 10.3% 的 WACC 进行折现,这与 Celestica 的资本结构以及风险特征一致。每股价值则基于公司在 2026 年第二季度 10-Q 中披露的摊薄股数,并额外计入公司在 8 月份发行的 1,110 万股新股。
【原文图片位置:Celestica 目标价估值分析(作者)】 fileciteturn1file0L53-L62
需要考虑的风险
近期有关 AI 安全问题的担忧,以及随后行业内要求“放慢前沿 AI 发展速度”的呼声,再次给整个 AI 基础设施交易带来了波动。这一点已经反映在 Celestica 股价上:9 月 14 日周一开盘时股价跳空下跌 6.9%,最终收盘跌幅达到 8.8%,明显跑输大盘,因为投资者正在评估潜在前沿 AI 发展放缓可能带来的影响。
不过,此后 Celestica 已经收复部分跌幅,因为 Nvidia(NVDA)CEO Jensen Huang 并不同意继续快速推进 AI 与安全之间必须二选一的隐含逻辑,包括对于灭绝风险的担忧。他认为,公司应该“尽可能快地向前跑……但在有需要的时候暂停一下,确保把事情做对”,以保证产品安全。Meta CEO Mark Zuckerberg 也表达了类似观点,他表示,“每一家实验室都有责任和动力,以训练模型所需要的安全速度推进,同时也有能力自行采取行动确保这一点”,并不需要刻意放缓进程或者建立联邦层面的统一治理框架。
最新的发展再次凸显 Celestica 仍然暴露在较高的市场波动之下,因为投资者正在重新评估高水平 AI 基础设施资本开支能否长期持续,同时也还在消化近期股权稀释带来的影响。不过,公司持续保持稳定的执行力,尤其是近期不断扩大的订单合作,已经提高了其增长和盈利前景的可见度。即便围绕“放慢前沿 AI 发展速度”的不确定性仍然存在,这依然有望成为降低公司投资风险的重要因素。 fileciteturn1file0L64-L69
最后观点
综合来看,市场很可能已经显著低估了 Celestica 的上行空间,因为公司正在出现的 scale-up 拐点,会进一步叠加目前已经非常强劲的 scale-out 网络以及 AI/ML 服务器增长动能。具体而言,近期 Helios 和 Jalapeno 项目的赢单,为 Celestica 在下一代 AI 架构中不断提高内容价值份额提供了有力验证。这还将受到即将到来的 1.6T 转型进一步推动,而管理层预计,1.6T 将加速公司的 scale-up 机会,并推动更多订单转化进入其更高价值的 HPS 管线。
展望未来,Celestica 即将进入的 1.6T 放量阶段,以及 Helios 和 Jalapeno 项目首批产品的出货,将成为股价的重要催化剂,因为它们能够提高市场对公司 scale-up 机会的可见度。同时,Celestica 产品组合持续向更高价值的 HPS 销售倾斜,再叠加持续释放的经营杠杆,也有望进一步抬升其盈利和自由现金流增长轨迹。综合来看,这些因素应该能够增强公司从当前估值水平进一步向上重估的可能性,同时抵消近期增发造成的短期股权稀释影响。
放弃百万美金年薪,牛津兄弟想训出「华尔街AI分析师」「自研模型,冲向交易金字塔尖。」
文|孙小雯 海若镜
编辑|海若镜
做AI金融模型创业前,子辰已是年薪百万美元的“金领”,凭借在顶级投行练就的交易嗅觉,赚钱对他来说不算难事。
创业的起心动念,源于一场AI交易大赛Alpha Arena。2025年底,DeepSeek、GPT、千问等大模型都下场参赛,也让子辰发现:通用大模型已经进化出一定的独立判断能力。也许未来,他引以为傲的投资决策能力,也能被大模型复现。
与其恐慌,不如下海去搏一搏风浪。他找到正在Meta从事模型研究的方正,两人一拍即合,开启了名为FreeRide的AI创业航程。「暗涌Waves」独家获悉,FreeRide AI近日完成数百万美元种子轮融资,投资方为L2F光源创业者基金。
在还没有Demo时,就拿到融资,关键有两点:一是选择的方向,二是创始团队的履历和潜能。从牛津大学数学系毕业后,子辰先后在伦敦和香港的摩根士丹利、摩根大通、华泰国际等机构工作,从事复杂衍生品交易,曾担任高级交易主管。
方正的履历则更为复合。牛津大学物理系毕业后,他先后在瑞银、Evercore、麦格理资本等机构,处理欧美区域的投行投资业务。因为感知到AI在金融行业的巨大潜力,他又回到剑桥大学攻读计算机科学博士,并参与到Meta、Oracle等大厂的AI模型训练和AI系统的研究。
两人开始探索:大模型已初具决策智能,但要让AI拥有“华尔街交易员”级别的能力,还有多少座山要翻越?
第一座绕不开的是“数据”。文本、代码可以被海量采集,但真正影响金融交易的高质量经验,往往只存在于一线从业者的大脑里。即便能采购诸多类型的数据库,但怎么判断数据价值、权重,进而转化为真实世界里的决策智能,仍有鸿沟。
而且,金融交易数据天然高噪声,现有大模型围绕coding智能体,适配出的长流程模式很难直接迁移。
架构层面,金融交易任务往往依赖极高维度的逻辑分析,很多任务不是定点、单向的求解路径,仅靠常规模型训练方法难以突破,还需要引入专门的系统学习架构。
即便金融专业模型掌握了应有的专业知识与能力,金融市场瞬息万变,只有让AI能够自主学习、自我进化,才可能捕捉到真实市场信号。
这些路障,也让他们理清了技术路线:做AI金融交易大脑,必须自训专业的垂直模型底座,同时做自进化Agent。基于在金融行业沉淀的经验,调整接入通用大模型的参数权重,进化出更有实操经验的LLM底座,先让AI成为有2-4年工龄的初级员工;再通过自进化Agent,让模型能够适应实时多变的金融交易。
自研模型,无疑是昂贵且艰难的。但子辰、方正认为,这是冲上金融“金字塔尖”的必经之路。一旦跑通,垂直模型进入塔尖的华尔街投行和一线基金,参与衍生品定价、复杂投资研究及决策,未来将能辐射更广的金融市场,甚至成为普通人的交易“副驾”。
在他们看来,模型大厂和互联网平台的确拥有更多算力与资源,但却很难偏离当前AI发展主线,聚焦于金融这一细分场景。未来AI系统,或许更像一个交响乐团:通用大模型,与一群专业模型合作,完成复杂任务。
除训练金融专业模型以外,两人在2026年发表论文,初步验证Agent在高噪声、高变化金融领域自进化的可行性。这一“会寻找Alpha的研究员”机制,在沪深300市场中测验,经过1600步进化后,将生成因子的IR中位数从1.6提高到3.9。这个表现不俗,在传统量化领域,IR大于1.0就可称为优秀因子。
技术初验后,接下来FreeRide将从衍生品定价等专业任务切入,做出金融专业人士可用的模型,再拓展到更广泛的金融任务。
以下是「暗涌Waves」与FreeRide联合创始人张子辰、沈方正的对话(经编辑):
Part01
AI交响乐团:
通用模型带一群垂类
暗涌:通用模型能搭Agent和Harness,为什么还要自己训练底层模型?
子辰:我们还是要用第一性原理去解决智能问题。现在Agent和Harness的架构越来越复杂,但如果你不掌握底层模型权重,上层设计地再精妙,也会面临一些风险,比如通用模型无法满足特定场景的任务质量。
另一方面是,以后机构会有自己的Agent,但这个Agent用哪个模型去驱动?现在的通用大模型不一定适合,我们希望做出一个更适合金融场景的模型,让这些Agent有机会用到FreeRideAI模型。
我们对比过GPT、Claude、DeepSeek、千问、MiniMax和智谱。在衍生品定价这类问题上,它们的确懂很多基础知识,但更像一个很好的实习生。你来投行实习,给出这样的回答,我觉得是OK的;但作为正式员工就不达标,因为你的答案过于肤浅,理论没有结合实际市场经验。
暗涌:投资人怎么看金融垂类模型,担心被通用模型吞掉吗?
子辰:感觉几个月以前,大家还在担心通用模型可以吞噬一切,但最近这一个月开始有变化。
通用大模型有几个限制,包括在专业领域的性能、成本和速度。对于特定专业,模型规模不一定是越大越好,最终形式可能是通用大模型与一系列专业模型合作完成任务。
现在的通用模型,在编程垂类已经做得非常好,但在金融、医疗等专业领域仍需要垂类模型。因为金融领域的一些实操经验,网上搜不到,书里也不会有。一个科技工作者很难复刻垂直领域里的顶尖能力。
方正:与其叫垂类模型,叫专业化模型可能更准确。与通识教育类似,现代AI在早期训练中打下的广泛知识基础,但若想像专业人士一样在特定领域独当一面,必须有高度专精的知识与职场技能培养。
暗涌:怎么确定金融模型该学什么?
方正:如果把模型训练比作“炼丹”的话,首先要知道这个“丹”是给谁吃的、解决什么问题。正因为我们团队在伦敦、纽约、香港等国际金融中心拥有丰富的专业经验,我们知道金融机构和专业人士需要AI模型做什么,就能反过来判断它应该具备什么能力、需要什么样的数据。
暗涌:买大量的商业金融数据库,来训练金融专业模型,是必须的?
子辰:确实需要采购数据库。但真正的经验是两点:第一,找到这些数据;第二,判断它们的价值和权重。同时面对100个数据,哪一个更重要?怎么把这些数据变成对决策有帮助的东西?决策思维链是怎样的?这些经验既往只存在于很小的金融圈,大家不会把它记录并公开出来。
比如期权定价的某一个参数,特定情况下怎么选,互联网语料和文献材料很少。但有一线交易实操经验的团队知道什么对、什么错,现有的数据里哪个权重应该更高、哪个应该更低。
如果只是把数据丢给模型专家,说“我有这些数据,你帮我去训吧”,最后的智能程度会非常低。就像经理让一个初级分析师分析问题,他直接把数据怼过去,那经理肯定会问:“我要你干什么?”
暗涌:只靠小圈子的经验,数据量够么?
子辰:首先,我们团队有能力从真实场景出发,针对需要解决的问题将相应的训练数据量放大。
另外,除了金融圈内的经验,我们还在做一件更有意思的事情,就是创建“模拟经验”的生成机制。它有些像AI斯坦福小镇,可以模拟人类的行为,各个角色在AI世界里交互。我们希望利用已有经验,用AI把数据量做大,去模拟更多有价值的经验。
暗涌:有具体的例子吗?
方正:关键技术细节,现阶段还不太方便透露太多。
但举一个例子,比如论文揭示的STAR机制,该机制处理的原始数据规模很小,而且全是有限、离散且信息与噪声高度浓缩的数值。
即便如此,我们仍然看到其中可以推导出有价值的观察结果,进而在后续阶段指导状态判断与决策行为。虽然应用于自进化和传统的后训练有所不同,但它印证了金融市场中很多信息可以被有效提取,并且作为信号推动AI系统与模型的整体迭代优化。
暗涌:金融领域现有的Benchmark怎么样,你们的垂类模型表现如何?
方正:现在金融领域的Benchmark并不是非常理想。比如去财报里找一些数字,本质上还是信息检索;或者是简单的计算,实质是把通用任务放到金融场景里。
我们也看到近期有一些Benchmark找专业人士标注,例如看一个问题需要从哪些角度思考的评测。但很多做得还比较粗糙,有些不是业内真正会考虑的问题。
子辰:我们不会盲目打榜。金融太大了,一个评测集可能只有小几百个问题。税务、会计、零售金融的问题跟机构金融的问题放在一起,各自覆盖面会比较狭窄。我们会针对性地判断,哪些Benchmark更适合我们。
Part02
自进化Agent:
即时感受市场变化
暗涌:为什么既要训练模型,又要让Agent自进化?
方正:它们是相辅相成的。由于通用模型在金融任务上的能力限制,只做Agent进化仍有效率和效果的瓶颈。与此同时,如果只做模型,那金融市场变化非常快,模型无法实时根据市场动态调整。
如果直接让通用大模型在金融任务上试错和进化,就像把基础能力不错的“高中生”送到华尔街,他成长为国际顶尖机构专业人士的进度,远不及直接引进具备扎实专业知识、高适应力的名校毕业生。训练金融专用模型,就是输出“AI金融名校生”。
我们希望Agent能够持续感知市场的变化,像人一样,慢慢沿着职业阶梯往上走。
暗涌:STAR自进化机制挖掘Alpha,和常见的Alpha挖掘有什么不同?这套机制会怎么用到产品里?
子辰:很不一样。一般大家会规定方向直接找Alpha。但我们的设计是让Agent进化成为一个很会找Alpha的研究员。
STAR加入了一个元认知模块,可以修改研究员的提示词、记忆、工具和研究流程。搜索时,也不只挑当前得分最高的个体,它会优先扩展能产生更强后代的谱系。论文里较少的进化步骤和成本,就将生成的因子使用的算子数量翻了将近7倍。
这些我们没有告诉它,都是它自主进化出来的。
反映到产品里,我们可以让用户定义自己想进化的方向。比如我现在有一个什么样的想法或者策略,你能不能通过STAR这套机制帮我进化,看看多少代之后会变得更好?这个是我们有机会做成“AI研究员”的能力之一。
暗涌:但论文的实验环境很简单,距离真正帮助机构做投资决策还有多远呢?
子辰:STAR这篇论文的核心目标并非优化单个Alpha因子,而是演化一个具备自主提炼能力系统的“Alpha研究员”。作为研究员,它能够综合市场现状、凝练思维框架、历史经验记忆及高阶数学算子工具,协同输出适配策略的量化因子。
这个世界上没有恒定的财富密码。
培养能够整合策略框架、经验与数学工具的研究型Agent,比单纯优化因子更具现实意义,也更契合人类研究员的工作逻辑。模型提出的因子,虽可通过不同样本及回测中的IC、IR和夏普比率等指标进行评估,但要将因子转化为最终的投资决策与收益,仍需历经投资组合构建、风险控制及交易执行等环节——这正是专业金融机构的标准运作流程。
现在机构大部分已经有自己比较成熟的机制,我们刚开始想做的是先融入进去。比如我给你一个好的Factor,你自己还有很多Factor,可以把它加进去做组合构建。
暗涌:怎么判断Agent给出的分析判断够不够专业?
方正:这里可以有很多方法,其中一种是将“高难度验证”转化为“低难度验证”。根据场景不同可以有很多具体实施细节,但其核心目标一致,即通过转换成正确性判定标准,简化整体验证流程。
不过,各种验证方法都无法完全取代行业最顶尖专家的重要性。我们有一个非常大的专家团来支持,他们是华尔街最顶尖的金融机构里的资深从业者,普遍有十几年、二十几年工作经验。
子辰:我举个例子。比如你问它怎么定价一个期权,普通的答案可能是看股票价格、波动率、股票的借款利率和股息率,这些都是教科书上能看到的东西。
但我们希望它能考虑到更多。比如这样的定价方式是否有对行业和同板块的分析,是否考虑到对未来事件的预测、对股票和行业未来资金流的分析等等。如果一个AI模型告诉我期权应该怎么定价,把这几点都说到了,我才觉得它在金融场景中是专业的。
Part03
未来之路
暗涌:FreerideAI首先想服务谁?他们最大的痛点是什么?
子辰:首先当然是希望金融机构和金融专业人士能满意。如果能做到,说明它达到了很高的智能水准。之后可以推广给更多普通人,这也是未来我们也想做的。
目前的问题是,大家根本不放心真的让AI协助投资决策。比如你问DeepSeek,明天该不该抄底?它会跟你说很多,看起来很专业,但有些回答存在AI幻觉,有些回答像教科书只给出概念。在专业的人看来,其实并不可用。
暗涌:现阶段,你们希望模型达到什么水平?什么时候能看到初步产品?
方正:近期要达到外资投行或者顶级对冲基金初级员工的能力,也就是有2到4年工作经验的员工水平。
随着模型训练越来越厉害,进化机制匹配得越来越好,再慢慢提高经验年限。当然,一开始是我们重点训练的场景和专业领域内,之后再逐步扩大事情的边界。
子辰:我们计划Q4推出初步Demo,到时候就可以看到一些特定场景的预演。衍生品定价是其中一个,未来还会逐渐泛化,扩展到二级市场交易、一级市场的投研等等。
暗涌:现在有密集接触投资人吗?什么时候准备启动下一轮融资?
子辰:最近主要在密集做产品研发和模型训练,等下个月Demo出来之后,再开始见一些投资人,准备融下一轮。
排版|郭栩君
图片来源|Unsplash
在折腾9个月后,手机Agent的王者,豆包手机助手它回来了。终于,憋了很久很久很久的努比亚发布会,在下午,终于开完了。
会上,搭载豆包手机助手消费者版本的努比亚Navix Ultra正式开售。
12+512GB的配置定价5999,国补后到手5499。
16+512GB定价6499,16GB+1TB定价7499。
去年12月,豆包手机助手技术预览版发布的时候,我也第一时间做过一轮实测一手实测豆包手机助手,这就是当今手机Agent的天花板。。
虽然后面经历了一些风波,但它在当时的我看来,依然是最好的手机Agent。
九个多月过去,豆包手机助手终于走到了消费者版本。
搭载它的手机,也从之前的限量工程机努比亚M153,换成了真正面向消费者的外观更精致的量产机,努比亚NaviX Ultra。
还是跟之前一样,豆包手机助手负责里面的AI助手体验,努比亚负责硬件工程和手机本身。
这次,我也非常荣幸,在几天前,提前拿到了真机。
整体的质感终于变得非常扎实了,跟之前的工程机的质感完全不一样了。
先说手机本身。
颜色从单一白色增加到了黑、白、粉、蓝四种颜色,正面是四等边直屏,背面换成了横向三摄模组,我们拿到的就是黑色款。
机身厚度7.62mm,电池容量增加到了7100mAh,全系512GB起步,主摄也翻了4倍,拉到了2亿像素。
简单来说,硬件层面,这次至少在外观、续航和影像上,都全面升级了。
除了外观变得更好看了,我觉得在硬件层面上,最特别的,还是侧边那颗非常显眼的橙色AI按键。
我觉得消费者版最值得聊的,还真就得从这颗按键说起。
1. AI键有指纹鉴权了
AI键本身已经不稀奇了,现在很多手机都有一个专门唤醒AI的入口。
这颗按键的基本操作和上一代一样,按一下调出功能栏。
长按可以直接提问,连按两下还能进入豆包实时视频通话。
但消费者版,有一个最重要的改变,就是这个AI键上,第一次加上了指纹鉴权。
我专门在锁屏状态下,让其他人拿起这台手机试了试。
他们直接按AI键吊起豆包手机助手,直接去问天气,或者一些普通问题,都可以正常回答,没有问题。
但是他们,一旦去问跟我有关的我的私人信息,或者是要操作我的手机去做点什么事情,它就会进行指纹鉴权,来判断操作手机的人是不是我。
如果是已经录入的指纹的话,它会显示已通过系统鉴别,在指纹验证的同时,豆包助手也唤醒了,不需要你先解锁手机再叫豆包。
这个时候,所有的关于我自己的一些内容,或者去操作,都可以正常的去使用。
但是如果指纹不对,他发现用手机的人不是我,它就会弹密码解锁,或者屏下指纹解锁等等你设置的手机解锁方式。
如果用户无法正确解锁的话,它就会取消任务,拒绝对话。
除了这个AI键,和上一代一样,它也支持语音唤醒。
这些就是我觉得一台Agent手机在保护用户隐私和安全的道路上,迈出的非常有用且坚实的一步。
并且这次还增加了连续对话,打开以后,唤醒一次就能接着聊,不用每问一句都重新叫它。
有了这两种方式,我在实测的过程中,再也没有去手机上手动打开豆包App了。
但是还是上面我说的,Agent用着越方便,那这个AI键的身份验证,就太太太太重要了。
2. 复杂长程任务上的能力提升
说完了AI键,这次豆包手机在复杂长程任务上的能力也提升了。
比如,我自己在内部最喜欢用手机Agent干的活,让他跑了一遍我们公司的飞书报销。
因为我们飞书报销的流程还是挺复杂的。
得去知道这个发票开销属于哪一类,再打开报销单模板,把内容和金额填进对应的表格,填完以后,还要保存表格和发票,进入飞书审批,把信息、表格和发票等等一起传上去,最后提交。
更别提未来更复杂的那种,我需要把邮件里面或者是手机各种App的发票先开出来,再全部从邮箱里面收集,再去报销,报销真的是我一生之敌。。。
不过就单纯的发票报销这件事,它还真的一次性跑完了,给大家看看10倍速的完整过程。
和我上次测试预览版时感受到的能力相比,消费者版本这次确实能把更长更复杂的流程跑完。
而且它在后台干活的时候,你还可以继续干别的。
而且这次还增加了任务排队和插队。
所以它干活的时候,你也可以接着发新任务。
新的任务可以选择排队,也可以选择立刻插队。
这就方便多了。
你可以一口气把所有活都派完,如果你手上突然来一个什么急活,也能够及时地插队去处理。
不过,插队这里有个不方便的地方是,一旦选择插队,前一个任务就会被终止,后面没法重新接着刚才的进度干。
所以遇到报销这种流程比较长的活,不着急的情况下不建议选择立刻插队。
3. 记忆和快捷指令
长流程能跑通以后,还有个很实际的问题。
有些重复要做的事,还有我们的偏好,如果每次都要和AI从头说一遍,那也太呆了,这个其实就是记忆的问题了。。
因为预览版出的比较早,所以记忆这个点,在真正去操作手机的时候,干的没有那么好。
不过消费者版本也通过记忆功能的大幅度升级和快捷指令,已经在很大的程度上解决了。
先说记忆。
你可以让它记住所有跟你生活相关的信息,比如你外卖打车的常用地址、口味、习惯和其他所有希望被记住的信息。
你可以直接给他说,比如记一下“我喜欢跟坤坤联名的所有产品”之类的,它就会记住。
比如还有,我跟它说,记一下,我不喜欢Anthropic这家公司,这个公司就是个大XX。
它就会把这条放进了个人信息,还给分到了科技爱好下面。
你也可以是在浏览某一个页面的时候,直接三指上滑,它也能存进记忆里面。
记忆里面存的信息,在后续让它执行任务的时候都是可以调用的。
举个例子,我定期会往家里买点猫粮,但其实每次买的都是那一款。
这种重复的事就可以让它给我干,我就只需要摁住AI键说一句,去抖音商城里面买一袋我经常买的猫粮送到我家。
它就可以自己去抖音上看我经常买哪一款下的哪一个规格。我默认地址其实是公司,它也会自动换到我家去,一路操作到支付页面。
我确认付款就完了,非常省事。
另一个让我很惊喜的功能,是把跑通的操作保存成快捷指令。
我们视频组的同事,平常会在即梦里大量去生成视频、测试看到的各种各样的提示词。
遇到喜欢的素材,会把视频和提示词一起存进公司的AI生成素材库,同时发给同事一起共享。
这个过程,他们也拿这台手机给实现了。
就比如说,他们平常零碎时间刷手机刷到喜欢的AI视频,不用跳转,直接摁住AI键口喷需求。
然后豆包手机助手就能复制视频的生成提示词,把视频下载到本地。接着打开飞书,找到AI生成素材库这张多维表格,填上内容名、内容类型、提示词等等巴拉巴拉,再上传视频。
一阵操作之后,它又去飞书里找到相应的同事,把视频和提示词发过去,告诉对方已经入库。
整个过程它实现的还是蛮丝滑的,中途只需要在他填完表格内容后,进行一个确认提交,其他的全都交给他就行了。
从提示词的长度,你应该也能发现,这个过程要表述清楚其实挺长的,说出来真的很费嗓子。
所以消费者版也新增了一个快捷指令。
任务完成后,对于可以复用的流程,豆包会提供保存成快捷指令的入口。
点进去,可以设置简短指令,比如设置成:提示词入库。
下一次直接说这个简短指令,它就能够复刻整个流程,非常省事。
4. 理解屏幕内容并干活
还有过去的一种操作,也很麻烦。
就是很多时候信息已经在屏幕上了,但是我们要让AI干活,每次还要截个图,然后再唤醒,再把这个截图扔到这个AI里面。。
那消费者版也终于把这个问题也解决了。
比如,因为我们中秋和国庆中间三天也都是线上办公,大家基本约等于有十几天的连续假期,所以他们就又约着一起要去成都玩的,有个J人就在疯狂写攻略文档中。。。
但网上的攻略总是零零散散的,你可能在一条帖子里面被安利了一家店,又在另一条帖子里面被安利了一个景点。
所以搞起来,太慢了,她们也吐槽说,收藏了一堆,逐个整理起来无敌麻烦。
但其实用这台手机的话,完全可以刷攻略的时候,看到啥喜欢的直接让豆包去给你改文档就行了。
随便拿个店铺举例,可以直接就着当前页面,让豆包搜索相关攻略,编辑攻略文档相应的部分。然后再通过飞书分享给同行的人。
5. 豆包手机助手更加深入系统
除了上面这些,相机、录音等等这些系统应用里,这次也接进了更多AI能力。
这里的点就比较碎了,但其实都是我们平常用手机都会高频用上的。
先说我们每个人每天可能都要做的,拍照。
相机里直接内置了AI改图功能。
你可以一句话给手办换一套装扮。
还有机位辅拍也挺有意思。
拍摄的时候点一下左下角的小魔法棒,画面里会出现构图提示和焦点指引。两个点重合以后,相机会自动调整焦段并完成拍摄。
可以看看最后拍出来的,照着他的指引拍出来,构图确实比一开始的画面方正的多。
消费者版这次系统录音和打电话都接入了飞书妙记,可以完成转录、说话人区分、总结和信息调取。
开会的时候打开录音,妙记生成后,直接让它像前面的例子一样去飞书上建日程或者任务,或者是约其他会议,都是一句话的事了。
比如我之前在公司做了一场Q3公司战略分享会。
直接打开手机录音,录完后就会生成飞书妙记。
那会后,如果想总结一下具体的Q3职责,给到相应的同事,也是给他说就行了。
最后,这里叠个甲,因为我们拿到的是测试机,版本也比较新,所以上述所有case,可能在未来大家拿到的时候,跟视频有点不太一样,到时候大家以实际到手版本为主,也可以关注一下系统升级。
从去年12月到现在,九个多月过去了。
预览版带着些莽撞的把手机Agent的潜力展示给大家看。
在它的基础上,消费者版做的,更多是把用户习惯、产品体验给完善了。
到现在,才真正开始可以说是面向每一个人的手机。
这大概就是消费者版本这几个字,真正的意义。
当然,它现在还有一些限制。
一个是目前手机操作做任务的免费额度是有限的。并不是买了手机豆包助手就能随便爽用了。
二是生态限制,目前操作手机的功能主要还是支持系统及中兴应用、字节系应用和部分已接入的第三方应用。
不过这次,豆包手机助手推出了SAEP屏幕自动化操作声明协议,还开启了30天规则公示。
简单来说,就是第三方App可以自己选择是否允许豆包助手在应用内进行GUI操作。
可以接受,也可以拒绝。
这个就很有意思了,我还非常期待,想看到有多少的应用愿意接入它们。
可以说,这就是新时代与旧时代的过渡。
剩下的,就看这个时代。
到底会不会。
配得上我们所期待的那个盛夏了。
Weekly丨美国银行正在上链MiM 周报 9/7 – 9/13, 2026
跨境支付|US Bank 用自家稳定币 USBDC 在 Stellar 上跑通北美与欧洲间的转账。21 家银行的合资公司还在筹备,第一家大行已经先出了流水。同周 Nubank 在迈阿密宣布美国开业,一周前 Revolut 刚拿到 OCC 有条件预批。美国的银行往链上走,海外的银行却往美国走。
链上金融|加密永续市场给尚未公开递交 S-1 的 Anthropic 标出 $2.12 万亿,是 5 月私募估值的两倍多。IPO 未至,定价先行。Robinhood Chain 代币化股票 AUM 达到 Base 的七倍,但增长最快的是 189 个股票篮子 meme 代币。BTC 周中跌破 $77,000,BTC ETF 四连流出,ETH ETF 却单日吸金 $2.16 亿。
Agentic Economy|Meta 发布连着用户支付方式的消费级 agent Muse,Mastercard 上线 Agent Connect,蚂蚁国际与 Mastercard、Visa 打通三套 agent 身份协议。入口、商户、护照同周就位。印度 NPCI 给 agent 发了 UPI 额度,GFF 上却禁谈稳定币。
投融资|本周 fintech 融资 $45 亿、18 笔,Mistral €30 亿 Series D 独占三分之二。
下周开奖|CLARITY 9/15 表决,Arc 主网 9/16 上线。
美国的银行往链上搬家,世界的银行往美国搬家。撰文:Techub News 整理 导语 2025 年 9 月,谷歌 DeepMind 的联合创始人兼 CEO 德米斯·哈萨比斯(Demis Hassabis)做客知名科技播客 All-In Podcast,进行了一场信息量极大的深度对话。作为 AlphaGo、AlphaFold 等里程碑式 AI 项目的核心推动者,以及 2023 年诺贝尔化学奖的共同得主,哈萨比斯一直是全球人工智能领域的灯塔人物。此次对话中,他不仅分享了获得诺奖的幕后故事,更系统地阐述了谷歌 DeepMind 的最新进展、对 AGI(通用人工智能)路径的思考,以及 AI 如何重塑科学、娱乐乃至人类社会的基础架构。在 AGI 浪潮席卷全球、科技巨头激烈角逐的背景下,哈萨比斯的见解无疑具有极高的参考价值。 摘要 世界模型是通往 AGI 的关键一步:Genie 等模型通过海量视频学习“直观物理”,无需预设物理引擎即可生成动态交互世界,这对机器人技术、智能眼镜助手至关重要。 AGI 可能还需 5-10 年:哈萨比斯认为当前 AI 尚缺乏真正的创造力、持续学习和一致性推理能力,需一两个关键突破才能达到真正的通用智能。 AI 将开启“科学新文艺复兴”:从药物发现(Isomorphic Labs)到材料设计、聚变控制,AI 将成为终极科学工具,其长远贡献将远超其当下的能耗。 人形机器人有独特价值:对于需要融入人类环境(家庭、办公室)的通用机器人,人形形态可能比专用形态更具实用性和适配性。 AI 赋能创作的两面性:既极大降低了普通人创作的门槛,也超级赋能顶级专业人士,催生“共同创造”的新娱乐形态。 从 AlphaFold 到诺奖:AI 驱动科学的起点 访谈从哈萨比斯获得诺贝尔化学奖的非凡经历开始。他描述接到来自瑞典的电话时“恍如隔世”,那是每个科学家梦寐以求的时刻。在斯德哥尔摩的颁奖周,最令他震撼的是在一本保存了120年的诺奖得主签名簿上,将自己的名字签在费曼、居里夫人、爱因斯坦、尼尔斯·玻尔等伟人之旁。哈萨比斯坦言,尽管有关于 AlphaFold 可能获奖的传言,但诺奖委员会对保密工作的极致要求,以及奖项更看重科学突破的实际影响力(这往往需要二三十年的沉淀),使得一切直到电话响起前都是未知数。AlphaFold 破解蛋白质结构预测难题,正是哈萨比斯从童年起就怀有的梦想——利用 AI 加速科学发现的完美例证。这枚诺奖奖章,不仅是对他个人和团队的认可,更是标志着 AI 正式成为基础科学发现的核心引擎。 谈及谷歌 DeepMind 在 Alphabet 中的定位,哈萨比斯将其比喻为“整个谷歌和 Alphabet 的引擎室”。自几年前谷歌内部所有 AI 力量(包括原 DeepMind)合并为 Google DeepMind 以来,团队规模已达约 5000 人,其中超过 80% 是工程师和博士研究员。Gemini 是他们构建的核心模型,此外还包括视频模型、交互式世界模型等多种 AI 系统。这些模型已经深度集成到谷歌几乎所有的产品和服务中,从 AI Overview、AI 模式到 Gemini 应用,每天有数十亿用户在与他们的 AI 技术互动。这种“前沿研究”与“数十亿规模落地”的结合,构成了谷歌 DeepMind 独特的优势。 Genie 与世界模型:让 AI 理解物理世界 对话的核心很快转向了谷歌 DeepMind 最新发布的一类革命性模型——“世界模型”,其代表便是 Genie。哈萨比斯现场展示了一段 Genie 生成的视频:用户仅通过一个文本提示(如“在鸡套装里的人”或“喷气式滑艇”),就能生成一个完全交互式的 3D 环境。用户可以使用方向键和空格键实时控制视角,探索这个世界。关键之处在于,所有像素都是实时生成,不存在于任何预设的视频或游戏中。当角色转头看向一个方向,那一侧的景物才被即时创造出来,并且保持物理一致性(例如之前墙上的涂鸦会保留)。 哈萨比斯解释道,Genie 模型通过观看互联网上数百万计的 YouTube 等视频,反向工程了“直观物理”。它并非基于传统的 3D 渲染引擎(如 Unity 或 Unreal),也没有被预先编程物理定律。相反,它纯粹从 2D 图像序列中学会了世界如何运作的复杂规律,包括光影反射、材质流动和物体行为。作为一名在 90 年代曾亲手编写游戏引擎和物理系统的前游戏开发者,哈萨比斯对 Genie 能如此“轻而易举”地完成这一切感到“极其震撼”。 为什么世界模型如此重要?哈萨比斯指出,要构建真正的 AGI,系统必须理解我们周围的物理世界,而不仅仅是抽象的语言或数学世界。这对于机器人技术、智能眼镜助手等应用至关重要。一个能帮助日常生活的智能眼镜助手,必须理解使用者所处的物理环境及其背后的物理规律。世界模型的突破,正是为 AI 系统装上了理解物理世界的“感官”和“常识”。他预测,随着 Genie 这类模型的进化(Gen 4, Gen 5…),它们将越来越逼近对现实世界的深刻模拟。 机器人、AGI 时间线与缺失的拼图 世界模型的自然延伸便是机器人技术。哈萨比斯介绍了他们基于 Gemini 微调而来的“Gemini 机器人模型”。在演示中,一个拥有两只机械臂的桌面机器人,能够理解“把黄色物体放进红色桶里”这样的自然语言指令,并将其转化为精准的动作序列。这体现了多模态模型的威力——它能将真实世界的理解融入与机器人的交互中,而不仅仅是依赖机器人专用的、狭窄的模型。 对于机器人的形态,哈萨比斯的观点发生了变化。他过去认为特定任务应有专用形态的机器人,但现在认为,人形机器人对于需要在人类设计的环境中工作的通用机器人具有重要意义。台阶、门把手、工具——我们的物理世界是为人类身体设计的。与其改变整个世界的设计,不如让机器人适应我们已有的环境。当然,在工业生产线或实验室等特定场景,专用形态的机器人仍是最优解。 关于 AGI(通用人工智能)的到来时间,哈萨比斯给出了相对审慎的估计。他认为当前顶尖的 AI 模型(包括他自己公司的)远非“博士级智能体”。它们在某些任务上表现出博士生水平的能力,但缺乏通用性和一致性,例如可能在高中学的数学或简单计数上犯低级错误。真正的 AGI 应该能全面达到高水平表现。 在他看来,通往 AGI 还缺少几个核心拼图:一是真正的创造力,即像爱因斯坦提出狭义相对论那样,从已知知识中进行“直觉飞跃”,提出全新的猜想或理论;二是持续学习能力,能够在线学习新知识并调整行为;三是更强的推理和一致性。哈萨比斯预测,可能还需要“一两个关键性突破”,时间尺度大约在5到10年。这与行业某些更为激进的预测(如几年内)形成了对比。 科学革命与能源挑战:AI 的长期回报 作为科学家,哈萨比斯始终坚信 AI 最崇高的使命是加速科学发现,应对人类面临的重大挑战。除了 AlphaFold,谷歌 DeepMind 的 AI 系统已应用于材料设计、聚变反应堆等离子体控制、天气预报、解决奥林匹克数学竞赛级别难题等多个科学分支。他领导的 Isomorphic Labs(从 DeepMind 分拆)正致力于基于 AlphaFold 的突破,彻底改革药物发现流程,目标是将耗时数年甚至十年的新药研发周期缩短至几周甚至几天。目前他们已与礼来、诺华等制药巨头合作,并预计明年将有候选药物进入临床前阶段。 针对当前热议的 AI 能耗问题,哈萨比斯认为存在“两个真相”。一方面,谷歌 DeepMind 自身因为需要每天为数亿用户高效提供 AI 服务(如 AI 概述),在模型效率优化上投入巨大,通过蒸馏等技术,过去两年相同性能下的模型效率提升了10倍甚至100倍。但另一方面,为了向 AGI 前沿推进,研究团队仍需不断用更大规模的数据和算力训练新的模型,这会推动总需求上升。他乐观地认为,从长远来看,AI 在优化电网、设计新材料和新能源、应对气候变化等方面的贡献,将远超其自身运行所消耗的能源。AI 是解决问题的手段,而不仅仅是问题的来源。 创作民主化与未来娱乐形态 除了硬核科技,哈萨比斯也展望了 AI 对文化和娱乐的冲击。像 Imagen、Veo 这样的顶级视频生成模型,以及“Nano Banana”这类拥有出色指令跟随一致性的图像生成工具,正在带来“创作民主化”。普通人无需再像过去那样啃读厚厚的 Photoshop 教程,只需用语言描述想法,就能进行创作。 但同时,AI 也在“超级赋能”顶级专业人士。哈萨比斯提到他们正与著名导演达伦·阿伦诺夫斯基等顶尖创作者合作。这些工具让专业创意人士能够以前所未有的速度尝试各种构思,生产力提升十倍甚至百倍,最终更快地实现他们脑海中最完美的愿景。他预见未来将出现一种融合了“共同创造”元素的新娱乐形式或艺术类型:顶级创意愿景家构建引人入胜的动态故事世界,而成千上万的用户可以在其中共同创造部分内容,主创者则扮演这个世界的“总编辑”。 未来十年:一个“科学新文艺复兴” 当被问及对未来十年的展望时,哈萨比斯承认在 AI 领域预测十周都充满挑战,更不用说十年。但他坚信,如果未来十年内我们能实现真正的 AGI,那将开启一个“科学的新文艺复兴”或“黄金时代”。从能源到人类健康,社会的方方面面都将受益于这个终极科学工具带来的突破。这不仅仅是一次技术升级,而是一场深刻重塑人类文明认知边界和能力极限的革命。德米斯·哈萨比斯和他领导的谷歌 DeepMind,正站在这场革命的最前沿。
