Cohere CEO Aidan Gomez(艾丹·戈麦斯):Transformer 架构八年未变,AI 的未来在于企业应用撰文:Techub News 整理
导语
2017年,一篇名为《Attention is All You Need》的论文横空出世,其提出的 Transformer 架构彻底改变了人工智能的发展轨迹,开启了生成式 AI 的浪潮。八年后的2025 年 6 月,这篇论文的八位作者之一、当时还是一名大三本科生的 Aidan Gomez(艾丹·戈麦斯)已成长为估值数十亿美元的 AI 独角兽 Cohere 的 CEO。在 The MAD Podcast 主持人 Matt Turck 的深度访谈中,Gomez 首次详细揭秘了 Transformer 论文诞生背后的“意外”故事,并阐述了他为何坚信企业级 AI 而非追逐 AGI(通用人工智能)才是 AI 技术造福世界的正道。这场对话不仅是对 AI 发展史上关键节点的回顾,更是对当下 AI 商业化路径与未来趋势的一次深刻洞察。
摘要
Transformer 的诞生源于“行政错误”与有机合作:Gomez 进入 Google Brain 实习源于一场误会(其经理误以为他是博士生),而论文的诞生则是几个独立研究小组因共同兴趣自发合并、冲刺会议 deadline 的结果。
Transformer 架构统治力惊人,八年未遇挑战:Gomez 坦言,Transformer 的持久性“令人震惊”,其成功部分源于整个 AI 基础设施(包括芯片)都已围绕其优化,新架构的替代门槛极高。
“推理计算”是重大突破,但潜力远未挖尽:让模型在不同问题上分配不同“思考”时间的“推理计算”范式解锁了巨大能力,且实现成本远低于预训练,未来将在科学、医疗、企业自动化等领域发挥更大作用。
Cohere 押注企业 AI 而非 AGI“宗教”:Gomez 直言不喜欢 AGI 圈子的“角色扮演”和“新宗教”氛围,认为通过 AI 提升人类生产力、降低成本和改善服务(如医疗)才是更有意义的方向。
智能体(Agent)平台“North”是企业 AI 的核心:Cohere 的垂直整合战略使其能提供从底层模型(Command、Embed)到上层智能体平台(North)的全栈解决方案,并特别注重数据安全(支持本地/私有云部署)和多语言/多模态能力。
Transformer 诞生记:一场美丽的“意外”
2017年,还在多伦多大学读大三的 Aidan Gomez(艾丹·戈麦斯)通过一封“cold email”联系上了 Google Brain 的研究员,原因是他反复在阅读的论文作者栏看到这个名字。他提出了自己对论文的一些扩展想法,并由此获得了一个实习机会。“我经理以为我是博士生,”Gomez 回忆道,“所以我想我是通过一个行政错误进去的——我们通常不招本科生。”这个“错误”让他坐到了另一位论文合著者 Noam Shazeer 旁边,并加入了 Lucas Kaiser 的团队。
最初的项目是一个名为“One Model To Learn Them All”的多模态模型。在开发过程中,Gomez 和 Kaiser 构建了一个名为“Tensor2Tensor”的框架用于高效分布式训练,并成功说服了邻座的 Noam Shazeer 使用它。随后,他们发现 Google Translate 团队也在进行类似的研究。“我们意识到大家在做同一件事,”Gomez 说,“我们都关注基于文本的自回归模型,并且更纯粹地利用注意力机制,而不是之前那些复杂且有些‘丑陋’的 RNN、LSTM 模型。”于是,几个小组决定合并力量,专注于打造一个最简单、高效的基于注意力的语言模型——这就是 Transformer 的雏形。
论文的写作过程堪称“疯狂冲刺”。团队为了赶上顶级 AI 会议 NeurIPS 的投稿截止日期,进行了高强度的工作。“我们尝试了无数东西,修补了很多小 bug,”Gomez 举例道,比如最初纯注意力架构无法区分序列中元素的位置信息,是 Noam Shazeer 灵光一现,提出了在嵌入中添加正弦波来表示位置的方法——这个方案至今仍被广泛使用。
论文发表后,在自然语言处理(NLP)和机器翻译的小圈子内引起了兴奋,但当时远未达到后来革命性的广泛认知。对于 Google 为何没有更快地利用 Transformer 架构开发出类似 ChatGPT 的产品,Gomez 澄清道,Google 实际上迅速将 Transformer 应用到了搜索和翻译等核心产品中(如 BERT)。“准确的说法是,他们没有像 OpenAI 那样早期且独特地全力投入互联网文本的纯序列建模(即大规模语言模型预训练)。” Gomez 总结道。
Transformer 为何统治八年?生态锁定与极高的替代门槛
距离论文发表已过去八年,Transformer 架构依然是 AI 领域的绝对主流,这一点连 Gomez 本人都感到“震惊”。“我们今天训练的 Transformer 和当年的看起来如此相似,”他说。他认为,这并非因为研究社区缺乏新想法,而是一个“自我实现的预言”或“强化循环”。
整个 AI 社区对 Transformer 的热情催生了专门为其优化的庞大基础设施堆栈。“我们现在甚至有专门为该架构优化的芯片,”Gomez 指出。因此,要转向一种新架构,需要付出巨大的努力和能量去重写一切。“新架构必须提供极其令人信服的理由(才能取代它),而我们还没找到那个架构。”他坦言,替代的门槛已被推得极高。
Gomez 本人也曾热切期待 Transformer 的继任者。他甚至将 Cohere 纽约办公室的一间会议室命名为“SSM”(状态空间模型),坚信它将是替代者。但现实是,Transformer 就像一个“伟大的艺术家”,不断吸收其他架构(如 SSM、扩散模型)中的优秀思想,并将其整合进自身,从而持续进化,保持了领先地位。
推理计算:一个“显而易见”却改变游戏规则的想法
近半年来,“推理计算”(Test-Time Compute)或“思维链”推理成为 AI 领域的热点。但在 Gomez 看来,这其实是一个酝酿已久且“显而易见”的方向。“我们已经知道它要来好几年了,”他说。
其逻辑在于:在引入推理能力之前,语言模型对所有输入(无论是“1+1”还是“治愈癌症”)都分配相同的“能量”和即时响应时间。这显然不合理。不同复杂程度的问题理应获得不同的“思考”资源。推理计算正是让模型能够根据问题复杂度,动态分配计算步骤(“思考时间”)的范式。
“它的有效性令人惊讶,”Gomez 评价道。模型仅需极少量的人类示范(如何一步步思考),就能自己掌握推理方法,从而解锁了前所未有的能力。更关键的是,实现推理能力的成本“远低于预训练”,使得智能提升变得“非常容易获得”。
然而,Gomez 认为这仅仅是开始。“我们只是触及了表面。”目前的研究主要集中在数学和编程领域,但在医学、物理、化学等纯科学领域,以及企业自动化场景中,还有巨大的空白等待探索。“所有有趣的问题都需要推理。”
从研究到创业:为何 Cohere 选择“枯燥”但重要的企业 AI
在目睹了早期大规模语言模型展现出的惊人能力后,Gomez 联系了他在 Google Brain 结识的两位朋友 Nick 和 Ivan,共同创立了 Cohere。与许多同期涌现的、目标直指 AGI 的明星实验室不同,Cohere 很早就确立了企业 AI 的方向。
“我从来不喜欢整个 AGI、有效利他主义圈子的氛围,”Gomez 直言不讳,“感觉像在角色扮演,像人们在创立一种新宗教……‘创造上帝’这类东西。我不喜欢那种精神气质。”相比之下,企业级应用或许听起来“枯燥”,但他认为其意义远为重大。
“提升人类生产力,让人类能做更多事,增加供给,降低事物成本,让人类成就更多——这些远比‘建造上帝’或‘从 AI 手中拯救世界’更激励我。我想用 AI 来拯救世界。” Gomez 阐述了他的理念。他希望通过 AI 让医生花更少时间写病历、填表格,而将更多时间用于诊治病人;为医生配备能帮助他们研究罕见病例的智能体。他的目标是让这项技术在全球经济中真正发挥作用。
当然,作为行业领军者,他无法完全避开关于 AGI/ASI(人工超级智能)的讨论。但他认为,AGI 的定义模糊且不断变化。“我认为我们在很大程度上已经拥有了 AGI。”他举例说,如果在他和 Cohere 的模型之间选择谁来诊断开药,理性的选择肯定是模型。“我保证它懂得比我多。”AI 已经在许多方面比普通人更聪明,并且未来在某些领域超越最顶尖的人类专家也是必然趋势。“我反对那些贩卖末日论调的人,”Gomez 总结道,“技术进步意味着什么?其切实的影响才是关键。”
Cohere 的全栈蓝图:模型、智能体与安全优先
Cohere 采取了一条垂直整合的道路。其核心是自研的模型层:包括生成模型 Command(对标 GPT、Llama 等)和搜索模型系列(Embed V4, Rerank 3.5)。这些模型构成了其智能体平台“North”的基石。North 允许企业构建能接入内部所有软件和数据的 AI 智能体,让其去完成具体任务。
Gomez 特别强调了 Cohere 在安全部署上的独特优势。与许多提供 API 调用服务的竞争对手不同,Cohere 可以将其模型直接部署在客户的硬件上,无论是在客户的云虚拟私有云(VPC)中,还是为受监管行业部署在本地数据中心。“这带来了巨大的解锁效应,”Gomez 解释,因为 AI 智能体需要访问企业的核心数据(邮件、文档、客户记录等),数据不出境、完全私有的部署模式让客户更放心地接入更多关键系统,从而发挥 AI 的最大价值。
在模型训练数据方面,Gomez 证实了合成数据已成为主流且效果卓越。“合成数据现在是我们训练 Command 等模型所用数据的主要部分,而且在许多情况下,它实际上比人类数据更有用。”他举例说,人类回答问题时往往简洁(如直接回答“11”),但人类实际上更喜欢模型那种充满同理心、耐心细致的回答风格。因此,他们需要用模型来重写人类答案,以生成风格更优的训练数据。
此外,Cohere 在多语言和多模态上也投入颇深。其 Cohere For AI 实验室发布了支持超百种语言的模型。Gomez 指出,日语、韩语等市场被严重低估,现有技术无法满足其企业级文档处理需求。因此,Cohere 选择与富士通(日本)、LGCNS(韩国)等地区巨头合作,开发针对当地语言和企业场景的定制模型。多模态能力也被视为企业场景的“入场券”,对于理解包含图表、幻灯片的 PDF 文档以及实现计算机视觉操控(让 AI 使用图形界面)至关重要。
智能体(Agent)的现在与未来:从研究到落地
Cohere 的智能体平台 North 目前处于早期访问阶段。Gomez 将其描述为一个“完全私有化、高度可定制、原生支持推理的消费级聊天机器人升级版”。它可以集成企业内部的任何软件,并花时间(几分钟甚至几十分钟)进行深度研究、筛选数据以完成任务。
他分享了一个生动的用例:财富管理。当突发事件(如战争、新关税)爆发时,理财经理的客户会纷纷来电询问对策。经理通常需要花费数周时间研究并制定对冲组合方案,但市场瞬息万变,等方案出炉可能已错过时机。North 这样的智能体可以极快地阅读海量分析报告和新闻,迅速提出初步方案,人类经理在此基础上进行修改和决策,将周期从数周缩短到数小时。
面对智能体能力泛化可能带来的“选择困难症”,Gomez 观察到市场已经发生了变化。“早期客户会问‘AI 很酷,董事会给我压力,我该用它做什么?’我们需要帮他们识别机会。但现在,客户的成熟度大大提高了。他们很清楚自己要做什么,只需要一个合作伙伴来帮他们执行这个路线图。”许多大企业会带着数百个已识别的用例来找 Cohere。
当然,智能体并非万能。Gomez 指出,在医疗、金融等敏感领域,必须保持“人在回路”的监督。此外,在需要真正突破性科学发现(如解决千年数学难题、发现新化合物)的领域,AI 目前还无法提供核心帮助,但他相信这一天很快就会到来。
CEO 的展望:技术乐观主义与社会关切
当被问及什么让他夜不能寐时,Gomez 的答案出人意料地并非技术挑战。“让我睡不着的是政治,”他说,“是世界各地出现的分裂……我主要担心我们的社会、自由民主制度。我为自由主义过去一个世纪取得的进步感到担忧。”
但他对 AI 持乐观态度,认为 AI 可以成为一股强大的向善力量,帮助“好人”获胜,并解决过去十五年来全球经济面临的一些问题,如生产力增长缓慢、财富分配不均等。
对于 Cohere 未来三到五年的成功愿景,Gomez 希望看到 AI 技术带来可衡量的 GDP 和生产力增长,希望这项技术能在全球范围内整合,成为每个人日常工作的一部分,而不仅仅是娱乐或搜索工具。“我希望它能帮助人们成就更多,让东西变得更便宜、更丰富。”这或许正是这位从一场“意外”中走出的 AI 先驱,为其所创造的技术所描绘的最朴实也最宏大的蓝图。
Cohere CEO Aidan Gomez(艾丹·戈麦斯):企业 AI 的规模化边界、合成数据与后 Transformer 时代撰文:Techub News 整理
导语
2025 年 4 月,Transformer 架构论文的八位作者之一、知名 AI 公司 Cohere 的联合创始人兼 CEO Aidan Gomez(艾丹·戈麦斯)做客由 Redpoint Ventures 制作的播客节目《Unsupervised Learning》。在这场长达 51 分钟的深度对话中,Gomez 以其独特的双重身份——既是奠定当前 AI 浪潮基础的关键研究者,又是领导一家估值数十亿美元 AI 公司的掌舵人——分享了关于企业 AI 落地、模型能力边界、数据策略以及未来 AI 架构演变的深刻见解。在当前 AI 从狂热探索转向务实落地的关键节点,Gomez 的思考为行业提供了宝贵的路线图。
摘要
企业 AI 成功的关键在于“中间路线”:既非纯咨询,也非纯标准化产品,而是需要深度支持与定制化集成,尤其要解决数据隐私和跨软件访问的复杂性问题。
规模化定律正在失效:单纯堆砌算力和资本的“暴力美学”已进入回报递减阶段,未来的模型进步需要更聪明、更具创造性的算法和数据策略。
合成数据成为主力,但人类评估仍是黄金标准:在模型训练中,合成数据已占主导,能极大降低成本;然而在评估模型输出的有效性和安全性时,人类专家仍不可或缺。
推理能力是当前最大突破:具备“测试时计算”(test-time compute)或“思维链”能力的模型,在处理此前无法解决的复杂业务流程自动化任务上,实现了从“几乎总失败”到“几乎总成功”的质变。
Transformer 架构终将被超越:尽管 Transformer 展现了惊人的生命力,但作为其共同创造者的 Gomez 热切期待在 5-10 年内出现新的、更优越的 AI 基础架构。
企业 AI 的落地模型:定制化集成是胜负手
面对企业如何部署生成式 AI 的多种模式——从纯咨询服务、自带工程团队的产品化方案,到开箱即用的标准化产品——Aidan Gomez(艾丹·戈麦斯)认为,长期来看,“中间路线”将会胜出。AI 是一项复杂的新技术,企业往往需要帮助才能将其整合到现有经济体系和五花八门的软件生态中。
Gomez 指出,AI 智能体要实现有效的自动化,必须拥有与人类员工同等级别的信息访问权限。这意味着它需要接入企业的电子邮件、聊天记录、通话、CRM、ERP、HR 软件等几乎所有系统,以获取足够的上下文。这带来了两大挑战:首先是前所未有的隐私问题,很少有软件需要如此广泛的数据访问权限,因此隐私在 AI 领域比其他企业软件更为关键;其次是极高的定制化需求,每家公司的软件“马赛克”都独一无二,没有标准配置,因此需要大量定制化工作来整合所有上下文并接入模型。
这正是 Cohere 在其新的智能体平台“North”上投入巨资的方向:让平台更容易根据每家公司的特定软件图谱进行定制和集成。Gomez 坦言,实现完全自助、无需人工干预的安装和配置目前仍是“幻想”,未来更可能是一种“中间状态”——自动化解决部分问题,但鉴于访问薪资数据、客户数据或患者数据等敏感信息的风险极高,相当多的安全护栏(guardrails)和人工监督仍是必要的。
产品市场契合点:从客户支持到深度研究
凭借与众多企业合作的独特视角,Gomez 分享了当前他认为已具备明确产品市场契合度(PMF)的 AI 用例。
客户支持是技术已准备就绪、需求极为明确的领域,正在电信、医疗、金融服务等各个垂直行业快速铺开。另一个难以归类但需求旺盛的领域是研究增强——用 AI 智能体辅助人类,将需要一个月的研究工作在短短一两个小时内完成。他举了一个生动的例子:银行的财富经理接到客户要求对冲某个未来地缘政治事件的请求,传统上需要耗时数日进行紧急研究。而现在,能够阅读海量资料并生成带有引用来源的详实报告的 AI 模型,可以将这类知识工作的效率提升十倍。
展望未来 12 个月,Gomez 预测,随着像 North 这样的自动化基础设施在企业中部署到位,更多“平凡的”后台办公室工作将开始上线,例如财务、法务领域的流程自动化。此外,销售也是一个成熟的领域。销售人员在会见客户前需要进行的内部和外部研究(公司战略、关键联系人、历史沟通记录等),完全可以由 AI 智能体高效完成,生成一份全面的情报简报,从而极大提升销售效率。
关于企业是选择多个“最佳单项”解决方案,还是一个统一的平台,Gomez 认为会经历一个从分散到整合的过程。初期各部门可能采购各自的应用,但很快他们会发现,销售智能体不能只接入 CRM,财务智能体也不能只接入 ERP,它们都需要连接公司内所有其他信息源。维护这些分散应用与所有数据源的连接将带来巨大的负担,因此最终会强烈倾向于整合到一个统一的、能接入一切、并实现所有自动化目标的平台。这也正是 Cohere 通过 North 平台所布局的“长线游戏”。
模型战略:垂直整合与专业化之路
在“一个模型统治一切”还是“多个专业模型并存”的辩论中,Gomez 的观点经历了演变。他最初更倾向于需要专业模型,但随着模型展现出自我发展出“专家子网络”的能力,这种压力有所缓解。
然而,定制模型仍然至关重要。基于网络数据训练的通用模型,缺乏关于特定业务或领域的根本性上下文信息。网络上有大量关于人类历史、文化、科学的信息,但制造业数据、客户交易数据、详细的个人健康记录等并不在网络上。对于这些模态或数据类型,Cohere 的做法是与拥有这些数据的机构合作,创建仅供其访问的定制模型,使其在该领域变得非常出色。
尽管如此,通用模型的能力已经非常卓越,而合成数据能够显著弥合差距。因此,Gomez 认为,一个组织内部不会运行数十或数百个模型,可能只有少数几个。他并不认为每个团队都需要自己的微调模型,除非他们专注于模型从未接触过的某种新型数据。
谈到 Cohere 同时构建底层模型和上层应用(North)的垂直整合战略优势时,Gomez 强调,这让他们拥有更多杠杆来提供客户所需的体验。最新版的 Command 模型已经针对 North 平台中客户需要的用例进行了优化,例如知道如何使用 ERP、如何与 CRM 协作。这种技术与客户实际需求之间的深度整合,对于产品质量至关重要。许多现有应用未能兑现其对用户的产品承诺,部分原因就在于它们只是技术的消费者,无法为了客户需求而改变底层技术。
数据与评估:合成数据当家,人类把关仍在
在数据策略方面,Gomez 揭示了当前模型训练的前沿实践。合成数据已经占据了 Cohere 为新模型生成数据的“压倒性多数”。用 10 万名医生来教模型学医的成本高得不可行,但用 100 名医生提供高质量、可信赖的“种子”数据,然后生成上千倍的合成仿制数据,则是可行的策略。在代码、数学等可验证领域,这更容易实现,因为可以检查结果并过滤垃圾数据。在其他领域虽然更复杂,但仍然是可行的。
然而,在模型评估(Eval)环节,人类仍然是无法脱离的“黄金标准”。Gomez 明确指出,要让人类退出评估循环,除非有一个比当前模型更专业的“专家”来观察它,但这首先假设你能构建出那个“专家”。因此,在评估方面,仍然严重依赖人类。毕竟,最终使用模型的是人,他们最适合评估模型的有用性。
能力突破:推理改变游戏规则,规模化遭遇瓶颈
Gomez 兴奋地谈到,推理能力是当前一代模型最明显的突破。对于 Cohere 专注的企业场景而言,推理的意义不在于解决数学奥林匹克竞赛,而在于教会模型使用人类在业务中使用的工具,来推理并解决业务中存在的问题。
在具备推理能力之前,许多任务根本无法让模型达到足够的准确度来完成,几乎是“不可能”的,模型几乎总是失败。而有了推理能力后,模型几乎从不失败。无论是多复杂的任务,它似乎都能找到办法完成。推理能力解锁了“反思”——理解第一次尝试为何失败,并利用这个信息找到达成同一结果的其他路径。这带来了真正的解放。
同时,Gomez 明确表示,“规模即一切”的假说正在被打破。资本和算力的回报递减效应已经非常明显。行业将不得不变得更聪明、更有创造力,才能解锁技术的下一个台阶。他认为这是好事,是对创新者施加的良好压力,迫使大家去探索和尝试。旧策略(单纯砸钱堆算力)是“无聊且愚蠢的”,他更期待新时代的到来。
未来架构:Transformer 的统治终将结束
作为 Transformer 架构的共同创造者,Gomez 对此架构的持久统治感到惊讶甚至“不满”。他坦言,如果在 2018 年(Transformer 论文发表一年后)被问到,7 年后我们是否还会主要使用 Transformer,他会认为概率“接近零”。
尽管目前出现了像状态空间模型(SSM)、离散扩散模型等有潜力的新架构,但往往发现可以将它们的优点“偷”过来融入 Transformer,从而削弱了彻底更换架构的必要性。例如,离散扩散模型在用户体验上很酷(像图像扩散一样从噪声中生成文本),但它是否真的是比 Transformer 更好的语言模型?Gomez 表示怀疑。
尽管如此,他热切期望在未来的 5 到 10 年内,会出现新的、成为主流的 AI 架构。“拜托,一定要有(新架构)。”他说道。这反映了一位奠基者对技术持续进步的真诚渴望。
AI 与社会:乐观前景与务实关切
Gomez 对 AI 的未来持乐观态度,但并非乌托邦式的幻想。他认为 AI 不会导致大规模失业,因为世界面临的是供给约束而非需求约束。只要能够将人们转移到需要的岗位并进行再培训,人类的需求是无限的。AI 技术将增强人类,让他们能够产出更多世界需要的东西。
他关注的 AI 风险更侧重于中短期:担心恶意行为者(尤其是国家层面)可能获得的能力;希望自由民主国家能率先掌握并建立优势;担忧社会是否具备足够的基础设施来帮助受影响岗位的人员转型到新的、更有成就感的工作。至于“终结者”式的生存风险(x-risk),他认为目前有足够多近中期的现实问题需要关注和解决,不应让公众和政策制定者的焦点过早集中在末日场景上。
最后,Gomez 分享了他最期待的下一个模型能力突破:从经验中学习。目前,模型无法记住与用户的互动历史和学习反馈,每次对话都像是面对一个刚来的实习生。他憧憬未来模型能像真正的实习生一样,在用户的教导和反馈中成长,从不犯错到熟练,最终成为用户的“2.0 版本”。这种与系统共同成长的联系,将彻底改变人机交互的深度和价值。
Apple:2000 美元的 iPhone 改变了投资逻辑投资观点
我对 Apple Inc.(AAPL)股票依然持积极看法。我继续给予该股“强烈买入(Strong Buy)”评级,并维持 372 美元的目标价(基于当前股价,对应约 18% 的潜在上涨空间)。我认为 Apple 股价仍然存在进一步上涨机会,原因有很多。
**iPhone 高端化:**Apple 已明确致力于推动 Pro 系列或更高价格产品的销售,即使 iPhone 销量没有出现爆发式增长,这也能够支撑平均售价(ASP)。
**毛利率:**虽然面对大宗商品价格等成本快速上涨时,许多公司都会很难完全消化这些压力,但 Apple 庞大的规模、高度整合的供应链以及强大的定价能力,为公司带来了独特优势。因此,即使宏观经济环境可能变得不那么有利,Apple 依然处于非常有利的位置,可以维持较高的毛利率。
**人工智能:**我对 Apple 人工智能战略——也就是设备端 Apple Intelligence——的潜力并没有特别强烈的看法,不过这些功能确实可能增强 Apple 生态系统的用户黏性,让用户更难离开 Apple,从而提高客户忠诚度,并持续支持新一轮 iPhone 换机周期。目前来看,虽然 AI 存在一定潜力,但我几乎完全把它视为一种防御性策略。
当你看到服务业务以高利润率增长,同时配件不断强化整个生态系统时,本质上也是同样的逻辑。真正的主要优势来自每一个持续把用户进一步连接到 Apple 生态系统中的新设备或新服务。
当然,这里同样存在风险,我显然很清楚这些风险。例如,全球经济增长放缓可能导致 iPhone 需求下降,而 Android 在低端市场依然拥有非常庞大的市场份额。不过,也正是在这里,Apple 的脆弱程度相对更低。因此,我们认为其风险收益关系依然非常有吸引力。 fileciteturn0file0L1-L8
今天发生了什么变化
很多人一直在等待这场发布会,而自从 Apple 举办“Surprise & Shine”活动以来,我对这只股票的整体看法其实并没有真正改变。
新任 CEO John Ternus 现在已经开始带领 Apple 向前发展,而投资者都在问自己:“未来几年 Apple 打算把 iPhone 带向什么方向?”根据今天的发布内容,答案已经非常明显。Duo 起售价为 1,999 美元,2TB 版本最高达到 3,199 美元。iPhone 18 Pro 起售价为 1,199 美元,而 Pro Max 起售价为 1,299 美元。
【原文图片位置:Apple 新款 iPhone 产品与定价(Apple)】
另外,我不知道你是否注意到,Apple 并没有发布“标准版”的 iPhone 18。换句话说,标准版 iPhone 18、18e 以及 Air 2 都会在之后推出。因此,在未来几个月里,希望购买 iPhone 的消费者能够选择的型号会相对有限,基本上只有 Pro 系列或者 Duo。
因此,我越来越觉得,Apple 希望推动产品结构向更高价格产品转移,并在不需要销售明显更多 iPhone 的情况下提高平均售价。 fileciteturn0file0L10-L20
iPhone Duo
让我们具体谈谈 Duo。正如我们所知道的,可折叠手机并不是什么新鲜事物,市场上早就已经有可折叠智能手机。具体来说,Samsung(SSNLF)早在 2019 年就发布了 Galaxy Fold。此外,还有一些公司已经开始生产双铰链的三折叠手机。不过,在经历了一个不错的开局之后,整个行业却出现了下滑。根据 IDC 的数据,今年前六个月折叠屏手机出货量下降了 15%。虽然 Apple 进入折叠屏手机市场早在几个月前就已经被市场广泛预期,但分析师认为,Apple 的加入将显著提振整个行业。具体而言,预计到 2026 年,Apple 将占据全球折叠屏智能手机总销售收入的 44%。
【原文图片位置:折叠屏智能手机市场数据(Agar Capital,Bloomberg Terminal)】
从财务角度来看,我很好奇这种定价能力最终会有多少真正转化为毛利润。随着内存和存储成本上涨,公司成本也在上升。而 Apple 只将 Pro 型号价格提高 100 美元,这可能会成为一次非常有意思的测试。对我而言,真正的问题是:更高的售价能否完全抵消内存和存储成本上涨带来的全部额外成本,还是毛利率依然会承受一定压力?
人工智能
对于人工智能(AI),我对这里所提出的愿景要保守得多。Apple 将 iPhone 称为一个“Personal Intelligence Hub(个人智能中心)”。这个个人智能中心包括设备端 AI、云端 AI,以及能够连接超过 30 万款应用的 Siri。目前这些功能的真正价值,更多在于它们能够帮助推动 iPhone 换机周期,并进一步提升用户在 Apple 生态系统中的留存率。A20 Pro 也与这些目标高度契合:采用 2nm 制程、上一代 Neural Engine 两倍的性能、更强的图形能力以及更好的持续性能。Apple 已经开发出了实现这些技术所需要的芯片和操作系统。此外,Apple 还拥有强大的分销渠道,以及超过 10 亿最终可以使用这些技术的客户。在我看来,这为公司长期构建更大的 AI 平台提供了一个非常强大的基础。
Apple Watch 与 AirPods
我对 Apple Watch 和 AirPods 的看法也是如此。最新的健康监测技术、环境智能以及基于 Siri 的创新,为整个生态系统增加的价值远远大于单纯提升每一类产品的销量。每一种产品都会再给用户一个继续留在 Apple 生态系统中的理由。用户忠诚度始终都是 Apple 最重要的优势。如果你现在正用 iPhone 阅读这篇文章,你可能非常清楚我在说什么。
iPhone 高端化
Apple 大约一半的收入都来自 iPhone,因此,如果你想知道公司下一步可能走向哪里,就必须从 iPhone 开始分析。过去几年里,Apple 一直在推动“Pro”型号,而在 9 月 9 日的发布会之后,这一战略已经非常明显。
【原文图片位置:Apple iPhone 收入及产品结构(Agar Capital,Bloomberg Terminal)】
随着新一代 iPhone 产品线的定价明显高于过去——iPhone 18 Pro 起售价为 1,199 美元,Pro Max 为 1,299 美元,而全新的 Duo 起售价接近 2,000 美元——即使公司卖出的 iPhone 数量与过去相同,甚至略少一些,只要每台设备的售价大幅提高,整体盈利仍然可能增长。这就是平均售价(ASP)发挥作用的地方。
正如你所知道的,过去几年 iPhone 的 ASP 一直持续上升。分析师预计,消费者向 Pro 型号迁移的趋势将在 2026 年继续支撑 iPhone ASP 增长。由于 Duo 将进入一个完全全新的价格区间,而且分析师预计折叠屏手机的平均价格将超过 2,550 美元,这将进一步提高 Apple 产品组合中高价格设备的占比。
【原文图片位置:iPhone 平均售价趋势(Agar Capital,Bloomberg Terminal)】
这意味着,从整体来看,即使全球智能手机市场增长放缓,只要更多消费者选择 Pro、Pro Max 或 Duo,iPhone 收入依然能够继续增长。换句话说,Apple 正在努力从每一台售出的设备中赚取更多利润。
存储芯片短缺也迫使行业内许多公司提高平均售价。根据 IDC 的数据,预计 2026 年全球智能手机 ASP 将上涨 27.6%。由于 Apple 几乎只生产高端设备,因此相比那些同时销售高端和低端设备的厂商,公司在这些产品上面临的降价压力明显更小。
【原文图片位置:全球智能手机 ASP 预测(Agar Capital,Bloomberg Terminal)】
iPhone Duo:市场情景分析
Duo 是 Apple 首次进入折叠屏市场,目前我们还无法确定消费者会以多快的速度接受一款售价超过 2,000 美元的 iPhone。因此,我更喜欢通过不同“情景”来构建预期,而不是在缺乏充分证据的情况下直接做单一预测。
在悲观情景中,我预计消费者反应相对平淡。Apple 最终获得全球折叠屏智能手机市场大约 10% 的份额,每年销售约 200 万至 300 万台 Duo。按照 2,300 美元的平均售价计算,这意味着 Apple 每年可以从这一产品获得大约 50 亿至 70 亿美元收入。因此,虽然对于一个全新的产品来说,这已经是非常不错的表现,但它对 Apple 整体利润的影响仍然相对有限。很多人担心会重演 Vision Pro 的情况。
基准情景是我认为最有可能发生的情况,我预计每年 Duo 销量约为 500 万至 700 万台,对应每年约 140 亿至 180 亿美元收入。
然后是乐观情景。在这种情况下,Apple 重演自己过去的历史模式:晚于其他厂商进入一个新产品类别,然后迅速占据主导地位。根据 IDC 提供的预测,如果 Apple 能够占据折叠屏市场接近 40% 的份额,那么每年可能销售 900 万至 1,100 万台 Duo。如果平均售价提高至 2,700 美元甚至更高,则对应收入可以达到约 250 亿至 300 亿美元。
情景
2026 年 Duo 销量(百万台)
2027 年 Duo 销量(百万台)
ASP(美元)
2027 年 Duo 收入(十亿美元)
占 2027 年 Apple 销售额比例
悲观(10% 份额)
~2.3M
~2.7M
2,300
~6.2
~1.2%
基准(25% 份额)
~5.7M
~6.8M
2,550
~17.2
~3.3%
乐观(40% 份额)
~9.2M
~10.8M
2,700
~29.2
~5.6%
从这些数字可以非常明显地看出,基准情景预测是现实的,对应收入大约占 Apple 整体收入的 3%。另一方面,乐观情景的上限则可以接近 6%。 fileciteturn0file0L56-L69
利润率与零部件成本分析
在利润率方面,Apple 依然拥有一个极其强劲的基础。Apple 规模庞大,能够以许多其他公司根本无法达到的采购量购买零部件,而且从历史上来看,公司一直能够在成本结构中实现显著的规模经济。因此,产品业务毛利率通常维持在 30%-35% 之间,而服务业务毛利率则超过 70%。受更好的产品组合以及有效成本管理推动,FY2023 公司整体毛利率进一步改善至 44.1%。
【原文图片位置:Apple 毛利率趋势(Agar Capital,Bloomberg Terminal)】
Apple 目前面临的主要问题来自内存成本。RAM(随机存取存储器)和 NAND(NAND Flash),也就是 iPhone 用于存储和处理数据的芯片,自去年以来价格已经显著上涨。根据 Wall Street Journal 最近一篇文章中引用的一些预测,部分 iPhone 18 Pro 配置的内存芯片成本可能上涨了三到四倍。如果只从单个零部件成本角度考虑,这种幅度的成本增加显然可能给任何商业模式带来非常大的压力。
幸运的是,Apple 有两种方式可以缓解这种影响。其中一部分内存成本上涨可以由 Apple 自己直接吸收,从而表现为较低的营业利润率。另一种方式,则是通过提高售价,把全部或者部分成本转嫁给消费者。从最新一代 iPhone 产品线来看,Apple 看起来正是这样做的。具体而言,Pro 和 Pro Max 的售价已经提高,而且有证据显示产品组合正在进一步向价格更高的高端型号以及 Duo 倾斜。
因素
iPhone 17 Pro
iPhone 18 Pro(预估)
基础首发价
$1,099
$1,199(+9.1%)
RAM + NAND 成本
$52(256GB)
$77(256GB)↑
其他零部件成本
~$200
~$200
预计毛利率
~37%
~36%-38%
在这种情景下,计算其实相当直接。虽然内存成本会增加几十美元,但如果一台 iPhone 的最终售价仅仅提高大约 10%,那么 Apple 很可能仍然可以保住大部分甚至全部原本可能损失的利润,甚至从单机美元利润角度来看还有可能实现改善。我的高端定价投资逻辑包含多个重要方面,但其中可能没有哪一点比它在原材料成本上涨时保护利润率的能力更加重要。
因此,我认为,即使物料清单(BOM)成本提高,Apple 未来仍然能够在很大程度上保护自己的毛利率。 fileciteturn0file0L71-L88
估值
我不认为 Apple 必须大幅提高 iPhone 销量才能兑现自身潜力。公司真正需要做的是提高每一台设备所创造的收入、扩大服务业务,并通过股票回购减少总流通股数量。这些策略应该能够推动每股收益(EPS)继续增长。
根据 Bloomberg 对 FY2028 EPS 10.68 美元的一致预期,我给予大约 35 倍市盈率,由此得到每股 373.80 美元的估值,基本与我的 372 美元目标价一致。
【原文图片位置:Apple FY2028 EPS 与目标价估值(Agar Capital,Bloomberg Terminal)】
35 倍市盈率显然是一个非常高的估值。不过,Apple 当前前瞻市盈率大约为 33 倍,而过去五年平均值大约为 30 倍。
【原文图片位置:Apple 前瞻市盈率与五年平均估值(Agar Capital,Bloomberg Terminal)】
因此,为了达到我的目标价,我并不是假设市场会从头开始彻底重估 Apple。相反,我只是预计估值倍数会温和扩张,同时盈利继续取得一定增量增长。
【原文图片位置:Apple 股价走势图(TradingView)】
结论
我将继续维持“强烈买入(Strong Buy)”评级,并保持 372 美元目标价不变。我们暂时把折叠屏 iPhone 和 Apple 对 AI 的应用放到一边,先看看 Apple 正在如何通过整个生态系统本身获取更多收入。每一代新 iPhone 发布时,Apple 都在提高 iPhone 的平均售价。同时,公司从每一位用户身上通过服务业务能够获得的收入也一直在增加。
【原文图片位置:Apple 生态系统及估值相关数据(Seeking Alpha)】
对我来说,真正的投资故事正是从这里开始。Apple 可能根本不需要每年比现在多卖出多少设备。真正需要做的是,通过提高每位客户的整体经济价值来保护利润率。同时,Apple 还需要把庞大的已安装用户基础进一步转化为更多持续性的经常性收入。
目前市场显然已经认识到了 Apple 很大一部分优质属性。由于 Apple 当前的估值倍数已经非常高,因此几乎没有太多犯错空间。不过,如果 Apple 能够在定价、利润率、服务业务以及 Duo 这几个方面全部执行到位,那么我认为,从当前价格计算大约 18% 的潜在上涨空间,依然足以覆盖相应风险。
一文看完苹果发布会:折叠iPhone又给所有手机上了一课(除了AI)作者|陆
微信|SHARK_CHILI_LU
北京时间 9 月 10 日凌晨,John Ternus 首次以苹果 CEO 的身份主持了这场秋季新品发布会。iPhone 18 Pro 和 Pro Max、AirPods 5、Apple Watch Series 12 与 Ultra 4 依次登场,折叠屏则留给了最后的“One more thing”。
图源:Apple
标准版 iPhone 18 和第二代 Air 没有在这一晚出现,整场手机新品的重心,明显向高端“移动”了。
1
苹果终于发布了折叠屏 iPhone,可是大家都猜错了名字
关于折叠 iPhone 的名字,大家替苹果操了很久的心。 最早爆料的 iPhone Fold 最直白,iPhone Ultra 听起来也符合“有史以来最贵 iPhone 的这个标签”,然而最后出现在发布会上的却是 iPhone Duo。
Duo 这个名字让我立刻想起微软的 Surface Duo,那台由两块独立屏幕组成、像小本子一样打开的设备,曾经也让人期待手机能有另一种用法。可惜这个系列没能走下去,如今两代产品都已结束系统与安全更新。苹果这次展开的是一块连续的柔性屏,技术路线不同,但那个熟悉的名字,还是让人忍不住多想了一下。
图源:不客观实验室
把 iPhone Duo 合起来看,它的轮廓更接近一本护照。5.4 英寸外屏听着不大,苹果给出的显示面积却相当于 iPhone 18 Pro 的约九成;打开之后,7.6 英寸内屏比 Pro Max 多出约一半显示面积,内外屏保持相同的画面比例,内容在开合时可以按比例展开,减少切换屏幕后重新排布的突兀感。
图源:Apple
在演示里,比屏幕尺寸更容易让人注意到的,是挪到侧面的 Dock 和操作控件。苹果把过去占据上下空间的部分按钮移到两侧,给内容留出更多纵向空间,也让拇指更容易够到。
图源:Apple
邮件可以同时显示列表和正文,两个应用可以并排运行,同一个 Safari 也能打开两个窗口,淘宝京东拼多多比价时终于不用反复切来切去。
图源:Apple
这些用法在安卓折叠屏上已经不陌生了。轮到苹果来做,我其实更想知道微信里的链接、购物页面、文档和视频,能不能同样顺畅地利用这块屏幕。发布会上展示的系统应用适配只能回答一部分问题,真正每天会碰到的,是那些我们用得最多、却未必会第一时间为新形态重新设计的应用。
苹果还预告在今年晚些时候,USB-C 版 Apple Pencil 将能在 Duo 的内外屏上使用,iPhone Duo 的侧边按钮集成了 Touch ID,内屏的 FaceTime 摄像头藏在显示屏下方;手机半折着放在桌上,可以自己站住拍照、打视频电话;进入待机显示也不再要求一直插着电。几项功能放在一起,已经能让人想到床头、办公桌和出差途中的具体用法。
图源:Apple
图源:Apple
当然,折叠屏打开之后,没用过折叠屏的用户最先找的恐怕还是那道折痕。
图源:APPLE 美国现场 爱范儿拍摄
苹果在这场发布会上花了相当多时间解释屏幕结构,表面采用纳米纹理处理,减少眩光和反射;定制聚合物覆盖层与防刮涂层负责保护表面,内部还有高强度玻璃、允许各层在弯折时相对滑动的黏合材料,以及位于底部的钛金属支撑板。
图源:Apple
发布会还展示了铰链匹配、逐台扫描和微层补偿等制造环节,想让一块能反复弯折的屏幕看起来足够平整,显然要处理的远不止中间那一道印记。听到屏幕下面的钛板,我想到的是三星前段时间公布的 Flex Titanium。
三星在 7 月 15 日的官方介绍中,提到了一套由钛合金薄膜和钛板组成的结构:薄膜位于 OLED 面板下方,提供内部支撑;更下方的钛板则支撑整个显示模组,并通过折叠区域的微孔设计兼顾弯曲能力。三星希望借此减轻折痕、提高耐用性,同时继续压缩显示结构的厚度。
图源:三星
把两个介绍放在一起看,确实很容易联想到此前关于三星为苹果提供高度定制折叠显示方案的传闻。至少在材料选择和支撑思路上,两者有值得对照的地方。不过仅凭“都用了整块钛板”还不能确认它们采用同一套结构,更不能把面板供应直接等同于整机折叠方案,苹果这次强调的表面处理、铰链、叠层和装配校准,也都在影响最终效果。
Duo 内部采用 A20 Pro、C2 调制解调器和双电池设计。苹果标注的内屏视频播放时间最长为 31 小时,外屏为 44 小时;有线快充约 20 分钟可充至最多 50%。这些是指定条件下的测试结果,日常频繁开合、拍照和联网使用的续航,还要等实际测试。
图源:Apple
拍照方面,它配备 4800 万像素主摄和超广角,支持主摄提供的 2 倍光学品质变焦,但没有 Pro 系列的独立长焦和可变光圈。
图源:Apple
折叠结构倒是带来了一些很生活化的功能:被拍的人可以在外屏看见自己,拍孩子时可以播放动画吸引视线,合照也能让手机判断大家准备好后自动拍摄。15999 元的起售价并不意味着 iPhone Duo 的每一项相机配置都超过 Pro Max,贵出来的部分更多落在这套屏幕和结构上。
图源:Apple
交互方面一直都是苹果的强项,iPhone Duo 用丝滑的动画效果,给这个世界上所有其他的手机厂商结结实实的“上了一课”。
当演示中的 iPhone Duo 在掰开的一瞬间内屏亮起,外屏进入磨砂玻璃效果的那一瞬间,你就明白了这家科技巨头仍然是地球上最注重细节的公司,那种宛如翻开一块玻璃的“通透感”,值得所有友商好好学习。
图源:Apple
值得注意的是,国行 iPhone Duo 的上市安排这次也需要把发布前后的消息分开看。
发布前曾有国行可能因 eSIM 适配而晚到的说法,这很容易让人想起去年的 iPhone Air。不过,截至发稿,苹果中国官网已经明确写出:10 月 16 日晚 8 点接受预购,10 月 23 日发售,与英文新闻稿中的首发日期一致。
图源:Apple
我更关心的,其实是已经用上 iPhone Air 的人这次能不能“少跑”一趟营业厅。毕竟手机的照片、应用和设置都可以在换机时迁移,手机号码能否一起过去,却取决于运营商是否支持相应的 eSIM 转移方式。
苹果中国官网对 Duo 的说明仍然要求前往运营商线下营业厅,核验身份证件并激活 eSIM;目前也没有看到明确适用于国行 Air 换 Duo 的免到店迁移承诺。
因此,我们还不能把系统里的“eSIM 快速转移”理解成大陆用户一定能用;甚至发布会上介绍的 iOS 27 可以支持两部 eSIM 版 iPhone 进行“信号接力”的功能,中国大陆用户也暂时无缘。
图源:Apple
对第一批接受 eSIM 的用户来说,去年已经为了体验新形态的 iPhone Air 调整过一次使用习惯,今年换机时如果还能再省掉一道手续,体感上的便利可能比发布会上许多漂亮的过渡动画都更加直接。
1
可变光圈终于来到了 iPhone Pro 上
把目光从 Duo 移开,iPhone 18 Pro 这次最值得展开说的是相机和散热。
iPhone 18 Pro 的 4800 万像素主摄加入可变光圈,提供 f/1.48、f/1.8、f/2.8 和 f/4.0 四档选择。系统可以根据场景自动调节,也允许用户自己控制。
图源:Apple
暗处需要更多进光量,合影时希望前后排都清楚,或者想主动改变画面景深,现在的新 iPhone 多了一项真正发生在镜头里的机械调节。不仅如此,iPhone 18 Pro 还首次加入了相机的 Pro 控制选项,能够自行 调整快门速度、白平衡和直方图,常用设置可以放到更容易找到的位置。
图源:Apple
对喜欢拍照的人来说,这比再多几个预设滤镜更有探索空间。不过小尺寸传感器上的光圈变化最终能带来多大程度的自然虚化和画质提升,虽然苹果在发布会用样张展示了可能性,但日常随手拍能否稳定得到同样的改善,才决定这项功能会不会经常被用到。
图源:Apple
芯片方面,A20 Pro 进入了 2 纳米制程,苹果为其增加了第二组神经网络引擎,总计 32 核,并把芯片与内存的封装布局重新调整,让芯片更直接地连接散热系统。新一代均热板面积达到上一代的三倍,官方宣称,整机持续性能相比 iPhone 17 Pro 最高提升 40%。
图源:Apple
这些变化放在游戏、长时间拍摄和设备端 AI 里更容易理解:手机刚开始运行时有多快,和运行十几分钟后还能有多快是两回事。苹果这次把不少篇幅花在热量怎么被带走上,也让人更期待后续的持续负载测试。
图源:Apple
续航方面,发布会介绍 iPhone 18 Pro Max 最长 45 小时视频播放是针对纯 eSIM 机型的,中国官网给国行标注的是 43 小时。;国行 Pro 和 Pro Max 分别从 9999 元、10999 元起售,9 月 12 日晚 8 点预购,9 月 18 日发售。
贯穿这些硬件介绍的 Siri AI,也终于有了更多可以落到具体操作上的演示。
图源:Apple
演示视频中,当使用者问 Siri “妈妈来访时想一起做什么”时,Siri 从邮件和信息里找到食谱与聊天内容,再把缺少的食材加入购物清单。
图源:Apple
它还可以根据相机看到的内容回答问题,在应用中执行操作,并通过独立的 Siri 应用保留和接续对话。比起单独回答一个常识问题,这类演示更接近人们对手机助理的期待:记得我收到过什么,也知道接下来该去哪里处理。
图源:Apple
Safari 现在能够基于 AI 监测网页变化、用自然语言生成快捷指令、打电话时调出相关订单信息,以及照片扩图和重新构图,也都沿着这个方向展开。
图源:Apple
图源:Apple
但功能演示之外,语言、地区和额度仍会影响体验:Siri AI 首先以英语测试版推出,部分依赖服务器模型的能力有使用限制,用户可以选择购买更高版本的 iCloud+来获得更多的使用时长。
国行页面对 Apple 智能的说明,依然是推出时间取决于监管审批。所以对于我们来说,买到新硬件与用上发布会上全部 AI 功能,还不能画上等号。
图源:Apple
1
Airpods 5 和新 Apple Watch
AirPods 5 的变化倒是很容易说清楚:这次两款都给了主动降噪。
图源:Apple
999 元的基础款以及 1149 元的无线充电盒款,都保留了不带硅胶耳塞的佩戴方式。后者多出耳柄滑动调音量、无线充电,以及更长的单次续航;开启降噪时,两款官方标称分别最长听 4 小时和 5 小时。
图源:Apple
两档产品只差了 150 元,我建议所有有意向购买的用户都选择 1149 元的版本。
苹果还表示,新声学结构让降噪效果相比上一代最高提升 50%。对于不喜欢耳塞深入耳道的人,值得关注这一代实际的佩戴和降噪表现。
图源:Apple
至于发布会上展示的实时翻译与 Siri AI,则仍要结合所连接的 iPhone、语言和地区支持情况来看。
在 Apple Watch 的演示里,我印象比较深的,是把刚刚没听清的话“找回来”的 Live Rewind 功能。
这是 Series 12 和 Ultra 4 借助 S11 芯片加入新的音频智能功能。餐厅服务员报完一串菜名、同事随口提了个建议,这些确实都是很容易错过的瞬间。现在你只需要双击数码表冠,Live Rewind 可以把此前 15 秒的讲话转成文字;同时 Siri Recap 则可以整理谈话中的要点,让整段“回忆”更加简介易懂。
图源:Apple
苹果表示,处理所用的原始音频随后会被删除,用户可以控制摘要功能何时开启;相关功能计划于今年晚些时候先以英语测试版提供。
除去音频功能的升级之外,Apple Watch 贴着手腕的传感器也重新设计了。发布会上给出的背景心率采样频率提高到每 5 秒一次,HRV 最频繁每 5 分钟采样一次,是目前最精准的腕上监测设备。
图源:Apple
新的 Readiness 评分会结合活动、睡眠和身体指标,帮助用户判断当天适合继续训练,还是应该放缓节奏。健康应用也展示了更多数据解读与个性化指导,不过其中依赖新 AI 能力的部分,同样有后续上线安排。
图源:Apple
Series 12 的标称续航仍为最长 24 小时;Ultra 4 的日常使用续航提高到最长 50 小时,标准运动追踪最长 18 小时,Max 延长运动模式则可达到 45 小时。
两款手表国行分别为 2999 元和 6499 元起,官网列出的预购时间是 9 月 11 日早 9 点,发售日期为 9 月 18 日。
看完这一场发布会,我最想尽快上手的还是 iPhone Duo,苹果已经把手机折起来了,接下来就等它进入那些不按演示脚本发生的日常中去了。
加拿大创新部长 Evan Solomon(埃文·所罗门):主权 AI 与加拿大数字未来撰文:Techub News 整理
导语
2025年9月24日,加拿大创新、科学和工业部长 Evan Solomon(埃文·所罗门)出席在蒙特利尔举行的第三届“ALL IN”人工智能峰会并发表主旨演讲。这场峰会由加拿大著名AI公司Scale AI主办,汇聚了全球AI领域的创始人、研究者、投资者和学生。在长达50多分钟的演讲及随后的专家讨论中,Solomon(所罗门)系统阐述了加拿大在AI革命关键节点上的国家战略——构建“数字主权”,并勾勒了政府在资本、算力、人才、法规等方面的具体行动计划。随后,他与NVIDIA企业生成式AI软件副总裁 Carrie Briskey、Cohere联合创始人兼CEO Aiden Gomez(艾登·戈麦斯)以及主持人 Amber Mac(安珀·麦克)进行了一场深度对话,进一步探讨了主权AI的实践路径、公众信任建立以及加拿大在全球AI竞争中的独特角色。此次发声被视为加拿大政府对AI国家战略的一次重要更新和动员。
摘要
加拿大将“数字主权”定义为核心国策,旨在建立自主的算力基础设施、数据治理规则和AI创新能力,确保关键数据受加拿大法律管辖。
政府计划在未来数月内,围绕信任与安全、资本/客户/算力、人才与前沿技术三大支柱,推出一系列具体措施,包括更新已有25年历史的隐私数据法、利用政府采购创造市场需求、启动重大量子倡议等。
主权不等于孤立,加拿大将继续深化与美国、欧盟、阿联酋等盟友及全球科技公司的合作,但强调必须“拥有这个关键时刻所需的工具和规则”。
面对公众对AI的焦虑,政府认为建立信任的关键在于将AI定位为“服务工具”,通过立法保障、实际用例展示和透明沟通,让技术服务于提升民生与经济。
加拿大AI业界领袖呼吁国内企业提升雄心与风险承受能力,制定超越简单工具应用的实质性AI战略,并积极采用本土AI解决方案。
构建数字主权:加拿大 AI 的国家使命
Evan Solomon(埃文·所罗门)在演讲开篇即点明,当前我们正处在“技术革命与政治格局重塑相互碰撞的关键时刻”。他认为,AI不仅是新技术,更标志着“创业者时代的诞生”,个人拥有了史上最强大的工具将创意转化为企业与就业。但他强调,加拿大的核心任务是构建“数字主权”——这被他称为“当今时代最紧迫的政策与民主议题”。
所谓“数字主权”,Solomon(所罗门)从几个层面进行了阐释:首先,加拿大需要一个有意义的、自主的主权数字骨干网络,包括人才、能源和算力,以构建未来经济。这个数字经济的核心是“免受胁迫”,即不被他人随意关闭。拥有自己的数字资产,加拿大才能以平等的姿态与全球伙伴合作、贸易,并在合作中保持主权。其次,数据是核心。谁控制、使用和管理数据,谁就决定了集体的繁荣、安全乃至价值观。因此,加拿大必须建立一个能反映、保护并投射其核心价值观的数字骨干,确保关键和敏感数据处于加拿大法律管辖之下。最后,数字主权意味着支持加拿大的建设者、创新者和企业家,让他们的创意成长为繁荣的加拿大公司,将总部、工作岗位和知识产权留在国内,使加拿大成为“AI总部”,而非“分支机构”。
他特别指出,主权并不意味着孤立(“Sovereignty does not mean solitude”)。加拿大将继续与国际朋友和盟友,尤其是美国、阿联酋、欧盟等,以及全球大型科技公司(超大规模云提供商)合作,他们同样是生态系统中至关重要的一部分。但关键在于,加拿大必须“拥有这个关键时刻所需的工具和规则”,建立自己的“数字保险单”。
Solomon(所罗门)回顾了加拿大在AI领域的传统优势:现代AI在此成形,拥有 Geoffrey Hinton(杰弗里·辛顿)、Rich Sutton(里奇·萨顿)、Yoshua Bengio(约书亚·本吉奥)等奠基人;2017年推出了全球首个国家AI战略;建立了Mila、Vector、Amii等世界领先的研究所。但他警告,领导地位不是与生俱来的,必须不断争取,而当前竞争异常激烈。
信任、资本、算力与人才:四大行动支柱
基于数字主权的目标,Solomon(所罗门)概述了政府即将展开的几大关键行动领域。
第一,信任与安全。 Solomon(所罗门)直言,技术以创新速度前进,但采用速度取决于信任。为了建立信任,政府将着手更新已有25年以上历史的加拿大隐私和数据法律。新法律将包含针对消费者担忧(如深度伪造)的保护措施,特别是加强对儿童的保护,并为数据使用设定清晰标准,以便创新者能够明确规则,从而释放投资。此外,政府还将通过刑事法典等其他法律工具应对新型威胁。他强调,立法的目标是让加拿大人感到安全,从而将AI视为改善服务的机会而非威胁。当人们信任AI时,才会在农业、医疗、教育、政府服务等各个领域广泛使用它。
第二,资本、客户与算力。 通过过去四个月与全国创始人和企业家的交流,Solomon(所罗门)总结出三大普遍需求。首先是资本。政府将推出新工具,帮助加拿大创新者在国内扩大规模,在种子轮和早期阶段获得更多资金,吸引耐心资本,并将总部留在国内。其次是客户。政府将发挥表率作用,通过政府采购成为AI解决方案的强大验证者和客户,为加拿大制造的AI产品创造市场。他举例已与Cohere签署谅解备忘录,采购其具有战略意义的大语言模型,并提到国防工业战略也将为AI技术解锁双重用途机会。第三是算力。主权算力/主权云是核心任务,意味着关键敏感数据将保留在加拿大法律下,并存储在加拿大控制的数据中心内。
第三,人才与下一代。 Solomon(所罗门)认为,加拿大的竞争优势在于“人”。因此,国家需要持续吸引全球顶尖人才,并留住本国最优秀的人才。他预告,今年10月,加拿大将启动一项重大的量子技术倡议,以确保量子领域的人才、智慧与知识产权留在国内。他明确表示,目标不是成为“他人经济体的农场队”,即培育公司只为被收购和迁走。
第四,战略更新与加速执行。 Solomon(所罗门)宣布,2025 年 9 月晚些时候将启动加拿大AI战略工作组,汇集全国各地的创新思想家,用30天时间围绕研究、应用、商业化、安全、教育、基础设施等八大优先级进行“冲刺”,提出大胆实用的想法。工作组将于11月提交报告。今年晚些时候,加拿大将提前近两年提交更新后的国家AI战略,实现“从原则到项目、从想法到影响”的转变。他强调“等不起”,加拿大必须保持竞争力、可信度和创新性。
专家对话:主权AI的实践、信任与机遇
在随后的专家讨论环节,NVIDIA的 Carrie Briskey、Cohere的 Aiden Gomez(艾登·戈麦斯)与 Solomon(所罗门)部长就主权AI的具体实践和挑战进行了深入探讨。
主权AI的必要性与模型:Carrie Briskey 从技术合作角度阐述了主权AI的价值。她指出,所有国家都应发展自己的AI,而不仅仅是外包给外部供应商,因为AI需要与本地价值观、文化背景、政策规范以及细微的自然语言模式对齐。她列举了瑞典、印度、日本、波兰、意大利、法国等国建设本土大模型的案例,并强调本地模型会吸引开发者,进而需要本地基础设施来构建应用,形成数据反馈和模型优化的正向循环,从而逐步建立信任。
Aiden Gomez(艾登·戈麦斯)则从公司和政府合作层面分享了Cohere的实践。他强调与加拿大政府合作的目标是提升公共服务质量与效率,同时确保数据主权和安全。Cohere提供的完全私有化部署方案,甚至可以做到物理隔离(“空气间隙”),为数据和IP提供了最高级别的保护,避免了数据外泄到外部公司的风险。
建立公众信任的路径:针对主持人 Amber Mac(安珀·麦克)提出的“超过半数加拿大人对AI感到担忧”的问题,Solomon(所罗门)重申了立法更新是关键的第一步,能向民众和企业发出明确的信号。他借用威尼斯Aldine印刷厂“欲速则达”(Festina Lente)的格言,指出必须“快速行动以跟上,但要稳中求进”。他认为,应当将AI首先作为一种“服务”来谈论——如何改善医疗、农业等民众切身相关的领域,并颂扬那些创造前所未有新岗位的企业家。技术变革总伴随焦虑,而信任感将随着使用案例的增多和安全感的确立而建立。
监管的平衡艺术:关于AI监管这一全球性难题,Solomon(所罗门)分析了三种不同模式:美中倾向于认为任何监管都会限制安全与创新;欧盟率先尝试全面监管,但坦承对创新造成了一些限制。加拿大的路径将是聚焦关键领域:保护加拿大敏感数据安全(通过主权基础设施)、更新隐私和数据法、关注儿童和消费者保护(如深度伪造)。他承认不存在“完美监管”,立法需要与技术一样迭代发展,避免“让完美成为优秀的敌人”。核心是保持加拿大作为一个法治国家、教育发达、人才辈出、值得信赖的贸易伙伴的竞争优势,不能让监管扼杀这些优势。
对加拿大企业领导者的建议:在讨论的最后,各位嘉宾对加拿大企业如何拥抱AI给出了建议。Solomon(所罗门)提出三点:购买加拿大(解决方案);与国际伙伴(如NVIDIA)在其安全框架内合作;制定清晰的、以服务交付和客户转变为导向的AI采用计划,而不仅是为了技术而技术。他引用NVIDIA CEO Jensen Huang(黄仁勋)的话鼓励企业不要追求完美主义,而要敢于“发布、观察、测试、然后成长”。
Aiden Gomez(艾登·戈麦斯)呼应了 Solomon(所罗门)关于“雄心与风险承受力”的观点,并尖锐指出,如果企业的AI战略仅仅是“购买了Microsoft Copilot或让员工用ChatGPT”,那等于没有战略,这只是价值创造中最底层的一环。企业需要制定有具体目标和真实投资回报率路径的战略。
Carrie Briskey 则以个人经历为例,鼓励大家立即行动。她谈到AI正在缩小技术鸿沟,她12岁的女儿已经能通过自然语言交互创建应用。她建议,无论是个人、家庭还是企业,都可以从今天开始尝试使用各种AI应用,通过透明性和实际使用来建立信任。
在闭幕词中,Aiden Gomez(艾登·戈麦斯)强调“这是加拿大的时刻”,需要将投入研究的AI技术真正投入生产,这要求雄心、风险承担和领导力。Evan Solomon(埃文·所罗门)则最终回归其核心信息:不要将技术与人对立,AI是企业家工具和改善服务的工具,当人们看到这一点,更多的人将涌入这个领域,共同推动国家经济增长,让所有人受益。
Shopify 总裁 Harley Finkelstein(哈利·芬克尔斯坦)、Wealthsimple 创始人 Mike Katchen(迈克·卡钦)与 Cohere 创始人 Aidan Gomez(艾丹·戈麦斯):共建加拿大科技新纪元撰文:Techub News 整理
导语
在 2025 年多伦多科技周(Toronto Tech Week 2025)的主舞台上,一场聚焦于「雄心」的重量级对话正在上演。Shopify 总裁 Harley Finkelstein(哈利·芬克尔斯坦)作为主持,与加拿大金融科技明星 Wealthsimple 的创始人兼 CEO Mike Katchen(迈克·卡钦),以及全球 AI 独角兽 Cohere 的联合创始人兼 CEO Aidan Gomez(艾丹·戈麦斯)同台,共同探讨加拿大科技创业的未来。
这三位分别是电商、金融科技和 AI 领域的领军人物,他们所领导的公司不仅在国内家喻户晓,更是在全球范围内具有重要影响力。他们的对话之所以重要,是因为它直面了长期以来困扰加拿大科技生态的核心议题——「雄心」与「人才外流」,并试图给出一个强有力的答案:停止抱怨,开始建设,就在加拿大。
摘要
雄心误读澄清:Harley Finkelstein(哈利·芬克尔斯坦)澄清其关于加拿大需要更多「雄心」的言论被误解,他强调并非加拿大人缺乏雄心,而是所有创业者都需要更大的抱负和持续创新的能量。
「天真雄心」的力量:Mike Katchen(迈克·卡钦)提出「天真雄心」的概念,即抛开无数个「不可能」的理由,转而思考「需要相信什么才能成功」,这是挑战传统金融壁垒、创立 Wealthsimple 的关键。
坚守加拿大,服务全球:Aidan Gomez(艾丹·戈麦斯)强调基于忠诚与战略选择在加拿大(多伦多)建立 Cohere 的原因,指出加拿大品牌在全球地缘政治中是巨大资产,并呼吁建立能造福全球的加拿大机构,而非仅服务本土市场。
主动拒绝外部「拉力」:三位创始人分享了他们如何拒绝迁址美国、拒绝被收购、拒绝将公司架构转为美国公司的压力,强调保持加拿大总部、建设本土巨头对生态系统和国家未来的重要性。
驳斥误解:我们需要的是更宏大的雄心,而非质疑其存在
对话伊始,Harley Finkelstein(哈利·芬克尔斯坦)首先澄清了一个困扰他八个月的公众误解。八个月前,他曾表示加拿大科技创业需要一个「房间里 600 磅的大猩猩」,即需要更大的「雄心」。然而,次日几乎所有媒体都将其解读为「哈利认为加拿大人缺乏雄心」。Finkelstein 强调,他的本意恰恰相反:加拿大创业者很有雄心,但我们需要的是更多、更大的雄心,以及保持这种雄心的能量。
他引用了标普 500 指数成分公司的数据来支撑这一观点:「标普 500 公司的平均年龄已从历史上的 36 年降至如今的 21 年。当你研究那些被剔除的公司时,会发现它们并非死于竞争,而是死于停滞——它们失去了最初让它们充满雄心的那股能量和火花。」 Finkelstein 希望,2025 年 7 月的对话能为大家注入更多这样的能量。
他继而指出,坐在他身边的 Mike Katchen(迈克·卡钦)和 Aidan Gomez(艾丹·戈麦斯)正是这种「宏大雄心」的践行者,他们分别挑战了壁垒森严的金融服务业和处于全球前沿的人工智能领域,并在加拿大建立了世界级公司。
「天真雄心」:挑战不可能的艺术
当被问及如何在壁垒重重的金融服务业中建立 Wealthsimple 时,Mike Katchen(迈克·卡钦)分享了公司的核心价值之一:「天真雄心」。
「当你提出一个新想法,比如『我们来创办一家金融服务公司』时,大多数人的第一反应是列出成千上万个它永远不会成功的理由,」 Katchen 回忆道,他当时 25 岁,从未有过金融业工作经验,「人们说,加拿大银行在信任方面拥有绝对垄断,这永远不会成功。」
Wealthsimple 的做法是「翻转问题」:「我们转而问自己:『我们需要相信什么,这件事才能成功?』 这就是『天真雄心』的全部。」他强调,加拿大需要更多这种「天真雄心」,即坚信可以从这里建立起世界上最好的公司。
Katchen 认为,这种雄心不应仅限于创始人。在 Wealthsimple,他们将「天真雄心」奉为公司价值观,期望每一位员工都能推动公司的抱负。「我最喜欢的时刻是,当我们取得巨大成功时,我反而是事后才知道的那个人。」他举例说,就在这个场地,两周前 Wealthsimple 举办了一场名为「银行业的终结」的大型活动,吸引了全加拿大 10 万人观看,而他作为主讲人却对活动的筹办一无所知。「这告诉我,我们已经创造了一种文化,让人们相信大事是可能的。」
为何扎根多伦多:忠诚、人才与国家品牌
Aidan Gomez(艾丹·戈麦斯)分享了他选择在多伦多而非硅谷或其他地方建立 Cohere 的思考。他认为,加拿大的问题不在于缺乏雄心,而在于「人才外流」——大量顶尖人才流向湾区或其他地方,破坏了本地的生态系统。
Gomez 与联合创始人都出生在加拿大,对他们而言,这里是家园。「这个国家的纳税人支付了我的教育、我的医疗,所以没有其他地方可选。我对这个国家怀有深厚的民族主义和忠诚,要在这里建设,并像哈利说的那样,为我们的国家贡献一家具有全球雄心的公司。」 他强调,目标不应仅是建立一家服务于加拿大的公司,而是在加拿大建立一家服务世界的公司。
此外,Gomez 指出了在加拿大创业的战略优势:加拿大的国家品牌是一个巨大的资产。「在全球舞台上地缘政治变化之际,加拿大品牌从未如此强大……加拿大被视为一个真正的好国家,拥有良好的道德观和价值观。人们希望加拿大赢,他们是站在我们这一边的。」这种品牌信誉为 Cohere 这样的公司带来了全球信任和合作机会。
Gomez 提到,Cohere 甚至经历了「反向人才外流」——来自美国等地的人才希望来到多伦多加入他们。这得益于多伦多不断发展的生态系统和社区凝聚力,而这正是通过组织像多伦多科技周这样的活动,将社区聚集在一起,激发灵感、建立联系而实现的。
讲好故事:从「歉意」到「自豪」的文化转变
Harley Finkelstein(哈利·芬克尔斯坦)提出了一个关键问题:加拿大人是否不善于讲述自己公司和国家的成功故事?他观察到许多创业者只是埋头苦干,却羞于或疏于分享他们的成就。
「我认为我们过去常常为自己的成功感到抱歉,」 Finkelstein 说,但现在情况正在改变。「我认为发生的一个重大转变是,现在我们有了一种自豪感——就像我可以在任何我想的地方建立这家公司。」他分享了自己选择留在加拿大(从渥太华搬到蒙特利尔)而非返回美国的故事,当时外界的普遍假设是他会离开加拿大。
Aidan Gomez(艾丹·戈麦斯)则将讲故事的能力归功于社区和「时代精神」。他指出,多伦多正在形成一种新兴的「时代精神」,充满活力的社区(他提到了 Vin 和 535 等)创造了思想碰撞和故事萌芽的空间。「我们是非常棒的故事讲述者和品牌塑造者,能够创造出世界想看的东西。我们只需要投入时间,做得更多。」
Mike Katchen(迈克·卡钦)则认为,讲故事的关键在于从事有意义的事业。「如果你从事有意义、有目标的事业,围绕它讲故事就会变得非常容易。」他回到加拿大的深层动机是对国家经济轨迹的担忧:「我们只做两件事:从地下挖东西,以及为挖东西提供融资。如果 20 年后我们告诉我孩子的故事还是这个,那么我们所享受的美好事物——有人买单的教育、医疗——都将消失。」 在他看来,通过创业重塑经济是唯一出路,而这个目标本身就构成了最有力的故事。
抵御「拉力」:对收购说「不」,对迁址说「不」
作为全球 AI 热潮的中心,Cohere 无疑是众多巨头并购部门眼中的「香饽饽」。Harley Finkelstein(哈利·芬克尔斯坦)好奇 Aidan Gomez(艾丹·戈麦斯)如何抵御那些极具诱惑力的收购要约。
Gomez 的回答干脆利落:「我们就是不开放(被收购)。我们不出售。」他直言不讳地表示:「在我看来,被收购就是失败,是终结了建设的过程。」他分享了一个早期经历:当时语言模型市场尚不存在,Cohere 收到了一个美国科技巨头「九位数」的收购报价。董事会曾认真考虑,但最终拒绝。「我现在非常、非常感激我们没有接受。我们还在飞速成长,我只专注于建设的现实,没时间去考虑另一个(被收购的)现实。」
Finkelstein 补充了 Shopify 早期的做法:他们干脆不回复任何并购部门的电话,以避免开启可能导致分心的对话循环。
除了收购,更大的「拉力」来自资本要求公司迁址或将法律实体转为美国公司(如特拉华州公司)。Gomez 透露,他2025 年 7 月还收到一位创始人求助,因其被美国顶级孵化项目录取,对方要求其将公司转为特拉华公司。Gomez 的建议是坚决拒绝:「我们需要开始对这类压力说『不』……我们需要采取积极的民族主义立场,为加拿大而建。」
Finkelstein 和 Katchen 也分享了类似经历。Finkelstein 回顾了 Shopify 在 A 轮融资时,投资者以迁址硅谷为投资条件,他们拒绝了,并最终找到了不在乎其所在地、只关心其愿景和团队的投资者。Katchen 则讲述了 Wealthsimple 早期无人愿投的困境,他们转而寻求加拿大本土机构(如 Power Corp)的支持,这为他们提供了专注于业务发展的稳定资本,并最终吸引了全球顶尖投资者首次投资加拿大。
他们都强调,如今在加拿大融资和建立全球公司的环境比十年前「容易得多」,这正得益于 Shopify、Wealthsimple、Cohere 等先行者开辟的道路。
展望未来:万亿市值公司与国家的存续
在对话尾声,Harley Finkelstein(哈利·芬克尔斯坦)提出了一个振奋人心的目标:加拿大历史上从未诞生过一家市值万亿美元的公司。他坚信,在场的某个人——无论是台上还是台下——将在未来十年或二十年实现这一创举。「无论你是谁,你不仅拥有我们的全力支持,你还拥有整个国家的支持。我们站在你身后。」他承诺将提供一切必要的帮助。
Aidan Gomez(艾丹·戈麦斯)则将话题提升到了国家存续的层面。「我认为加拿大正面临威胁……『加拿大是否应该存在』这个问题已经被摆上台面。 如果我们不加强经济,不建立多元化的供应链和公司群……半个世纪后我们将不复存在。这是生存问题。」因此,他呼吁加拿大人「为国家而建」,这需要深刻的承诺和雄心。幸运的是,全球对加拿大的信任和支持为此提供了巨大的机会。「世界上每个人都喜欢加拿大,他们想买你的产品。给他们一个理由。去建设,去全球扩展。这是我们保卫家园的唯一方式。」
Mike Katchen(迈克·卡钦)引用了《为什么墨西哥人不喝莫尔森啤酒?》一书作为结尾。该书探讨了加拿大拥有建立世界冠军公司的所有要素,却未能找到「配方」的窘境。他的愿望是:「希望我的孩子们永远不会读到这本书,因为它将因在座各位所建立的领先世界的公司而变得无关紧要。 加拿大将在全球经济中占据应有的地位。」
最后,Finkelstein 向所有在加拿大怀揣雄心、建设伟大公司的创业者传递了一个明确的信息:你们身后有一个支持你们的社群,有 Mike、Aidan,还有我,以及整个社区,随时准备帮助你们实现梦想。唯一的请求是:放手去做,并大声告诉世界。
Cohere CEO Aidan Gomez(艾丹·戈麦斯):Transformer 永生、开源昂贵,以及民主联盟的 AI 主权战撰文:Techub News 整理
导语
2026 年 6 月,Transformer 架构奠基性论文《Attention Is All You Need》的联合作者之一、AI 初创公司 Cohere 的联合创始人兼 CEO Aidan Gomez(艾丹·戈麦斯)做客知名科技媒体人 Eric Newcomer 的播客节目。在这场长达 20 多分钟的深度对话中,Gomez 不仅以技术先驱的视角回顾了 Transformer 的惊人生命力,更以企业 CEO 的身份,分享了关于 AGI 现状、企业 AI 采用、开源模型真实成本,以及 AI 时代地缘政治与“数字主权”的尖锐见解。在当前中美科技竞争加剧、全球 AI 监管与安全讨论白热化的背景下,这位身处行业核心的创业者兼学者的观点,为我们理解 AI 技术演进与产业格局的未来提供了关键线索。
摘要
Transformer 架构可能成为长期基础平台,如同数据库一样,未来创新将更多发生在该平台之上,而非彻底取代它。
企业 AI 采用仍处极早期,除编码外,金融、合规、内部协调等绝大多数企业流程尚未被 AI 触及,市场潜力巨大。
完全自托管开源模型的真实成本被低估,基础设施、软件栈维护和持续更新带来的负担使其对多数企业而言并不经济。
过度依赖单一国家(美国)的少数科技巨头是民主联盟的“单点故障”,构建多极化的民主 AI 能力联盟对保障数字主权和系统韧性至关重要。
中国 AI 模型能力被严重低估,其发展轨迹强劲,这更凸显了民主国家间建立多元 AI 供给体系的紧迫性。
Transformer 永生:从翻译工具到AI基石
作为 Transformer 架构的缔造者之一,Aidan Gomez(艾丹·戈麦斯)坦言,七年前论文发表时,团队无人预见到它会引发一场席卷全球的 AI 革命。“我们当时是为解决谷歌翻译这样一个非常具体、范围有限的问题而构建了它。后来的发展是一个巨大的震撼。”更让他感到“好笑”的是,近十年过去了,Transformer 不仅未被淘汰,反而展现出惊人的“生命力”和“抄袭”能力。
Gomez 以之前流行的状态空间模型(SSM)为例,当时许多人认为 SSM 因其超长上下文窗口等优势将取代 Transformer。“结果 Transformer 只是‘抄袭’了那些好点子,将其整合进自身架构,我们依然叫它 Transformer。”他比喻道,Transformer 就像一个伟大的艺术家,擅长从其他架构中汲取精华。这种持续的进化能力,使得它可能不再是那个需要被“超越”的对象,而是演变为一个长期的基础平台。
“我认为人们正在向技术栈的上层移动,并将创新精力投入那里。”Gomez 解释说,就像训练模型的基本算法在过去十多年里没有根本性改变一样,Transformer 可能成为 AI 的“平台”。未来的巨大进步,例如“推理”能力的提升,也将在这个平台内部发生。虽然他希望仍有突破性新架构出现的空间,但他承认,要彻底取代 Transformer,“需要一些相当重大的东西”。
AGI已来?企业AI的冰山与“令牌狂热”
当被问及“我们今天是否已实现通用人工智能(AGI)”时,Gomez 给出了一个耐人寻味的肯定:“从很多方面来说,是的。”他认为,当前的 AI 已经展现出通用性,无论人类指向什么问题,它基本上都能在该问题上超越人类能力。这种能力的泛化,正是 AGI 的核心特征之一。
然而,在商业落地层面,AI 的潜力远未释放。Gomez 指出,当前企业界对 AI 的采用存在一种“令牌狂热”(token maxing)现象,即公司初期为了激励员工使用 AI 而不设预算上限,导致开支激增,随后不得不进行回调。他认为这是一个典型的技术采纳周期:狂热采用、过度消费、然后修正。而修正的动力一方面来自企业自身控制成本,另一方面则来自模型公司通过创新实现的效率提升和成本压缩。
“成本将急剧下降,”Gomez 预测,“而随着成本下降,使用量的增长将解锁更多应用。”他坚信,企业 AI 的采用仍处于非常早期的阶段。编码(编程辅助)是当前最成熟的应用,可能正在接近饱和点,但企业内其他所有流程——从金融决策、跨部门沟通协调,到法规合规自动化——在他看来“基本上尚未被触及”。
“我们所做的事情(指当前已落地的 AI 应用)是如此简单,”他比喻道,“水面之下还有一座巨大的冰山。”他认为,仅在企业端,令牌消耗量就还有 10 倍甚至 100 倍的增长空间。对于 Cohere 这类公司而言,客户因控制成本而缩减开支并不会损害其长期收入,因为更低的成本将激活一个庞大得多的增量市场。
开源迷思与定制化价值:模型并非唯一瓶颈
面对“令牌狂热”,开源模型常被视为一种成本更优的解决方案。但 Gomez 对此提出了不同看法。他认为,如果企业选择完全自托管开源模型,需要自行构建和维护整个软件栈、服务框架,并确保最佳的运行效率,实际成本可能相当高昂。
“这很像数据库的情况。是的,你可以拿一个开源数据库来自行托管、维护和管理它。但几乎没人这么做。”Gomez 指出,绝大多数企业选择托管服务,因为运营这些系统是困难、痛苦且昂贵的。开源模型看起来便宜,往往是基于使用 DeepSeek 或阿里巴巴等公司提供的低价 API 的假设,但这意味着将数据发送给这些服务商。一旦涉及数据主权和安全性要求高的关键工作负载,自托管的复杂性和成本就会凸显。
这也解释了 Cohere 的核心战略:自己构建模型,并专注于为企业提供高度定制化的解决方案。Gomez 强调,Cohere 并不追求在“前沿模型”的烧钱竞赛中竞争,那是一场“必输的竞赛”。相反,他们观察到,模型本身往往已不是市场应用的瓶颈。
“前沿模型的能力已经远远领先于市场实际使用水平。即使你用的是一年前、18 个月前甚至两年前的模型,企业仍然在努力追赶这些能力。”因此,对于大多数企业任务,模型的能力已经“足够好”。真正的瓶颈在于市场如何消化和利用这些能力。而当企业确实需要更强大能力时,天价的前沿模型又让他们望而却步,转而寻求性价比更高的定制化模型。这种对成本、主权和定制化的综合需求,正是 Cohere 试图抓住的市场机会。
数字主权与民主联盟:对抗“单点故障”
访谈中最具战略高度的部分,集中在 AI 的地缘政治和“数字主权”议题上。Gomez 尖锐地指出,过去 30 年,以 G7 为代表的民主世界,其技术供给日益 consolidated(集中)于极少数(主要是美国)科技巨头。这构成了一个极其脆弱的系统。
“这是一个单点故障。作为一名计算机科学家或工程师,你学到的第一件事就是:不要构建单点故障。”Gomez 警告道。如果你关心民主事业,那么将 AI 能力扩散到其他 G7 国家或更广泛的民主联盟中,对于民主制度本身的韧性至关重要。“如果一个(供应源)倒下了,你需要确保有备份。”
他认为,此前 Anthropic 模型出口受限等事件,已经惊醒了那些对这类风险抱有天真想法的人。这凸显了“数字主权”的重要性——国家必须控制那些支撑其经济命脉(如电信、金融、医疗、电网、国防)的关键基础设施所依赖的 AI 能力。Cohere 与德国 AI 公司 Aleph Alpha 的合并,正是为了构建一个横跨加拿大和德国的“双总部”架构,旨在成为这种多极化民主 AI 能力联盟的一部分。
“我们有一个民主国家目前在 AI 领域领先,这很棒。但民主国家需要占据第一、第二、第三、第四……的位置,而现状并非如此。”Gomez 呼吁,中等强国需要联合起来,共同发展 AI 能力,这既是为了民主联盟的共同利益,也是为了在未来可能出现的“两个世界”的格局中,形成民主国家阵营的集体竞争力。
正视中国AI能力与未来的“同事”
在讨论外部竞争时,Gomez 特别提到了中国。他直言,那种将中国模型视为仅仅是西方模型“蒸馏”产物的看法是“自欺欺人”。“他们(中国模型)能力非常强,拥有政府提供的极其丰富的资源,而且只会获得更多资源。他们非常擅长构建这项技术。”他承认蒸馏技术可能起过作用,但中国 AI 的发展轨迹是独立且强劲的。这进一步强化了他关于民主国家需要建立多元、有韧性 AI 供应链的论点。
展望未来 12 到 18 个月的技术趋势,Gomez 认为变革将完全发生在企业工作方式内部。AI 智能体(Agent)将从目前软件开发者的“协作伙伴”角色,渗透到更多领域。人们将越来越多地与模型作为“同事”一起工作。
对于 AI 对就业的影响,他持谨慎乐观但密切关注的态度。他提到了“杰文斯悖论”——效率大幅提升的技术可能反而创造更多就业,因为需求会随之飙升。但他也承认,此次 AI 革命与以往不同,AI 在形态上更接近人类,因此其替代效应可能更强。“我希望能避免(大规模失业),但我们需要为此情景做好准备并制定应对工具”,如再培训计划、工作岗位保障等。
在这场坦诚的对话中,Aidan Gomez(艾丹·戈麦斯)不仅展现了一位技术先驱对行业本质的洞察,也勾勒出一位肩负地缘政治责任的科技企业家眼中的未来图景:一个技术持续演进但基础可能稳固、市场广阔但挑战重重、且必须在全球竞争与合作中谨慎寻求平衡的 AI 新时代。
OpenAI 联合创始人 John Schulman(约翰·舒尔曼):ChatGPT 本可提前数年诞生,RL 研究远未结束撰文:Techub News 整理
导语
2025 年 12 月,OpenAI 联合创始人、首席科学家 John Schulman(约翰·舒尔曼)做客 Cursor 播客,进行了一场长达 51 分钟的深度对话。作为强化学习(RL)领域的奠基人之一,以及从 OpenAI 早期一路走来的核心人物,John Schulman(约翰·舒尔曼)的视角极具历史纵深感和行业洞察力。他目前也是新兴 AI 公司 Thinking Machines 的联合创始人。本次对话不仅回顾了 OpenAI 那段“草莽”岁月中的成败得失,更对当前 AI 研究的前沿问题、机构管理哲学以及技术未来走向,给出了坦诚而富有启发性的回答。
摘要
凭借后见之明,一个由少数精英组成的团队,完全有可能在 2018 或 2019 年就打造出 ChatGPT 3.5 级别的模型。
OpenAI 早期项目“Universe”是一个“死胡同”,但其追求通用 RL 智能体的核心理念“超前了可能十年”。
价值函数在当前的 LLM 强化学习(如 RLHF)中作用有限,但未来可能会“卷土重来”。
理想的 AI 研究管理者没有固定模式,需根据团队目标、成员经验和研究阶段,在“深度技术参与”和“放手赋能”之间灵活切换。
AGI 时间线预测充满不确定性,工程师的乐观估计通常需要乘以 2-3 倍的“现实系数”,但 AI 加速自身发展又可能带来意外突破。
ChatGPT 的“时空穿越”:少数精英与提前数年
访谈从一个有趣的假设开始:如果让 OpenAI 创始团队带着今天的全部知识回到 2015-2016 年,他们能以多快的速度“速通”ChatGPT?John Schulman(约翰·舒尔曼)给出了一个惊人的答案:“你完全可以用少得多的计算资源做到这一点。”他提到像 nanoGPT 这样的项目已经证明了这种可能性。关键在于,通过更巧妙的技巧,尤其是更好的“训练后”(post-training)方法,如精细的微调和巧妙构建的数据集,可以有效“放大”计算能力,让一个规模小得多的模型达到相当好的效果。
当被追问具体需要多少人、多少 GPU 以及在何时能完成时,John Schulman(约翰·舒尔曼)估算道:“如果你有几位才华横溢的人,带着充分的后见之明工作一年左右……我认为你可以在 2018 或 2019 年,用几个人就做出达到 GPT-3.5 水平的东西。”他补充说,这还建立在可以利用他人已有的预训练数据集和网络爬取成果的基础上。他甚至畅想未来可能会出现更极端的“演示场景版 ChatGPT”,即一个文件就能完成从网络爬取到全天训练的全过程。
OpenAI 的“草莽”岁月:死胡同与必要的弯路
如今市值巨大的 OpenAI,在早期却是一个“非正式”甚至有点“杂牌军”气质的团队。John Schulman(约翰·舒尔曼)证实了这一点,形容早期更像一个学术小组,研究人员根据个人兴趣主导项目,通常是一到三人合作,产出论文或博客文章。同时,他们也怀有进行大型工程项目的抱负,并深受 DeepMind 如 AlphaGo 等项目工作方式的影响。
然而,并非所有项目都通向成功。他重点提到了一个早期“死胡同”项目——Universe。该项目旨在汇集大量不同的 RL 环境(如各种电子游戏、网页导航任务),构建一个庞大的数据集,通过联合训练得到一个通用的、强大的 RL 智能体。“有趣的是,我认为这是一个根本上正确的想法,但就是太早了,可能早了十年。”John Schulman(约翰·舒尔曼)总结道。当时系统笨重,模型从零开始训练,泛化能力差,最终未能成功。团队后来转向更聚焦的环境(如模拟视频游戏集),才取得了更好的进展。像机器人项目也曾是公司的“死胡同”,但从长远看,它们锻炼了团队执行大型工程和科研项目的能力。
在谈到早期的大型工程项目时,John Schulman(约翰·舒尔曼)提到了 Dota 项目,这是 OpenAI 早期首个真正成功的大型计算密集型项目,涉及复杂的系统工作,包括如何接入 Dota 环境、构建训练系统以及进行大规模并行和异步 RL 训练。
管理科研“特种部队”:没有标准答案的难题
随着 AI 科研日益成为大团队协作的“大科学”,研究管理者的角色变得至关重要。John Schulman(约翰·舒尔曼)认为这是一个“棘手的问题”,因为成功的管理模式多种多样,且领域本身在快速变化。
他观察到两种有效模式:一种是深度参与型,管理者亲自动手写大量代码,审阅所有下属的代码,提供详细的技术反馈;另一种是赋能放手型,管理者更像一个“共鸣板”,提供职业建议,保持团队积极性和动力,让成员自由探索。
“没有一种模式适合所有情况。”John Schulman(约翰·舒尔曼)分析道,如果团队从事探索性研究,且成员经验丰富,那么放手模式更合适;如果目标明确,或者团队成员经验尚浅,需要执行具体任务,那么深度参与、提供更多技术监督的模式可能更有效。
关于研究机构的文化溯源,John Schulman(约翰·舒尔曼)表示,OpenAI 可能更多借鉴了成员们之前工作过的地方(如谷歌、DeepMind)的经验,而非刻意研究历史上的成功实验室(如贝尔实验室、施乐帕克)。早期 OpenAI 更像“和平时期”,允许更多探索性工作;而近年新成立的许多公司则更多处于“追赶模式”,先复制当前技术前沿,这可能导致探索性研究“肌肉”锻炼不足。
强化学习的现在与未来:价值函数会卷土重来吗?
作为 RL 专家,John Schulman(约翰·舒尔曼)对当前 RL 在 LLM 领域的应用现状和未来方向进行了剖析。
他首先解释了为什么价值函数(Value Functions)在当前流行的 RLHF 等任务中不那么受欢迎:“它们似乎帮助不大。”价值函数的主要作用是方差缩减,但在当前任务集上,效果并不明显。他坦言不清楚具体原因,但预计价值函数未来会在某个时刻“卷土重来”。
对于持续学习(Continual Learning)这一挑战,John Schulman(约翰·舒尔曼)认为它包含多种类型(如运动学习、情景记忆、程序性记忆)。他预计上下文学习(in-context learning)和长上下文能力会持续改进,而像 LoRA 这样的参数微调技术将在此基础上发挥作用,尤其适用于需要大量容量和知识吸收的记忆类型。但他也指出,如果模型规模持续扩大,即使方法论不变,各项指标也会持续改善;当然,新方法可能会带来更优的缩放定律,加速持续学习。
关于 RL 研究的未来,John Schulman(约翰·舒尔曼)认为许多想法会经历“时尚轮回”,有些想法出现得过早未能兑现承诺,但之后可能再度流行。他特别提到离线 RL(Offline RL) 和仿真到现实(Sim-to-Real) 是很有趣的方向。当前 LLM 领域的 RL 某种程度上类似于 Sim-to-Real,即在多样化的模拟环境中进行大规模 RL 以求泛化到现实世界。他认为这项技术在机器人领域依然有效,并预计未来 LLM 领域也会重新重视从真实部署中学习。
AGI 预测与行业变迁:从“怪人”聚集到工程能力优先
对于炙手可热的 AGI 时间线预测,John Schulman(约翰·舒尔曼)表现出审慎的态度。他认同工程师和研究者在预估项目时间上存在系统性低估的倾向,通常需要乘以 2-3 倍的系数才能接近现实。参考自动驾驶技术的发展历程,他认为 AGI 可能比一些乐观预测来得更晚。
“另一方面,AI 加速自身发展的正反馈循环也可能颠覆直觉。”他补充道,考虑到这一因素,一些较短的预测时间线也颇具说服力。因此,他并不愿做出非常自信的预测,认为其中存在大量不确定性,例如人类理解进展的瓶颈等。
回顾 AI 领域人才构成的变化,John Schulman(约翰·舒尔曼)认为早期从业者“可能更奇怪一些”,因为当时 AI 的重要性不像今天这样是“传统智慧”,吸引了更多非传统职业路径和风险承受能力更高的人。如今,更多遵循常规职业路径、风险承受能力相对较低的人进入这个领域。同时,由于竞争激烈,入行门槛也水涨船高。
更重要的是,工程技能的重要性如今已超过以往。因为扩展现有简单想法并良好执行就能带来大量收益,且领域更加成熟,研究者通常是在他人代码库和基础设施上构建,而非从零开始。因此,拥有软件工程背景的人现在更具优势。
Thinking Machines 的蓝图:Tinker 与未来展望
在访谈的最后部分,John Schulman(约翰·舒尔曼)谈到了他目前联合创立的公司 Thinking Machines 及其推出的产品 Tinker。
Tinker 被描述为一个低层级微调 API,提供了一小组用于训练和采样的底层原语,让用户能够表达几乎任何想要的训练后算法,而无需担心 GPU、加速器或复杂的分布式系统问题。它类似于 OpenAI 和 Anthropic 提供的采样 API,但专注于训练环节。John Schulman(约翰·舒尔曼)希望未来的初创公司能够直接基于 Tinker 构建复杂定制模型,而无需自研基础设施。
目前,Tinker 主要面向对 ML 有深入了解、希望使用这些底层原语的资深用户。但团队计划不断改进,增加更多功能(如多模态输入输出),并构建更多工具和高级组件,使其未来变得更加用户友好,成为一个“全栈”解决方案。
关于 Thinking Machines 的未来,John Schulman(约翰·舒尔曼)透露,明年将看到公司自有模型的相关发布,同时 Tinker 平台也将持续增强。
NVIDIA 创始人 Jensen Huang(黄仁勋):AI 将重塑美国制造业,社会需要建立「新规范」撰文:Techub News 整理
导语
2026 年 6 月,NVIDIA 创始人兼 CEO Jensen Huang(黄仁勋)在出席其战略合作伙伴 Coherent 位于德克萨斯州谢尔曼市(Sherman)新工厂的奠基仪式期间,接受了美联社(Associated Press)的独家专访。这次采访不仅发生在 AI 算力基础设施投资的关键现场,更是在美国大选后、产业政策与全球技术竞争格局备受关注的时刻。作为全球 AI 浪潮的核心推手与市值最高的科技公司领导者,黄仁勋的言论深刻揭示了 AI 如何从技术概念演变为驱动实体工业复兴的核心力量,并触及了技术扩散与社会适应的根本性问题。
摘要
AI 是一场五层蛋糕式的工业革命,美国在芯片、基础设施和模型层领先,但在能源和应用层仍需努力。
社会需要为 AI 时代建立新的「社会规范」,就像汽车普及后建立了交通规则一样,这需要技术、法规和社会共识同步演进。
美国正迎来制造业复兴的「完美时机」,AI 驱动的需求将催生高端制造岗位,重塑经济结构,实现「信息工人」与「建造者」的平衡。
黄仁勋认为,确保国家安全与保持技术领先、经济繁荣三者可以并行不悖,关键在于精准施策而非全面封锁。
面对公众对 AI 的焦虑,他建议「先去尝试再下判断」,AI 是史上最能弥合数字鸿沟的技术,因其易得、易用且有免费层级。
AI 驱动的工业革命:五层蛋糕与制造业复兴
在黄仁勋看来,当前公众所见的 AI 模型(如 ChatGPT)只是「冰山一角」。他将完整的 AI 产业架构比喻为一个「五层蛋糕」:能源、芯片、基础设施、AI 模型和应用。这五个层面相互依存,共同构成了一场新的工业革命。
他特别指出,美国在这五个层面的竞争力并不均衡。在芯片、基础设施(如数据中心)和 AI 模型层面,美国「绝对是世界级的」。然而,在底层能源生产和顶层的行业应用上,美国却「落后了」。他认为,过去长期对能源生产的限制导致了今天的短板,而没有充足的能源,上层的一切 AI 基础设施都无从谈起。同时,在将 AI 技术转化为医疗、制造、机器人等具体行业应用方面,美国也尚未建立起世界级的优势。
这场工业革命的核心驱动力,是「63 年来计算机的首次重新发明」。黄仁勋解释道,自 1964 年 IBM System/360 问世以来,计算机的基本范式未曾改变。而如今,AI 计算机不再需要预先编程和记录所有信息,而是能够实时解决问题。这意味着,整个计算基础设施都需要被重建。「未来 10 年,我们将建造价值数万亿美元的新计算机,来取代过去 60 年建造的旧计算机。」
正是这种史无前例的基建需求,为美国的「再工业化」提供了绝佳契机。黄仁勋强调,这不是要回归传统的、竞争激烈的旧制造业,而是要抓住产业范式转换的窗口,建立全新的、高附加值的先进制造能力。Coherent 在谢尔曼的工厂正是这一愿景的缩影——这家全球最先进的 6 英寸磷化铟激光器工厂,将在一年内将产能提升至原来的四倍,以生产对 AI 数据中心至关重要的光互联芯片。「我们需要把建造者和制造者带回美国,而不仅仅是信息工作者。」
社会需要新规范:从「汽车与儿童」到全民拥抱 AI
当被问及公众对 AI 的担忧更多源于技术本身还是社会适应滞后时,黄仁勋给出了一个生动的历史类比:汽车。
「汽车刚出现时,我们也需要创造新的社会规范。」他回忆道,早期人们曾指责「汽车会杀死儿童」,因为孩子们习惯了在街上玩耍。随着汽车普及,社会逐渐建立起一套新体系:人行道、斑马线、安全带、交通法规,并教育孩子不要在街上玩耍。「所有这些社会规范、法规、更安全的汽车、技术……它们是同时发生的。」
他认为 AI 也将经历类似过程。技术本身需要变得更安全、更可靠(「更聪明、更安全、有更好的护栏、更基于事实」),同时社会也需要逐步形成如何使用、监管和与之共处的新规范。这是一个技术、法规和社会共识协同演进的过程。
对于当前普遍的 AI 焦虑,黄仁勋给出了直接的建议:「先去尝试再下判断。」 他认为 AI 是历史上最能缩小技术鸿沟的工具,因为它易于获取(联网即可)、有免费使用层级,并且极其易用。「你不知道怎么用 AI?那就直接走过去问它:『我不知道怎么用 AI,我该怎么用?』」他举例说,无论是木匠想成为设计师,还是小店主想创建网站,AI 都能提升个人能力。
他鼓励每个人亲自体验,而不是被恐惧阻隔。这种「拥抱变化」的态度,贯穿了他对技术革命的整体看法。
平衡的艺术:国家安全、技术竞争与政治
采访不可避免地触及了地缘政治与产业政策。关于美国政府对先进 AI 芯片的出口管制,黄仁勋首先肯定了国家安全是「首要问题」,出口管制若使用「精准且具体」,可以是一个有效的工具。但他也谨慎地补充,需要小心避免「过度使用」,以免产生意想不到的后果,损害美国科技行业的竞争力和全球地位。
对于中国市场,黄仁勋展现了务实与自信。他提到,在出口管制之前,NVIDIA 在中国拥有约 95% 的市场份额,并且「竞争得很好」。他认为,国家安全、技术领先和经济繁荣三者可以兼得。「这是一个错误的选择题……我们的国家长期以来一直在同时做这三件事。」他警告,如果主动放弃中国这个巨大市场,当地的竞争者将会成长为巨头,其能力最终会扩展到中国之外,美国将来仍需面对。
当话题转向他与前总统特朗普的关系时,黄仁勋显得坦诚而谨慎。他描述了与特朗普在佛罗里达的会面,称对方「极具魅力」,整个对话都围绕着「创造更多就业、美国再工业化、保护国家安全、让美国变得富裕」展开。黄仁勋表示,特朗普深刻理解「当公司成功、市场成功、行业成功时,你可以利用这种势头来资助再工业化并在美国创造更多就业」的逻辑。
对于因此可能引发的与民主党人的关系问题,黄仁勋的回应展现了其作为企业家的政治智慧:「特朗普总统是我们的总统,是我的总统。我相信每个美国人都应该希望我们的总统成功……因为当特朗普总统成功时,我们的国家就成功了。无论下一任总统是谁,属于哪个政党,我都会希望那位总统成功。」他将自己的角色定位为帮助国家议程实现的助力者。
未来十年:从「硅草原」到和谐社会的愿景
展望未来十年,黄仁勋描绘了一幅由 AI 驱动的社会经济图景。首先,支持能源增长的议程将使美国经济再次增长。其次,AI 将使美国能够投资可持续能源、升级电网,并重塑劳动力结构。
他特别强调社会结构的平衡:「你不能只有信息工作者……你也必须有建造者。不应该只有获得计算机科学博士学位才能找到好工作。」他认为,AI 驱动的再工业化将带来高技能、高薪酬的制造业岗位,让喜欢动手建造的人也能拥有 prosperous 的生活,从而实现更均衡、更有「社会和谐」的社会。
在技术层面,他着重强调了互联的重要性。未来的 AI 系统是「终极分布式计算问题」,需要将数百万处理器连接起来协同工作。当芯片之间的距离达到数百甚至数千英尺时,电互联不再可行,必须依赖硅光子学或光互联。这正是 Coherent 在谢尔曼工厂生产的核心部件——将电信号转换为光信号进行传输。他称这种技术对于扩展 AI 计算规模「至关重要」。
最后,当被问及人们对他最大的误解是什么时,这位全球科技偶像给出了一个出乎意料平实的答案:「我其实非常无聊。」他表示,自己的生活只是在关心家人和操心工作之间循环,最大的快乐就是与家人一起看电影,比如他最喜欢的《天国王朝》。这个回答或许揭示了他将庞大精力聚焦于单一愿景的秘诀:在喧嚣的革命性浪潮中,保持一种近乎单调的专注。
Cape CEO John Doyle:在已知被渗透的电信基础设施上,如何构建安全可信的蜂窝网络撰文:Techub News 整理
在2026 年 3 月a16z举办的一场对话中,美国海军首席技术官(CTO)Justin Fanelli与新兴安全电信运营商Cape的联合创始人兼CEO John Doyle进行了一场富有洞察力的交流。这场对话之所以重要,是因为它触及了两个关键且紧迫的议题:一是国家级对手对全球关键通信基础设施的深度渗透已成现实,二是国防机构正如何转变思维,以前所未有的速度吸纳商业创新技术来应对这些威胁。Cape在关岛的试点项目,正是这种新型公私合作模式的成功范本。
一、 危机浮现:从“盐风暴”到关岛困局
对话从一个令人震惊的事实开始。John Doyle分享了他去年在达沃斯世界经济论坛网络安全分论坛上的经历。当时,一位演讲者提到了名为“盐风暴”(Salt Typhoon)的高级持续性威胁(APT)组织,这是一个被认为隶属于中国政府的黑客团体。Doyle询问在场约60位网络安全专业人士,有多少人了解此事?结果只有5人举手。
“盐风暴”所揭示的,远不止一次普通的网络攻击。根据后续公开报道,该组织已经“全方位”渗透了美国主要的电信运营商。这意味着,攻击者实际上能够监听电话通话、获取通话详单、追踪互联网连接,甚至控制用于合法监听的接口。“他们可以随时打开开关进行监听,”Doyle强调,“想想你的手机上有多少生活内容?基本上全部。而我们现在了解到,这对美国的每个人都是如此,包括最高层人士。”
这一威胁在2024年美国总统竞选期间已现端倪,当时有报道称参议员J.D. Vance的电话遭到监听。更严重的是,攻击者还能获知哪些人正在被执法部门合法监听,这直接危及调查行动与相关人员安全。
这一宏观威胁在具体地点——关岛——变得尤为尖锐和棘手。关岛是美国在西太平洋的关键战略枢纽。Justin Fanelli指出,海军清楚地意识到关岛当地电信运营商可能已被渗透。然而,传统的“排查与清除”思路面临巨大挑战:在复杂如电信网络的系统中,很难确信自己找到了所有后门并彻底清除了威胁。
“与其试图在关岛现有的运营商网络中费力搜寻所有(中国)植入物,并尝试清除——而且永远无法确定是否完成或成功,”Doyle阐述了Cape的基本思路,“不如直接在现有物理基础设施之上,干净地安装一套电信网络。” 换言之,假设物理基础设施是敌对的,但通过上层的软件和架构创新,依然能提供可信的通信服务。这一想法成为了Cape与海军在关岛合作试点项目的核心。
二、 Cape的解法:构建“网络之上的网络”
那么,Cape究竟是什么?它如何实现其宣称的“更私密、更安全、更有韧性”?
John Doyle解释道,Cape是一个全球性的商业蜂窝网络,用户手机可以接入。它本质上是一个移动虚拟网络运营商(MVNO),但其中的“虚拟”(Virtual)是关键。Cape不拥有或建设物理蜂窝塔,而是从世界各地的现有运营商那里租用塔楼容量。在美国,这意味着与主流电信公司合作;在海外,例如近期宣布的与日本乐天移动的合作。
这种模式带来了独特的优势:
韧性:Cape构建了一个“网络的网络”,将不同物理基础设施提供商的资源编织在一起。因此,用户不依赖于任何单一供应商。Doyle提到,过去六个月中,美国三大电信运营商中的两家都发生了重大中断,但对Cape用户的影响则小得多,因为可以故障切换到其他网络。
安全:Cape团队在四年前创业时几乎没有任何电信行业经验,多来自国防科技背景。他们发现电信行业的网络安全现状“非常、非常糟糕”。因此,Cape选择在商业云上部署,采用行业最佳的网络安全实践,并对不符合安全标准的现成组件进行自研。Doyle自信地表示,从网络安全角度,Cape已“显著优于其他运营商”。
隐私:Cape在管理用户数据和手机标识符的方式上高度差异化。就像苹果为iPhone旋转MAC地址一样,Cape对其网络使用的多种标识符进行定期轮换,增加了用户追踪的难度。
关岛项目完美诠释了这一架构的价值。海军没有要求Cape去修复或清理现有网络,而是直接在其上叠加部署Cape的软件定义核心网。通过加密穿越可能被渗透的物理层,Cape为关岛的军事人员提供了可信的蜂窝连接。这个试点项目提前完成、未超预算,并达成了所有预设的成功指标(WHAMs)。
Doyle还分享了一个令人瞠目的故事,揭示了电信行业供应链的脆弱性。在建设自身网络时,Cape需要集成一个第三方供应商的系统,以响应执法部门的合法监听请求(这是法律要求)。这家供应商服务于众多大型电信公司。然而,Cape的站点可靠性工程(SRE)团队在评估该供应商提供的安装程序时,发现了一个未加密的文本文件,里面包含了该供应商所有客户的用户名和密码。“而这恰恰发生在‘盐风暴’新闻爆出的前三个月,”Doyle说,“我们后来得知中国攻破了所有这些主要电信公司的X1接口……现在看来,对他们来说似乎并不难。” 这件事促使Cape更换了供应商,并更坚定了自研与严格审核的决心。
三、 海军CTO的变革:从“建造者”到“园丁”,加速创新采纳
Cape能与海军快速达成合作并取得成功,离不开海军内部,尤其是Justin Fanelli所领导的团队,在创新采纳方式上的根本性转变。
Fanelli回顾,过去海军乃至整个国防部的采购体系严重依赖“需求轴”,即花费数年时间详细定义需求,过程缓慢。对于软件和快速发展的商业技术而言,这种模式已然过时。现在,海军正转向一种更灵活、更具前瞻性的“小赌注”模式:通过小型试点项目验证有潜力的技术,如果成功,再迅速扩大规模。
“我们以前更擅长自己建造一切,”Fanelli说,“现在我们正从‘建造者’转变为‘园丁’。” 他的团队致力于发现并培育有前景的技术种子,为它们在海军内部的应用扫清障碍。
这一转变的核心是改变内部流程与文化。Fanelli指出,过去负责采购飞机舰船的人员,习惯于用同样的漫长流程来采购软件。为此,他的团队与支持者一起,为项目经理和合同官员举办“训练营”,教授他们如何在3个月内完成过去需要18个月的事情。他强调,这不仅仅是外部初创公司需要学习如何与政府打交道,政府内部也需要进行“由内而外”的改革,消除瓶颈。
另一个关键工具是制定清晰、可衡量的“世界级对齐指标”(WHAMs),也就是成功标准。Fanelli坦言,如果技术介绍只停留在功能层面,而非聚焦于解决什么具体痛点、带来什么可衡量的作战或业务成果,就很难在决策链条中推动。在关岛项目中,双方花费了大量精力打磨这些指标,确保了目标一致,为后续顺利执行奠定了基础。
为了扩大创新规模,Fanelli的团队推行了“创新采纳工具包”,并鼓励形成“网络中的网络”。他们不再试图由一个小团队包揽所有创新发现,而是激活海军各社区(如弹药、机器人自主系统等领域)内部的“推动者”,并与外部投资者和生态系统保持紧密联系,共同识别和牵引新技术。
四、 给创业者的建议与未来的机会领域
对于有志于进入国防科技或军民两用领域的创业者,两位嘉宾给出了务实建议。
John Doyle指出,过去圈内有一种“传统智慧”:如果你要面向政府销售,应该最后才找海军,因为他们被认为采纳速度最慢。但这种情况正在改变。他建议创业者重视可共享的、非密的技术验证报告,就像DIU为关岛项目资助的第三方深度渗透测试报告那样。这类客观证据能极大加速技术在不同军种和政府机构间的传播与采纳。
Justin Fanelli的建议更直接:深入问题现场。“去圣地亚哥或诺福克,那里停泊着许多舰船。” 他建议创业者与最终用户(水兵、海军陆战队员)交流,倾听他们的痛点,参加黑客松,关注国防部发布的“结构化挑战”。关键在于找到那些“偏头痛”级别的、紧迫的真实问题,而不是轻微的不便。他还提到,软件领域存在大量“技术债”,许多陈旧系统亟待替换。如果一个新应用能整合并取代五个旧系统,将极具吸引力。
在机会领域方面,Fanelli提到了几个重点:
海事工业基础与分布式制造:通过3D打印等技术实现关键零部件的快速制造与维修,解决因单一小零件短缺导致昂贵装备停摆数月的问题,能产生巨大影响。
软件现代化:几乎所有软件领域都存在系统过多、用户体验不佳的问题。能够提供安全数据交付和直观用户界面,并能替代多个遗留系统的新方案,有很大空间。
对于有热情但暂无具体想法的创业者,Doyle建议可以先加入一家优秀的国防科技初创公司获取经验,而Fanelli则再次强调,深入一线发现问题本身就是最好的起点。
五、 结语:构建桥梁,共迎挑战
在对话的最后,Justin Fanelli用了一个比喻:匹兹堡是一座拥有数百座桥梁的城市,最初并非有意设计如此,但这些桥梁最终让城市受益匪浅。他认为,在当前这个对国家安全的支持达到空前水平的时刻,需要更多“桥梁建造者”——那些能够连接技术创新与国防使命、理解双方语言和需求的“战士工程师”和双语人才。
“我们更关注结果,我们可以衡量这些成果,”Fanelli总结道,“带来那些能形成‘压倒性优势’的方案,展示你能带来的改变。我们将提升价值、增强影响力、加强威慑。越多的人能够连接各个节点、说同样的语言,从国家安全和经济繁荣的角度来看,我们所有人的处境都会更好。”
这场对话清晰地表明,面对日益复杂严峻的网络威胁与地缘政治挑战,敏捷的商业创新与积极改革的政府机构之间的紧密合作,不再是可选项,而是必选项。Cape与海军的关岛合作,为这种新型伙伴关系提供了一个可复制的蓝本。John Joseph D'Agostino|Coinbase Institutional 策略负责人 (Head of Strategy) 确认出席「GWDC 2026 KOREA」Techub News 消息,GWDC 2026 KOREA SPEAKER 重磅宣布 John Joseph D'Agostino|Coinbase Institutional 策略负责人 (Head of Strategy) 确认出席「GWDC 2026 KOREA」。
John Joseph D'Agostino 现任 Coinbase Institutional 策略负责人,主导机构级数字资产服务、全球传统金融基础设施对接及资本市场战略拓展。Coinbase Institutional 作为全球领先的合规加密基础设施与托管平台,为顶级传统金融机构、对冲基金及主权基金提供安全、合规的数字资产交易、托管与主经纪商(Prime Brokerage)服务。John 凭借在纽约商品交易所(NYMEX)高管经历及全球衍生品市场数十年的深厚资历,持续推动传统资本向去中心化生态的规模化迁徙。
9月29-30日|首尔 aT Center,John Joseph D'Agostino 将与政商领袖、行业从业者与开发者齐聚大会分享前沿洞察,共塑 Web3 与 AI 的未来范式。
GWDC 2026 Korea 将于 2026 年 9 月 29 日至 30 日在韩国首尔 aT Center 举办。大会由 Web3Labs 主办,Techub News、HypaiLabs 与 TokenPost 联合主办,并获得香港-韩国Web3政策推动联盟支持。
本届大会以“For Builders, By Builders”为核心理念,聚焦 Web3、AI、链上基础设施与数字资产生态的技术创新和产业应用。大会将通过主题演讲、技术论坛、项目展示、商务对接及黑客松等活动,推动开发者交流、技术协作、资本连接与创新项目落地。
大会已同步开放参会报名与黑客松报名。黑客松预计吸引500+全球开发者参与,围绕真实链上任务展开,配备行业导师辅导及机构 VC 评审,并计划产出 100+创新项目;大会还将设置创新项目展示与 VC 对接,推动优质项目的全球化发布、流动性增长与生态建设。
门票申请:https://luma.com/cp87au4f
大会官网:https://www.gwdc.net
活动赞助:https://gwdcseoul.carrd.co/美国参议院 CLARITY 法案程序性投票未获通过,Circle 股价下跌 11.61%Techub News 消息,美国参议院周二对《数字资产市场清晰法案》(CLARITY 法案)的关键程序性投票(终止辩论动议)未能获得所需的 60 票支持,导致该加密市场结构法案无法进入下一阶段。法案旨在将数字资产的联邦监管权在 SEC 与 CFTC 之间进行划分。
稳定币发行商 Circle Internet Group 股价在投票后下跌 11.61%,至每股 86.11 美元。该公司被视为该法案前景最直接的股市风向标。XRP 和 Stellar 等加密资产在投票前因市场预期而上涨。
尽管此次投票失败,但法案进程并未终结。参议院领导人仍可安排新一轮投票,但并无强制规定必须在年底前进行。(BeInCrypto)美共和党参议员:特朗普同意加密法案道德条款Techub News 消息,美国共和党参议员 Cynthia Lummis、Tim Scott 和 John Boozman 宣布,总统特朗普已同意一项加密货币法案中的严格道德条款,包括允许州检察长参与执法及要求官员剥离加密货币资产。该法案将于本周二进行关键投票。
该条款最初禁止联邦民选官员及配偶持有数字资产,后因 Thom Tillis 等参议员要求增加州检察长执法权以解决利益冲突问题。尽管白宫曾担忧该权力可能被用作政治武器,但特朗普最终同意了约 80% 的提案内容,相关修订版法案已于周日发布。(ABC News)特朗普与约翰逊称AI行业反应过度,担忧暂停研发将让中国领先Techub News 消息,Anthropic CEO Dario Amodei 日前发表公开信,呼吁“控制前沿”并放慢 AI 发展速度,OpenAI 的 Sam Altman 与 Elon Musk 均公开表示支持。但美国前总统特朗普与国会众议院议长迈克·约翰逊认为,AI 行业高管反应过度,担忧暂停研发会导致中国在 AI 竞赛中超越美国。特朗普表示,美国在 AI 领域领先中国,并希望保持这一优势,因为“谁赢得 AI,谁就赢得未来”。(The Verge)AI 公司 Cohere 正进行高级谈判,拟融资高达 30 亿美元Techub News 消息,AI 公司 Cohere 正在进行高级谈判,计划融资高达 30 亿美元。此举旨在增强其在企业 AI 领域的竞争力,以挑战规模更大的全球竞争对手。
(Crypto Briefing)Cohere 发布 North Small Translate 翻译模型,覆盖 50 种语言Techub News 消息,AI 公司 Cohere 发布开源翻译模型 North Small Translate。该模型为稀疏专家混合模型,总参数量 2180 亿,激活参数量 250 亿,支持从阿尔巴尼亚语到越南语等 50 种语言。在 Cohere 的 WMT26 评估中,其平均得分为 83.6。
Cohere 表示,该模型性能优于 DeepL、Google Translate 以及 GLM 5.2 和 Mistral Large 3 等开源选项。模型可通过 Cohere API 免费调用(受速率限制),也可非商业自托管或商业授权使用。
根据 Cohere 公布的成本图表,该模型每项任务(平均 661 个词元)的成本为 0.000676 美元,而 Gemini 3.1 Pro Preview 的成本约为其 58 倍。 (MarkTechPost)Pi Network 发布 Pi Desktop 0.6.3 更新,优化 SoloHost 并增强 AI 代理支持Techub News 消息,Pi Network 核心团队发布了 Pi Desktop 0.6.3 版本更新,对 SoloHost 框架进行了多项重要改进。此次更新包括引入新的 AI 代理专用 SoloHost 代码仓库,旨在让 AI 工具更有效地协助开发者创建自托管应用。此外,社区应用将根据实时运行人数进行排名,开发者获得新的“我的应用”管理板块,并增强了 Docker Compose 支持与就绪探针功能。
团队表示,未来版本将统一称为 Pi Desktop 版本,而非 Pi Node 版本。此次更新是 Pi Network 将节点从区块链验证器转型为自托管应用、AI 及分布式计算平台基础设施的又一举措。Pi Network 的长期目标是让第三方应用能利用其超过 42 万个已声明的节点运营商的闲置算力。(CryptoPotato)苹果 CEO John Ternus 称 iPhone 仍是最佳 AI 设备Techub News 消息,苹果 CEO John Ternus 表示,iPhone 目前仍然是最佳的人工智能设备。该公司同时强调,其设备端模型能为用户提供更强的隐私保护。 (TechCrunch)MoneyGram 高管将出席 Solana Breakpoint 分享如何利用 Solana 革新跨境支付Techub News 消息,MoneyGram 高管 Anthony Soohoo 将出席 Solana Breakpoint 大会,分享该公司如何利用 Solana 网络的低费用和近乎即时的结算速度,重塑跨境支付业务。MoneyGram 是全球领先的跨境汇款服务商之一。
(@solana)纽约市议员Zohran Mamdani提案禁止AI在公立学校使用Techub News 消息,纽约市议员Zohran Mamdani提出一项法案,旨在禁止人工智能在纽约市公立学校中的使用。该提案涵盖从幼儿园到12年级的教育阶段,旨在限制AI工具在教学、评估及学生互动中的应用。
法案若通过,将成为美国主要城市中对教育领域AI应用最严格的限制之一。支持者认为此举可保护学生免受潜在偏见与数据隐私风险,但批评者担忧可能阻碍教育技术创新。(@Kalshi)撰文:Techub News 整理 导语 2017年,一篇名为《Attention is All You Need》的论文横空出世,其提出的 Transformer 架构彻底改变了人工智能的发展轨迹,开启了生成式 AI 的浪潮。八年后的2025 年 6 月,这篇论文的八位作者之一、当时还是一名大三本科生的 Aidan Gomez(艾丹·戈麦斯)已成长为估值数十亿美元的 AI 独角兽 Cohere 的 CEO。在 The MAD Podcast 主持人 Matt Turck 的深度访谈中,Gomez 首次详细揭秘了 Transformer 论文诞生背后的“意外”故事,并阐述了他为何坚信企业级 AI 而非追逐 AGI(通用人工智能)才是 AI 技术造福世界的正道。这场对话不仅是对 AI 发展史上关键节点的回顾,更是对当下 AI 商业化路径与未来趋势的一次深刻洞察。 摘要 Transformer 的诞生源于“行政错误”与有机合作:Gomez 进入 Google Brain 实习源于一场误会(其经理误以为他是博士生),而论文的诞生则是几个独立研究小组因共同兴趣自发合并、冲刺会议 deadline 的结果。 Transformer 架构统治力惊人,八年未遇挑战:Gomez 坦言,Transformer 的持久性“令人震惊”,其成功部分源于整个 AI 基础设施(包括芯片)都已围绕其优化,新架构的替代门槛极高。 “推理计算”是重大突破,但潜力远未挖尽:让模型在不同问题上分配不同“思考”时间的“推理计算”范式解锁了巨大能力,且实现成本远低于预训练,未来将在科学、医疗、企业自动化等领域发挥更大作用。 Cohere 押注企业 AI 而非 AGI“宗教”:Gomez 直言不喜欢 AGI 圈子的“角色扮演”和“新宗教”氛围,认为通过 AI 提升人类生产力、降低成本和改善服务(如医疗)才是更有意义的方向。 智能体(Agent)平台“North”是企业 AI 的核心:Cohere 的垂直整合战略使其能提供从底层模型(Command、Embed)到上层智能体平台(North)的全栈解决方案,并特别注重数据安全(支持本地/私有云部署)和多语言/多模态能力。 Transformer 诞生记:一场美丽的“意外” 2017年,还在多伦多大学读大三的 Aidan Gomez(艾丹·戈麦斯)通过一封“cold email”联系上了 Google Brain 的研究员,原因是他反复在阅读的论文作者栏看到这个名字。他提出了自己对论文的一些扩展想法,并由此获得了一个实习机会。“我经理以为我是博士生,”Gomez 回忆道,“所以我想我是通过一个行政错误进去的——我们通常不招本科生。”这个“错误”让他坐到了另一位论文合著者 Noam Shazeer 旁边,并加入了 Lucas Kaiser 的团队。 最初的项目是一个名为“One Model To Learn Them All”的多模态模型。在开发过程中,Gomez 和 Kaiser 构建了一个名为“Tensor2Tensor”的框架用于高效分布式训练,并成功说服了邻座的 Noam Shazeer 使用它。随后,他们发现 Google Translate 团队也在进行类似的研究。“我们意识到大家在做同一件事,”Gomez 说,“我们都关注基于文本的自回归模型,并且更纯粹地利用注意力机制,而不是之前那些复杂且有些‘丑陋’的 RNN、LSTM 模型。”于是,几个小组决定合并力量,专注于打造一个最简单、高效的基于注意力的语言模型——这就是 Transformer 的雏形。 论文的写作过程堪称“疯狂冲刺”。团队为了赶上顶级 AI 会议 NeurIPS 的投稿截止日期,进行了高强度的工作。“我们尝试了无数东西,修补了很多小 bug,”Gomez 举例道,比如最初纯注意力架构无法区分序列中元素的位置信息,是 Noam Shazeer 灵光一现,提出了在嵌入中添加正弦波来表示位置的方法——这个方案至今仍被广泛使用。 论文发表后,在自然语言处理(NLP)和机器翻译的小圈子内引起了兴奋,但当时远未达到后来革命性的广泛认知。对于 Google 为何没有更快地利用 Transformer 架构开发出类似 ChatGPT 的产品,Gomez 澄清道,Google 实际上迅速将 Transformer 应用到了搜索和翻译等核心产品中(如 BERT)。“准确的说法是,他们没有像 OpenAI 那样早期且独特地全力投入互联网文本的纯序列建模(即大规模语言模型预训练)。” Gomez 总结道。 Transformer 为何统治八年?生态锁定与极高的替代门槛 距离论文发表已过去八年,Transformer 架构依然是 AI 领域的绝对主流,这一点连 Gomez 本人都感到“震惊”。“我们今天训练的 Transformer 和当年的看起来如此相似,”他说。他认为,这并非因为研究社区缺乏新想法,而是一个“自我实现的预言”或“强化循环”。 整个 AI 社区对 Transformer 的热情催生了专门为其优化的庞大基础设施堆栈。“我们现在甚至有专门为该架构优化的芯片,”Gomez 指出。因此,要转向一种新架构,需要付出巨大的努力和能量去重写一切。“新架构必须提供极其令人信服的理由(才能取代它),而我们还没找到那个架构。”他坦言,替代的门槛已被推得极高。 Gomez 本人也曾热切期待 Transformer 的继任者。他甚至将 Cohere 纽约办公室的一间会议室命名为“SSM”(状态空间模型),坚信它将是替代者。但现实是,Transformer 就像一个“伟大的艺术家”,不断吸收其他架构(如 SSM、扩散模型)中的优秀思想,并将其整合进自身,从而持续进化,保持了领先地位。 推理计算:一个“显而易见”却改变游戏规则的想法 近半年来,“推理计算”(Test-Time Compute)或“思维链”推理成为 AI 领域的热点。但在 Gomez 看来,这其实是一个酝酿已久且“显而易见”的方向。“我们已经知道它要来好几年了,”他说。 其逻辑在于:在引入推理能力之前,语言模型对所有输入(无论是“1+1”还是“治愈癌症”)都分配相同的“能量”和即时响应时间。这显然不合理。不同复杂程度的问题理应获得不同的“思考”资源。推理计算正是让模型能够根据问题复杂度,动态分配计算步骤(“思考时间”)的范式。 “它的有效性令人惊讶,”Gomez 评价道。模型仅需极少量的人类示范(如何一步步思考),就能自己掌握推理方法,从而解锁了前所未有的能力。更关键的是,实现推理能力的成本“远低于预训练”,使得智能提升变得“非常容易获得”。 然而,Gomez 认为这仅仅是开始。“我们只是触及了表面。”目前的研究主要集中在数学和编程领域,但在医学、物理、化学等纯科学领域,以及企业自动化场景中,还有巨大的空白等待探索。“所有有趣的问题都需要推理。” 从研究到创业:为何 Cohere 选择“枯燥”但重要的企业 AI 在目睹了早期大规模语言模型展现出的惊人能力后,Gomez 联系了他在 Google Brain 结识的两位朋友 Nick 和 Ivan,共同创立了 Cohere。与许多同期涌现的、目标直指 AGI 的明星实验室不同,Cohere 很早就确立了企业 AI 的方向。 “我从来不喜欢整个 AGI、有效利他主义圈子的氛围,”Gomez 直言不讳,“感觉像在角色扮演,像人们在创立一种新宗教……‘创造上帝’这类东西。我不喜欢那种精神气质。”相比之下,企业级应用或许听起来“枯燥”,但他认为其意义远为重大。 “提升人类生产力,让人类能做更多事,增加供给,降低事物成本,让人类成就更多——这些远比‘建造上帝’或‘从 AI 手中拯救世界’更激励我。我想用 AI 来拯救世界。” Gomez 阐述了他的理念。他希望通过 AI 让医生花更少时间写病历、填表格,而将更多时间用于诊治病人;为医生配备能帮助他们研究罕见病例的智能体。他的目标是让这项技术在全球经济中真正发挥作用。 当然,作为行业领军者,他无法完全避开关于 AGI/ASI(人工超级智能)的讨论。但他认为,AGI 的定义模糊且不断变化。“我认为我们在很大程度上已经拥有了 AGI。”他举例说,如果在他和 Cohere 的模型之间选择谁来诊断开药,理性的选择肯定是模型。“我保证它懂得比我多。”AI 已经在许多方面比普通人更聪明,并且未来在某些领域超越最顶尖的人类专家也是必然趋势。“我反对那些贩卖末日论调的人,”Gomez 总结道,“技术进步意味着什么?其切实的影响才是关键。” Cohere 的全栈蓝图:模型、智能体与安全优先 Cohere 采取了一条垂直整合的道路。其核心是自研的模型层:包括生成模型 Command(对标 GPT、Llama 等)和搜索模型系列(Embed V4, Rerank 3.5)。这些模型构成了其智能体平台“North”的基石。North 允许企业构建能接入内部所有软件和数据的 AI 智能体,让其去完成具体任务。 Gomez 特别强调了 Cohere 在安全部署上的独特优势。与许多提供 API 调用服务的竞争对手不同,Cohere 可以将其模型直接部署在客户的硬件上,无论是在客户的云虚拟私有云(VPC)中,还是为受监管行业部署在本地数据中心。“这带来了巨大的解锁效应,”Gomez 解释,因为 AI 智能体需要访问企业的核心数据(邮件、文档、客户记录等),数据不出境、完全私有的部署模式让客户更放心地接入更多关键系统,从而发挥 AI 的最大价值。 在模型训练数据方面,Gomez 证实了合成数据已成为主流且效果卓越。“合成数据现在是我们训练 Command 等模型所用数据的主要部分,而且在许多情况下,它实际上比人类数据更有用。”他举例说,人类回答问题时往往简洁(如直接回答“11”),但人类实际上更喜欢模型那种充满同理心、耐心细致的回答风格。因此,他们需要用模型来重写人类答案,以生成风格更优的训练数据。 此外,Cohere 在多语言和多模态上也投入颇深。其 Cohere For AI 实验室发布了支持超百种语言的模型。Gomez 指出,日语、韩语等市场被严重低估,现有技术无法满足其企业级文档处理需求。因此,Cohere 选择与富士通(日本)、LGCNS(韩国)等地区巨头合作,开发针对当地语言和企业场景的定制模型。多模态能力也被视为企业场景的“入场券”,对于理解包含图表、幻灯片的 PDF 文档以及实现计算机视觉操控(让 AI 使用图形界面)至关重要。 智能体(Agent)的现在与未来:从研究到落地 Cohere 的智能体平台 North 目前处于早期访问阶段。Gomez 将其描述为一个“完全私有化、高度可定制、原生支持推理的消费级聊天机器人升级版”。它可以集成企业内部的任何软件,并花时间(几分钟甚至几十分钟)进行深度研究、筛选数据以完成任务。 他分享了一个生动的用例:财富管理。当突发事件(如战争、新关税)爆发时,理财经理的客户会纷纷来电询问对策。经理通常需要花费数周时间研究并制定对冲组合方案,但市场瞬息万变,等方案出炉可能已错过时机。North 这样的智能体可以极快地阅读海量分析报告和新闻,迅速提出初步方案,人类经理在此基础上进行修改和决策,将周期从数周缩短到数小时。 面对智能体能力泛化可能带来的“选择困难症”,Gomez 观察到市场已经发生了变化。“早期客户会问‘AI 很酷,董事会给我压力,我该用它做什么?’我们需要帮他们识别机会。但现在,客户的成熟度大大提高了。他们很清楚自己要做什么,只需要一个合作伙伴来帮他们执行这个路线图。”许多大企业会带着数百个已识别的用例来找 Cohere。 当然,智能体并非万能。Gomez 指出,在医疗、金融等敏感领域,必须保持“人在回路”的监督。此外,在需要真正突破性科学发现(如解决千年数学难题、发现新化合物)的领域,AI 目前还无法提供核心帮助,但他相信这一天很快就会到来。 CEO 的展望:技术乐观主义与社会关切 当被问及什么让他夜不能寐时,Gomez 的答案出人意料地并非技术挑战。“让我睡不着的是政治,”他说,“是世界各地出现的分裂……我主要担心我们的社会、自由民主制度。我为自由主义过去一个世纪取得的进步感到担忧。” 但他对 AI 持乐观态度,认为 AI 可以成为一股强大的向善力量,帮助“好人”获胜,并解决过去十五年来全球经济面临的一些问题,如生产力增长缓慢、财富分配不均等。 对于 Cohere 未来三到五年的成功愿景,Gomez 希望看到 AI 技术带来可衡量的 GDP 和生产力增长,希望这项技术能在全球范围内整合,成为每个人日常工作的一部分,而不仅仅是娱乐或搜索工具。“我希望它能帮助人们成就更多,让东西变得更便宜、更丰富。”这或许正是这位从一场“意外”中走出的 AI 先驱,为其所创造的技术所描绘的最朴实也最宏大的蓝图。
