Google Brain 联合创始人 Jeff Dean(杰夫·迪恩):从早期神经网络到“百万教师教一个学生”的AI愿景撰文:Techub News 整理
导语
2025 年 8 月,谷歌传奇工程师、Google AI 负责人及 Google Brain 联合创始人 Jeff Dean(杰夫·迪恩)做客 X(原谷歌 X)工厂的“Moonshot Podcast”节目,进行了一场深度对话。作为谷歌最早的工程师之一,Jeff Dean(杰夫·迪恩)亲历了谷歌从搜索引擎到 AI 巨头的整个演变过程,尤其在推动谷歌大脑项目及定制 AI 芯片(TPU)方面发挥了关键作用。此次访谈不仅回顾了神经网络从冷门到主流的技术跃迁,也展望了 AI 未来在教育、医疗及社会协作层面的巨大潜力,为理解当今 AI 浪潮的源起与方向提供了宝贵的一线视角。
摘要
回顾 Google Brain 诞生:源于与 Andrew Ng(吴恩达)的一次偶然对话,目标是利用谷歌的计算资源规模化训练神经网络。
早期突破:通过“模型并行”与“数据并行”策略,训练出当时规模空前的神经网络,在图像识别和语音识别任务上取得飞跃性进步。
硬件创新:因预见 AI 计算的巨大需求,推动开发了专为机器学习设计的张量处理单元(TPU),最初仅支持 8 位整数运算。
核心技术演进:从词向量、序列到序列模型,最终到 Transformer 和注意力机制,奠定了现代大语言模型的基础。
未来愿景:AI 将成为个性化的“苏格拉底式”伙伴,并通过“百万教师教一个学生”的模式,让全社会的知识贡献普惠于所有人。
少年工程师与神经网络初遇
Jeff Dean(杰夫·迪恩)的编程之路始于童年。由于父亲是医生且对计算机在公共卫生中的应用感兴趣,他九岁时家里就有了一台需要自行焊接组装的 kit 电脑。通过键入书本上的 BASIC 游戏代码并修改,他初次领略了编程的乐趣。青少年时期,他通过明尼苏达州的学校计算机网络,早早体验了多用户在线聊天和互动游戏,这几乎是互联网普及前二十年的“虚拟社交”雏形。
他回忆第一个非 trivial 的编程项目是在十三四岁时,将一位博士生为大型机写的 Pascal 多用户游戏源代码,移植到自家带有多个终端的 UCSD Pascal 系统上。这个过程迫使他学习处理多端口中断、多终端输入调度等并发问题,虽然是在“胡乱摸索”中完成,却为他日后处理分布式系统奠定了基础。
在明尼苏达大学高年级时,Jeff Dean(杰夫·迪恩)选修了一门关于分布式和并行编程的课程,并由此首次接触到神经网络。那是1990年,神经网络因其高度并行的计算形式和解决某些模式匹配任务的潜力而令人兴奋。他被这个“ loosely based on how real brains work”的抽象所吸引,并以此为课题完成了关于并行化神经网络训练的荣誉论文,探索了后来被称为“数据并行”和“模型并行”的两种方法。尽管当时需要的是“百万倍”而非“32倍”的计算能力,但神经网络作为“正确抽象”的信念,已在他心中埋下种子。
Google Brain 的诞生与早期规模化探索
Jeff Dean(杰夫·迪恩)的职业路径充满了对新鲜领域的探索。从公共卫生软件到编译器研究,他最终在2011年左右,因负责的 Spanner 分布式存储系统趋于稳定,开始寻找下一个挑战。一次在微型厨房与当时在 Google X 兼职的斯坦福教授 Andrew Ng(吴恩达)的偶然交谈,成为了转折点。Andrew Ng(吴恩达)提到他的学生在使用 GPU 的神经网络上,于语音和视觉应用取得了有趣成果。Jeff Dean(杰夫·迪恩)当即回应:“我喜欢神经网络,我们应该训练真正大的神经网络。”
这便是 Google Brain 团队的雏形。他们的核心假设很简单:规模是关键。Andrew Ng(吴恩达)从学生工作中已知,只要让神经网络变得更大,效果就会更好。但他们缺乏的是将这一想法推向谷歌数据中心级别规模的能力——这正是 Jeff Dean(杰夫·迪恩)的专长。团队最初利用数据中心里2000台计算机(16000个CPU核心),因为没有现成的 GPU,来训练分布式神经网络。
他们早期训练了一个拥有20亿参数、用于计算机视觉的“局部感受野”模型。为了处理如此庞大的模型,他们采用了复杂的模型并行策略:将模型在图像的空间维度(X和Y方向)上切分,一个13x13的机器网格(共169台机器)负责处理模型的不同部分,每个“副本”处理一批随机数据。为了协调这些副本并确保参数收敛,他们引入了“参数服务器”(Parameter Server)的概念。通过这种方式,他们成功训练了比当时主流模型大50倍的神经网络。
标志性的成果是著名的“猫神经元”发现。团队使用无监督学习算法,用1000万个随机 YouTube 视频帧训练模型,让模型学习从原始像素中提取高层特征。在最高层的特征中,他们发现有些神经元会对“猫”的图像产生强烈反应,这意味着模型通过纯粹的优化过程,自发“发明”了“猫”的概念。这项成果登上了《纽约时报》,成为 AI 发展的一个标志性时刻。
更实际的影响体现在性能突破上。使用这个巨大视觉模型进行少量监督微调后,他们在 ImageNet 的2万类别基准上实现了60%的相对错误率降低。在语音识别方面,用神经网络替换传统声学模型后,取得了30%的词错误率相对改进——这相当于过去20年语音研究进展的总和。这些成果以惊人的速度攀升各类基准排名,让谷歌内部乃至整个行业看到了深度学习的颠覆性潜力。
从软件到硬件:TPU 的诞生与架构演进
惊人的效果伴随着高昂的计算成本。Jeff Dean(杰夫·迪恩)做了一个思想实验:如果因语音识别变好,有1亿人每天对手机说话3分钟,部署当时基于 CPU 的模型所需的计算量将是天文数字。他意识到必须有更高效的方案。
神经网络的两个特性为专用硬件指明了方向:一是其主要由少量线性代数操作(如矩阵乘法)构成;二是其对计算精度不敏感,可以容忍较低的数值精度。基于此,最初的 TPU(张量处理单元)被设计为仅支持8位整数运算的推理专用芯片,完全没有浮点单元。后来的版本才加入了名为“bfloat16”的降低精度浮点格式,这种格式牺牲尾数精度保留指数范围,更适合神经网络的需求。
TPU 的开发也标志着 Google Brain 项目从 Google X 回归谷歌核心。初期团队在 X 大楼起步,但随着成果在搜索、语音、视觉等核心产品中展现出巨大价值,回到主园区并与产品团队更紧密协作变得顺理成章。
语言理解的突破:从词向量到 Transformer
Jeff Dean(杰夫·迪恩)梳理了自然语言处理领域的几个关键突破。首先是词向量(Word2Vec),它将单词表示为高维空间中的向量,使得“国王 - 男人 + 女人 = 女王”这样的语义代数成为可能,揭示了语言中潜在的方向性结构。
其次是序列到序列模型,它使用 LSTM(长短时记忆网络)将一个序列(如英语句子)编码为一个向量状态,再从此状态解码出另一个序列(如法语句子)。这不仅是机器翻译的突破,也适用于医疗记录、基因组序列等多种序列映射任务。
最重要的飞跃来自Transformer 架构和注意力机制。2017年发表的《Attention Is All You Need》论文提出,与其在每一步更新一个单一的状态向量,不如记住所有中间状态向量,并让模型学会在需要时“注意”它们。虽然注意力计算量随序列长度呈平方级增长,但它带来了两大好处:一是允许并行处理整个序列,极大地发挥了现代 ML 处理器中矩阵单元的并行能力;二是产生了更强大的模型。Transformer 成为了当今所有大型语言模型的基石。
未来展望:AI 作为伙伴与“百万教师”愿景
谈及 AI 的未来影响,Jeff Dean(杰夫·迪恩)更倾向于讨论具体的能力和场景,而非抽象的“AGI”(通用人工智能)概念。他认为,AI 正在从单纯处理文本转变为真正的多模态系统,能够理解并生成语音、图像、视频等多种形式的内容。例如,用户可以要求模型“生成一段独角兽跳过校车、并且前面有我的狗的视频”,并附上狗的照片。
更根本的转变在于人机协作模式的改变。人类的工作重心将从“制造事物”转向“具体指定需求”。当前的“提示工程”将演变为我们主要的工作方式。AI 可以充当“苏格拉底式”的伙伴,帮助人类探索想法、生成正反论据、撰写报告或创作内容。他举例说,可以要求 AI “总结过去20年风能和太阳能的趋势、价格变化以及南美洲的部署情况”,AI 能够综合多方信息,完成过去需要人类大量时间的工作。
在更宏大的社会层面,Jeff Dean(杰夫·迪恩)分享了一个他特别认同的愿景:“如何实现一百万名教师教导一个学生?”这里的“学生”指的是强大且持续学习的 AI 模型。全世界的每个人都可以在某些方面“教导”这个模型(例如提供高质量数据或反馈),而全人类都将受益于这些教学产生的更智能、更有用的模型。这需要建立机制,让数据贡献者能因其贡献的价值获得相应的补偿,尤其是那些提供新颖、真实、高质量信息的贡献。
同时,他也清醒地认识到 AI 带来的挑战,如深度伪造、 misinformation(错误信息)的泛滥,以及在医疗等领域的隐私问题。他认为,技术界和社会必须共同思考如何塑造 AI 的发展,以最大化其在教育、医疗等领域的积极影响,同时通过技术和政策手段,尽可能减少其负面影响。
模型的“可解释性”与 Jeff Dean 的下一个五年
随着模型变得极其庞大和复杂,理解其内部决策过程(即可解释性)的挑战日益突出。Jeff Dean(杰夫·迪恩)认为这有点像神经科学,但优势在于我们可以任意探测和测量这个“数字大脑”。他设想未来的解释方式可能更偏向交互式对话:用户可以追问模型“你为什么做出这个决定?”,模型则能回溯并解释其推理链条中的关键步骤,就像程序员调试时追踪变量值一样。
对于“AI 何时能自主实现科学突破”这一问题,他认为在某些具备清晰反馈循环、可快速评估想法的领域,这一天并不遥远。强化学习和大规模计算搜索在这些领域已显示出强大能力。但在那些评估周期长、奖励信号不明确的领域,还需要更多进展。
谈及个人规划,Jeff Dean(杰夫·迪恩)延续了他每五年左右深入一个新领域的风格。他目前关注的下一个方向是:如何让最强大的 AI 模型变得成本效益极高,从而能够部署给全球数十亿人使用。他认为目前最先进的模型计算成本仍然较高,他有了一些初步想法,希望能在这方面取得突破,让尖端 AI 能力真正实现普惠。ClickUp 发布AI助手 'Brain²',自动执行文档、代码及仪表盘等任务업무 협업 플랫폼 클릭업(ClickUp)이 인공지능 비서 ‘브레인²(Brain²)’를 공개했다. 단순히 질문에 답하는 수준을 넘어, 한 번의 프롬프트로 프레젠테이션 자료와 대시보드, 웹사이트, 실행 가능한 코드까지 만들어내는 것이 핵심이다.
클릭업은 13일 자사 플랫폼 내 AI 기능을 대폭 개편했다고 밝혔다. 새 시스템은 클릭업 워크스페이스 안에 저장된 정보를 직접 맥락으로 활용하고, 작업 성격에 따라 여러 대규모언어모델(LLM) 사이에서 적합한 모델로 업무를 자동 분배한다. 회사 측은 이를 통해 AI가 ‘무엇을 아는가’에서 나아가 ‘실제로 일을 처리하는가’ 단계로 진화했다고 설명했다.
제브 에번스(Zeb Evans) 클릭업 창업자 겸 최고경영자(CEO)는 “범용 AI는 사용자의 실제 업무를 알지 못한다”며 “브레인²는 선택한 모델이 워크스페이스 전체 맥락에 접근해, 단순 답변이 아니라 실제 작업을 수행할 수 있게 한다”고 말했다.
이번 개편은 클릭업의 공격적인 AI 확장 전략의 연장선에 있다. 이 회사는 지금까지 5억3000만달러, 원화 약 7908억원을 조달했으며, 기업공개(IPO) 의지도 공개적으로 밝혀왔다. 최근에는 기업용 검색 스타트업 카탈로그(Qatalog Inc.)와 AI 코딩 스타트업 코드젠(Codegen Inc.)를 잇달아 인수하며 업무 데이터 이해력과 소프트웨어 개발 자동화 역량을 끌어올렸다.
특히 카탈로그의 ‘액션쿼리(ActionQuery)’ 엔진은 100개 이상 외부 소프트웨어 플랫폼과 연동되는 권한 인식형 AI 검색 기술로 알려져 있다. 클릭업 AI 총괄 제이 핵(Jay Hack)은 “브레인²는 모든 정보를 무조건 보는 구조가 아니라, 사용자가 접근 권한을 가진 정보만 실시간으로 가져온다”며 “색인 지연 없이 정확한 데이터에 접근하는 것이 기반”이라고 설명했다.
여러 AI 모델을 자동 조합…‘정답 근거’까지 함께 제시
이전 버전의 클릭업 브레인은 클로드, 챗GPT, 제미나이 같은 외부 AI 모델 접근을 사용자가 직접 설정해야 했다. 반면 브레인²는 워크스페이스 맥락을 자동으로 주입하고, 작업 과정 중에도 단계별로 더 적합한 모델로 전환할 수 있다.
클릭업은 이를 위해 빠르고 정확한 맥락 검색을 보장하는 ‘최적화된 컨텍스트 그래프’를 도입했다고 밝혔다. 핵은 “AI가 답을 만들기 전에 먼저 ‘사실 기반 정보’에 노출되도록 설계했다”며 “브레인²는 응답 생성에 활용한 출처도 선제적으로 제시해 사용자가 결과를 쉽게 검증할 수 있다”고 말했다.
여기에 지속형 메모리 기능도 추가됐다. 이에 따라 시스템은 세션이 바뀌어도 사용자 선호, 문서 서식 규칙, 조직 맥락 등을 유지할 수 있다. 매번 새로 학습시키듯 지시할 필요가 줄어드는 셈이다.
클릭업은 또 ‘모델 컨텍스트 프로토콜(MCP)’ 지원을 통해 플랫폼 밖으로도 브레인의 활용 범위를 넓혔다. 이제 Gmail, 깃허브(GitHub), 피그마(Figma), 슬랙(Slack) 같은 외부 도구의 데이터에도 접근할 수 있다.
‘무조건 맞장구’ 대신 반론 제시…기업용 AI 신뢰성 경쟁 본격화
브레인²의 또 다른 특징은 클릭업이 ‘안티-사이코팬시’라고 부르는 시스템 프롬프트다. 쉽게 말해 사용자의 결정을 무조건 긍정하거나 맞장구치는 대신, 필요하면 문제점을 지적하고 반론을 제시하도록 설계한 것이다.
핵은 일부 상용 LLM이 사용자 참여를 늘리기 위해 발언이나 결정을 강화하는 경향이 있다며, 실제 업무에는 ‘비판적 질문’과 ‘건설적 토론’이 더 중요하다고 짚었다. 그는 “브레인²는 친절한 보조자이지만, 듣기 좋은 말만 하며 진실을 가리지 않는다”고 말했다.
이 같은 접근은 최근 기업 시장에서 커지는 우려와 맞닿아 있다. 일부 AI 모델이 잘못된 판단까지 강화할 수 있다는 비판이 커지면서, AI 공급업체들에는 투명성과 거버넌스를 높여야 한다는 압력이 커지고 있다. 클릭업은 브레인 에이전트가 같은 플랫폼 안에서 작동하기 때문에 모든 행동이 가시적이고 감사 가능하다고 강조했다.
회사는 이와 함께 iOS와 안드로이드에서 동일한 AI 기능을 쓸 수 있는 독립형 모바일 앱 ‘브레인 맥스(Brain Max)’도 내놨다. 비용 부담을 줄이기 위해 정보 전송 전 지식 그래프 크기를 압축하는 자체 기술도 적용했다. 클릭업에 따르면 이를 통해 운영 비용은 사용자당 약 0.91달러, 원화 약 1358원 수준으로 낮췄고, 사용량이 늘수록 질의당 비용은 더 내려간다.
클릭업은 브레인²와 브레인 맥스를 즉시 사용할 수 있다고 밝혔다. 현재 플랫폼에는 1100만개 이상의 에이전트가 올라와 있으며, 연간 반복 매출(ARR)은 3억달러, 원화 약 4476억원을 넘어섰다고 설명했다. AI 관련 매출도 빠르게 늘고 있어, 노션, 슬랙, 아사나와의 생산성 플랫폼 경쟁이 한층 치열해질 전망이다.
TP AI 유의사항
TokenPost.ai 기반 언어 모델을 사용하여 기사를 요약했습니다. 본문의 주요 내용이 제외되거나 사실과 다를 수 있습니다.Braintrust,B轮融资筹集8000万美元……加速AI观测平台创新开发人工智能原生观测平台的初创公司Braintrust Data Inc.近日成功获得8000万美元(约合1.152万亿韩元)的中期阶段投资,公司估值已达8亿美元(约合1.152万亿韩元)。本轮B轮融资由Iconiq领投,安德森·霍洛维茨基金、格雷洛克风投、Basecase资本及Elad Gil等机构参与投资。
Braintrust开发了一个能够监控人工智能模型与产品的平台。与传统系统状态监控方式不同,该平台追踪人工智能模型的质量与输出结果,监测因错觉、变异或退化导致的准确性下降问题。联合创始人兼首席执行官安库尔·戈亚尔强调,现有工具已无法适应人工智能原生环境的需求,这使得嵌入工程工作流的系统以及驱动各类产品的模型正超越传统工具的局限。
Braintrust整合了多种关键观测工作流程,包括能自动捕获各人工智能模型或智能体推理过程的追踪工具。该平台可自动评估模型输出,提供基于真实数据的测试环境,从而在部署前确保最优结果。同时,公司正在开发一款人工智能助手,能在监督智能体的过程中协助优化提示建议、生成新数据集并识别特定错误模式。
安库尔·戈亚尔透露,Braintrust已与Notion Labs、Replit、Cloudflare、Ramp、Dropbox等数十家人工智能原生企业展开合作,协助其监控人工智能部署情况。作为支持服务的一部分,Braintrust通过紧密的客户协作持续收集并整合产品改进反馈。
通过此次融资,Braintrust计划扩充工程与市场拓展团队,推出新型观测工具,并谋求进军海外市场。Delphi Digital 分享非植入式脑机接口研究进展与挑战Techub News 消息,Delphi Digital 在 X 平台分享了一项关于非植入式脑机接口的研究进展与挑战。该研究探讨了仅通过想象运动来控制机器的可能性,但指出构建无需植入物的神经接口十分困难。
研究指出,当大脑信号到达头戴设备时已经减弱,并且会与面部运动和附近电子设备的电活动信号混合,这构成了技术上的主要挑战。该研究旨在探索更便捷、无创的人机交互方式。 (@Delphi_Digital)斯坦福大学研究人员成功培育出人鼠混合大脑Techub News 消息,斯坦福大学研究人员通过基因改造小鼠,使其能够接收并运作人类脑细胞,成功培育出部分人类、部分小鼠的混合大脑。这项科学突破为研究人类脑部疾病和神经功能提供了新模型。(BBC News)斯坦福大学成功培育出部分人脑细胞功能的小鼠模型Techub News 消息,斯坦福大学研究人员通过基因编辑技术,成功培育出能够接收并运行人类脑细胞的小鼠模型。这项突破性研究为神经科学和脑部疾病治疗提供了新的实验平台。
该模型允许人类脑细胞在小鼠大脑中存活并发挥功能,有助于科学家更深入地研究人脑发育、神经系统疾病以及潜在的治疗方法。研究人员表示,这一进展可能推动阿尔茨海默症、帕金森病等脑部疾病的研究进程。(BBC News)中国 PhysBrain 1.5 登顶全球开源榜,空间智能比肩 GPT-6 AstraTechub News 消息,中国公司推出的物理 AI 大模型 PhysBrain 1.5 在全球开源榜单上排名第一,其空间智能能力与 OpenAI 的 GPT-6 Astra 并驾齐驱。该模型在物理闭环中最具挑战性的环节取得突破,标志着中国在物理 AI 领域的重要进展。
PhysBrain 1.5 的成功展示了中国在人工智能前沿研究方面的实力,特别是在需要深度理解物理世界和空间关系的复杂任务上。这一突破可能为机器人、自动驾驶和具身智能等领域的应用带来新的可能性。(量子位)Subsense 获 2700 万美元种子轮融资,开发纳米粒子脑机接口Techub News 消息,脑机接口初创公司 Subsense 宣布获得 2700 万美元种子轮融资,用于开发基于纳米粒子的非侵入式脑机接口技术,旨在革新神经疾病治疗方法,挑战现有的侵入式方案。(Crypto Briefing)PayPal 二季度支付量达 4864 亿美元并重组加密业务部门Techub News 消息,PayPal 发布二季度财报,总支付量达 4864 亿美元,同比增长 10%。该公司创立「支付服务与加密」部门,将 PYUSD 稳定币与 Braintree 及商户处理业务整合,并将稳定币纳入正式创新计划。
该部门与 Checkout Solutions 和消费者金融服务构成三大业务板块。CEO Enrique Lores 称,计划推出更多由 PYUSD 支持的商户产品。二季度净收入同比增长 5% 至 86.8 亿美元,但 GAAP 净利润下降 12% 至 11 亿美元。(crypto.news)赵长鹏:Hyperliquid 去中心化存疑,小团队控制近 60% 质押Techub News 消息,赵长鹏在 Galaxy Brains 播客中称,尽管 Hyperliquid 技术令人印象深刻,但其治理模式存在问题。该平台仅由 24 个验证者运行,Hyper Foundation 控制近 60% 质押,去中心化程度存疑。
此前 Binance 因反洗钱合规问题支付 43 亿美元罚款,其本人也认罪。他指出,无 KYC 且日交易量达数十亿美元的平台若由小团队控制,将面临监管风险,这种治理结构难以抵御监管审查。(CryptoBriefing)Perplexity 推出 Brain 自改进记忆系统Techub News 消息,Perplexity 发布名为 Brain 的新型记忆系统,用于其 AI Computer 平台。
该系统构建持续更新的上下文知识图谱,可定期回顾代理的工作记录并自动更新工作上下文,使 AI 能够从过往任务中学习改进而非仅记忆用户偏好。早期测试数据显示,Brain 使计算机在曾处理过的任务上正确率提升 25%,召回率提高 16%,历史上下文相关任务成本降低 13%。该功能现面向 Max 和 Enterprise Max 订阅者以研究预览版形式推出。(CryptoBriefing)JetBrains 开源 Mellum2 模型,120 亿参数 MoE 架构Techub News 消息,据 huggingface.co 报道,JetBrains 发布开源 MoE 模型 Mellum2,该模型拥有 120 亿参数,采用 Apache 2.0 许可证。
Mellum2 每 token 仅激活 25 亿参数,推理速度比同类模型快 2 倍以上,适用于代码生成、RAG、路由和 Agent 子任务等低延迟场景,支持私有化部署。SOL 财库公司 Upexi 聘请 SOL Big Brain 与 Arthur Hayes 担任顾问委员会成员Techub News 消息,据 The Block 报道,纳斯达克上市 SOL 财库公司 Upexi(UPXI)宣布聘请 Solana 知名投资人 SOL Big Brain 加入其顾问委员会,与 Maelstrom 基金联合创始人 Arthur Hayes 共同组建加密资产智囊团。该公司自 4 月起累计购入超 200 万枚 SOL,当前持仓价值约 4.1 亿美元。撰文:Techub News 整理 导语 2025 年 8 月,谷歌传奇工程师、Google AI 负责人及 Google Brain 联合创始人 Jeff Dean(杰夫·迪恩)做客 X(原谷歌 X)工厂的“Moonshot Podcast”节目,进行了一场深度对话。作为谷歌最早的工程师之一,Jeff Dean(杰夫·迪恩)亲历了谷歌从搜索引擎到 AI 巨头的整个演变过程,尤其在推动谷歌大脑项目及定制 AI 芯片(TPU)方面发挥了关键作用。此次访谈不仅回顾了神经网络从冷门到主流的技术跃迁,也展望了 AI 未来在教育、医疗及社会协作层面的巨大潜力,为理解当今 AI 浪潮的源起与方向提供了宝贵的一线视角。 摘要 回顾 Google Brain 诞生:源于与 Andrew Ng(吴恩达)的一次偶然对话,目标是利用谷歌的计算资源规模化训练神经网络。 早期突破:通过“模型并行”与“数据并行”策略,训练出当时规模空前的神经网络,在图像识别和语音识别任务上取得飞跃性进步。 硬件创新:因预见 AI 计算的巨大需求,推动开发了专为机器学习设计的张量处理单元(TPU),最初仅支持 8 位整数运算。 核心技术演进:从词向量、序列到序列模型,最终到 Transformer 和注意力机制,奠定了现代大语言模型的基础。 未来愿景:AI 将成为个性化的“苏格拉底式”伙伴,并通过“百万教师教一个学生”的模式,让全社会的知识贡献普惠于所有人。 少年工程师与神经网络初遇 Jeff Dean(杰夫·迪恩)的编程之路始于童年。由于父亲是医生且对计算机在公共卫生中的应用感兴趣,他九岁时家里就有了一台需要自行焊接组装的 kit 电脑。通过键入书本上的 BASIC 游戏代码并修改,他初次领略了编程的乐趣。青少年时期,他通过明尼苏达州的学校计算机网络,早早体验了多用户在线聊天和互动游戏,这几乎是互联网普及前二十年的“虚拟社交”雏形。 他回忆第一个非 trivial 的编程项目是在十三四岁时,将一位博士生为大型机写的 Pascal 多用户游戏源代码,移植到自家带有多个终端的 UCSD Pascal 系统上。这个过程迫使他学习处理多端口中断、多终端输入调度等并发问题,虽然是在“胡乱摸索”中完成,却为他日后处理分布式系统奠定了基础。 在明尼苏达大学高年级时,Jeff Dean(杰夫·迪恩)选修了一门关于分布式和并行编程的课程,并由此首次接触到神经网络。那是1990年,神经网络因其高度并行的计算形式和解决某些模式匹配任务的潜力而令人兴奋。他被这个“ loosely based on how real brains work”的抽象所吸引,并以此为课题完成了关于并行化神经网络训练的荣誉论文,探索了后来被称为“数据并行”和“模型并行”的两种方法。尽管当时需要的是“百万倍”而非“32倍”的计算能力,但神经网络作为“正确抽象”的信念,已在他心中埋下种子。 Google Brain 的诞生与早期规模化探索 Jeff Dean(杰夫·迪恩)的职业路径充满了对新鲜领域的探索。从公共卫生软件到编译器研究,他最终在2011年左右,因负责的 Spanner 分布式存储系统趋于稳定,开始寻找下一个挑战。一次在微型厨房与当时在 Google X 兼职的斯坦福教授 Andrew Ng(吴恩达)的偶然交谈,成为了转折点。Andrew Ng(吴恩达)提到他的学生在使用 GPU 的神经网络上,于语音和视觉应用取得了有趣成果。Jeff Dean(杰夫·迪恩)当即回应:“我喜欢神经网络,我们应该训练真正大的神经网络。” 这便是 Google Brain 团队的雏形。他们的核心假设很简单:规模是关键。Andrew Ng(吴恩达)从学生工作中已知,只要让神经网络变得更大,效果就会更好。但他们缺乏的是将这一想法推向谷歌数据中心级别规模的能力——这正是 Jeff Dean(杰夫·迪恩)的专长。团队最初利用数据中心里2000台计算机(16000个CPU核心),因为没有现成的 GPU,来训练分布式神经网络。 他们早期训练了一个拥有20亿参数、用于计算机视觉的“局部感受野”模型。为了处理如此庞大的模型,他们采用了复杂的模型并行策略:将模型在图像的空间维度(X和Y方向)上切分,一个13x13的机器网格(共169台机器)负责处理模型的不同部分,每个“副本”处理一批随机数据。为了协调这些副本并确保参数收敛,他们引入了“参数服务器”(Parameter Server)的概念。通过这种方式,他们成功训练了比当时主流模型大50倍的神经网络。 标志性的成果是著名的“猫神经元”发现。团队使用无监督学习算法,用1000万个随机 YouTube 视频帧训练模型,让模型学习从原始像素中提取高层特征。在最高层的特征中,他们发现有些神经元会对“猫”的图像产生强烈反应,这意味着模型通过纯粹的优化过程,自发“发明”了“猫”的概念。这项成果登上了《纽约时报》,成为 AI 发展的一个标志性时刻。 更实际的影响体现在性能突破上。使用这个巨大视觉模型进行少量监督微调后,他们在 ImageNet 的2万类别基准上实现了60%的相对错误率降低。在语音识别方面,用神经网络替换传统声学模型后,取得了30%的词错误率相对改进——这相当于过去20年语音研究进展的总和。这些成果以惊人的速度攀升各类基准排名,让谷歌内部乃至整个行业看到了深度学习的颠覆性潜力。 从软件到硬件:TPU 的诞生与架构演进 惊人的效果伴随着高昂的计算成本。Jeff Dean(杰夫·迪恩)做了一个思想实验:如果因语音识别变好,有1亿人每天对手机说话3分钟,部署当时基于 CPU 的模型所需的计算量将是天文数字。他意识到必须有更高效的方案。 神经网络的两个特性为专用硬件指明了方向:一是其主要由少量线性代数操作(如矩阵乘法)构成;二是其对计算精度不敏感,可以容忍较低的数值精度。基于此,最初的 TPU(张量处理单元)被设计为仅支持8位整数运算的推理专用芯片,完全没有浮点单元。后来的版本才加入了名为“bfloat16”的降低精度浮点格式,这种格式牺牲尾数精度保留指数范围,更适合神经网络的需求。 TPU 的开发也标志着 Google Brain 项目从 Google X 回归谷歌核心。初期团队在 X 大楼起步,但随着成果在搜索、语音、视觉等核心产品中展现出巨大价值,回到主园区并与产品团队更紧密协作变得顺理成章。 语言理解的突破:从词向量到 Transformer Jeff Dean(杰夫·迪恩)梳理了自然语言处理领域的几个关键突破。首先是词向量(Word2Vec),它将单词表示为高维空间中的向量,使得“国王 - 男人 + 女人 = 女王”这样的语义代数成为可能,揭示了语言中潜在的方向性结构。 其次是序列到序列模型,它使用 LSTM(长短时记忆网络)将一个序列(如英语句子)编码为一个向量状态,再从此状态解码出另一个序列(如法语句子)。这不仅是机器翻译的突破,也适用于医疗记录、基因组序列等多种序列映射任务。 最重要的飞跃来自Transformer 架构和注意力机制。2017年发表的《Attention Is All You Need》论文提出,与其在每一步更新一个单一的状态向量,不如记住所有中间状态向量,并让模型学会在需要时“注意”它们。虽然注意力计算量随序列长度呈平方级增长,但它带来了两大好处:一是允许并行处理整个序列,极大地发挥了现代 ML 处理器中矩阵单元的并行能力;二是产生了更强大的模型。Transformer 成为了当今所有大型语言模型的基石。 未来展望:AI 作为伙伴与“百万教师”愿景 谈及 AI 的未来影响,Jeff Dean(杰夫·迪恩)更倾向于讨论具体的能力和场景,而非抽象的“AGI”(通用人工智能)概念。他认为,AI 正在从单纯处理文本转变为真正的多模态系统,能够理解并生成语音、图像、视频等多种形式的内容。例如,用户可以要求模型“生成一段独角兽跳过校车、并且前面有我的狗的视频”,并附上狗的照片。 更根本的转变在于人机协作模式的改变。人类的工作重心将从“制造事物”转向“具体指定需求”。当前的“提示工程”将演变为我们主要的工作方式。AI 可以充当“苏格拉底式”的伙伴,帮助人类探索想法、生成正反论据、撰写报告或创作内容。他举例说,可以要求 AI “总结过去20年风能和太阳能的趋势、价格变化以及南美洲的部署情况”,AI 能够综合多方信息,完成过去需要人类大量时间的工作。 在更宏大的社会层面,Jeff Dean(杰夫·迪恩)分享了一个他特别认同的愿景:“如何实现一百万名教师教导一个学生?”这里的“学生”指的是强大且持续学习的 AI 模型。全世界的每个人都可以在某些方面“教导”这个模型(例如提供高质量数据或反馈),而全人类都将受益于这些教学产生的更智能、更有用的模型。这需要建立机制,让数据贡献者能因其贡献的价值获得相应的补偿,尤其是那些提供新颖、真实、高质量信息的贡献。 同时,他也清醒地认识到 AI 带来的挑战,如深度伪造、 misinformation(错误信息)的泛滥,以及在医疗等领域的隐私问题。他认为,技术界和社会必须共同思考如何塑造 AI 的发展,以最大化其在教育、医疗等领域的积极影响,同时通过技术和政策手段,尽可能减少其负面影响。 模型的“可解释性”与 Jeff Dean 的下一个五年 随着模型变得极其庞大和复杂,理解其内部决策过程(即可解释性)的挑战日益突出。Jeff Dean(杰夫·迪恩)认为这有点像神经科学,但优势在于我们可以任意探测和测量这个“数字大脑”。他设想未来的解释方式可能更偏向交互式对话:用户可以追问模型“你为什么做出这个决定?”,模型则能回溯并解释其推理链条中的关键步骤,就像程序员调试时追踪变量值一样。 对于“AI 何时能自主实现科学突破”这一问题,他认为在某些具备清晰反馈循环、可快速评估想法的领域,这一天并不遥远。强化学习和大规模计算搜索在这些领域已显示出强大能力。但在那些评估周期长、奖励信号不明确的领域,还需要更多进展。 谈及个人规划,Jeff Dean(杰夫·迪恩)延续了他每五年左右深入一个新领域的风格。他目前关注的下一个方向是:如何让最强大的 AI 模型变得成本效益极高,从而能够部署给全球数十亿人使用。他认为目前最先进的模型计算成本仍然较高,他有了一些初步想法,希望能在这方面取得突破,让尖端 AI 能力真正实现普惠。
