撰文:Techub News 整理
导语
2025 年 8 月,谷歌传奇工程师、Google AI 负责人及 Google Brain 联合创始人 Jeff Dean(杰夫·迪恩)做客 X(原谷歌 X)工厂的“Moonshot Podcast”节目,进行了一场深度对话。作为谷歌最早的工程师之一,Jeff Dean(杰夫·迪恩)亲历了谷歌从搜索引擎到 AI 巨头的整个演变过程,尤其在推动谷歌大脑项目及定制 AI 芯片(TPU)方面发挥了关键作用。此次访谈不仅回顾了神经网络从冷门到主流的技术跃迁,也展望了 AI 未来在教育、医疗及社会协作层面的巨大潜力,为理解当今 AI 浪潮的源起与方向提供了宝贵的一线视角。
摘要
- 回顾 Google Brain 诞生:源于与 Andrew Ng(吴恩达)的一次偶然对话,目标是利用谷歌的计算资源规模化训练神经网络。
- 早期突破:通过“模型并行”与“数据并行”策略,训练出当时规模空前的神经网络,在图像识别和语音识别任务上取得飞跃性进步。
- 硬件创新:因预见 AI 计算的巨大需求,推动开发了专为机器学习设计的张量处理单元(TPU),最初仅支持 8 位整数运算。
- 核心技术演进:从词向量、序列到序列模型,最终到 Transformer 和注意力机制,奠定了现代大语言模型的基础。
- 未来愿景:AI 将成为个性化的“苏格拉底式”伙伴,并通过“百万教师教一个学生”的模式,让全社会的知识贡献普惠于所有人。
少年工程师与神经网络初遇
Jeff Dean(杰夫·迪恩)的编程之路始于童年。由于父亲是医生且对计算机在公共卫生中的应用感兴趣,他九岁时家里就有了一台需要自行焊接组装的 kit 电脑。通过键入书本上的 BASIC 游戏代码并修改,他初次领略了编程的乐趣。青少年时期,他通过明尼苏达州的学校计算机网络,早早体验了多用户在线聊天和互动游戏,这几乎是互联网普及前二十年的“虚拟社交”雏形。
他回忆第一个非 trivial 的编程项目是在十三四岁时,将一位博士生为大型机写的 Pascal 多用户游戏源代码,移植到自家带有多个终端的 UCSD Pascal 系统上。这个过程迫使他学习处理多端口中断、多终端输入调度等并发问题,虽然是在“胡乱摸索”中完成,却为他日后处理分布式系统奠定了基础。
在明尼苏达大学高年级时,Jeff Dean(杰夫·迪恩)选修了一门关于分布式和并行编程的课程,并由此首次接触到神经网络。那是1990年,神经网络因其高度并行的计算形式和解决某些模式匹配任务的潜力而令人兴奋。他被这个“ loosely based on how real brains work”的抽象所吸引,并以此为课题完成了关于并行化神经网络训练的荣誉论文,探索了后来被称为“数据并行”和“模型并行”的两种方法。尽管当时需要的是“百万倍”而非“32倍”的计算能力,但神经网络作为“正确抽象”的信念,已在他心中埋下种子。
Google Brain 的诞生与早期规模化探索
Jeff Dean(杰夫·迪恩)的职业路径充满了对新鲜领域的探索。从公共卫生软件到编译器研究,他最终在2011年左右,因负责的 Spanner 分布式存储系统趋于稳定,开始寻找下一个挑战。一次在微型厨房与当时在 Google X 兼职的斯坦福教授 Andrew Ng(吴恩达)的偶然交谈,成为了转折点。Andrew Ng(吴恩达)提到他的学生在使用 GPU 的神经网络上,于语音和视觉应用取得了有趣成果。Jeff Dean(杰夫·迪恩)当即回应:“我喜欢神经网络,我们应该训练真正大的神经网络。”
这便是 Google Brain 团队的雏形。他们的核心假设很简单:规模是关键。Andrew Ng(吴恩达)从学生工作中已知,只要让神经网络变得更大,效果就会更好。但他们缺乏的是将这一想法推向谷歌数据中心级别规模的能力——这正是 Jeff Dean(杰夫·迪恩)的专长。团队最初利用数据中心里2000台计算机(16000个CPU核心),因为没有现成的 GPU,来训练分布式神经网络。
他们早期训练了一个拥有20亿参数、用于计算机视觉的“局部感受野”模型。为了处理如此庞大的模型,他们采用了复杂的模型并行策略:将模型在图像的空间维度(X和Y方向)上切分,一个13x13的机器网格(共169台机器)负责处理模型的不同部分,每个“副本”处理一批随机数据。为了协调这些副本并确保参数收敛,他们引入了“参数服务器”(Parameter Server)的概念。通过这种方式,他们成功训练了比当时主流模型大50倍的神经网络。
标志性的成果是著名的“猫神经元”发现。团队使用无监督学习算法,用1000万个随机 YouTube 视频帧训练模型,让模型学习从原始像素中提取高层特征。在最高层的特征中,他们发现有些神经元会对“猫”的图像产生强烈反应,这意味着模型通过纯粹的优化过程,自发“发明”了“猫”的概念。这项成果登上了《纽约时报》,成为 AI 发展的一个标志性时刻。
更实际的影响体现在性能突破上。使用这个巨大视觉模型进行少量监督微调后,他们在 ImageNet 的2万类别基准上实现了60%的相对错误率降低。在语音识别方面,用神经网络替换传统声学模型后,取得了30%的词错误率相对改进——这相当于过去20年语音研究进展的总和。这些成果以惊人的速度攀升各类基准排名,让谷歌内部乃至整个行业看到了深度学习的颠覆性潜力。
从软件到硬件:TPU 的诞生与架构演进
惊人的效果伴随着高昂的计算成本。Jeff Dean(杰夫·迪恩)做了一个思想实验:如果因语音识别变好,有1亿人每天对手机说话3分钟,部署当时基于 CPU 的模型所需的计算量将是天文数字。他意识到必须有更高效的方案。
神经网络的两个特性为专用硬件指明了方向:一是其主要由少量线性代数操作(如矩阵乘法)构成;二是其对计算精度不敏感,可以容忍较低的数值精度。基于此,最初的 TPU(张量处理单元)被设计为仅支持8位整数运算的推理专用芯片,完全没有浮点单元。后来的版本才加入了名为“bfloat16”的降低精度浮点格式,这种格式牺牲尾数精度保留指数范围,更适合神经网络的需求。
TPU 的开发也标志着 Google Brain 项目从 Google X 回归谷歌核心。初期团队在 X 大楼起步,但随着成果在搜索、语音、视觉等核心产品中展现出巨大价值,回到主园区并与产品团队更紧密协作变得顺理成章。
语言理解的突破:从词向量到 Transformer
Jeff Dean(杰夫·迪恩)梳理了自然语言处理领域的几个关键突破。首先是词向量(Word2Vec),它将单词表示为高维空间中的向量,使得“国王 - 男人 + 女人 = 女王”这样的语义代数成为可能,揭示了语言中潜在的方向性结构。
其次是序列到序列模型,它使用 LSTM(长短时记忆网络)将一个序列(如英语句子)编码为一个向量状态,再从此状态解码出另一个序列(如法语句子)。这不仅是机器翻译的突破,也适用于医疗记录、基因组序列等多种序列映射任务。
最重要的飞跃来自Transformer 架构和注意力机制。2017年发表的《Attention Is All You Need》论文提出,与其在每一步更新一个单一的状态向量,不如记住所有中间状态向量,并让模型学会在需要时“注意”它们。虽然注意力计算量随序列长度呈平方级增长,但它带来了两大好处:一是允许并行处理整个序列,极大地发挥了现代 ML 处理器中矩阵单元的并行能力;二是产生了更强大的模型。Transformer 成为了当今所有大型语言模型的基石。
未来展望:AI 作为伙伴与“百万教师”愿景
谈及 AI 的未来影响,Jeff Dean(杰夫·迪恩)更倾向于讨论具体的能力和场景,而非抽象的“AGI”(通用人工智能)概念。他认为,AI 正在从单纯处理文本转变为真正的多模态系统,能够理解并生成语音、图像、视频等多种形式的内容。例如,用户可以要求模型“生成一段独角兽跳过校车、并且前面有我的狗的视频”,并附上狗的照片。
更根本的转变在于人机协作模式的改变。人类的工作重心将从“制造事物”转向“具体指定需求”。当前的“提示工程”将演变为我们主要的工作方式。AI 可以充当“苏格拉底式”的伙伴,帮助人类探索想法、生成正反论据、撰写报告或创作内容。他举例说,可以要求 AI “总结过去20年风能和太阳能的趋势、价格变化以及南美洲的部署情况”,AI 能够综合多方信息,完成过去需要人类大量时间的工作。
在更宏大的社会层面,Jeff Dean(杰夫·迪恩)分享了一个他特别认同的愿景:“如何实现一百万名教师教导一个学生?”这里的“学生”指的是强大且持续学习的 AI 模型。全世界的每个人都可以在某些方面“教导”这个模型(例如提供高质量数据或反馈),而全人类都将受益于这些教学产生的更智能、更有用的模型。这需要建立机制,让数据贡献者能因其贡献的价值获得相应的补偿,尤其是那些提供新颖、真实、高质量信息的贡献。
同时,他也清醒地认识到 AI 带来的挑战,如深度伪造、 misinformation(错误信息)的泛滥,以及在医疗等领域的隐私问题。他认为,技术界和社会必须共同思考如何塑造 AI 的发展,以最大化其在教育、医疗等领域的积极影响,同时通过技术和政策手段,尽可能减少其负面影响。
模型的“可解释性”与 Jeff Dean 的下一个五年
随着模型变得极其庞大和复杂,理解其内部决策过程(即可解释性)的挑战日益突出。Jeff Dean(杰夫·迪恩)认为这有点像神经科学,但优势在于我们可以任意探测和测量这个“数字大脑”。他设想未来的解释方式可能更偏向交互式对话:用户可以追问模型“你为什么做出这个决定?”,模型则能回溯并解释其推理链条中的关键步骤,就像程序员调试时追踪变量值一样。
对于“AI 何时能自主实现科学突破”这一问题,他认为在某些具备清晰反馈循环、可快速评估想法的领域,这一天并不遥远。强化学习和大规模计算搜索在这些领域已显示出强大能力。但在那些评估周期长、奖励信号不明确的领域,还需要更多进展。
谈及个人规划,Jeff Dean(杰夫·迪恩)延续了他每五年左右深入一个新领域的风格。他目前关注的下一个方向是:如何让最强大的 AI 模型变得成本效益极高,从而能够部署给全球数十亿人使用。他认为目前最先进的模型计算成本仍然较高,他有了一些初步想法,希望能在这方面取得突破,让尖端 AI 能力真正实现普惠。









