由OpenAI前首席技术官(CTO)米拉·穆拉蒂创办的思考机器实验室(Thinking Machines Lab)公布了一种旨在减少人与AI之间“中断式对话”的新模型结构。其核心在于,摆脱以往需等待文本或语音输入结束后才回答的传统方式,推出了能同时处理“看、听、说”任务的“实时交互”AI。
思考机器实验室近日通过博客发布了其首个“交互模型”的研究预览。该模型并非像传统生成式AI那样等待用户完成所有提问后再响应,而是将输入和输出划分为约200毫秒(ms)的小区间进行处理。公司方面解释称,这使得AI即使在说话过程中也能持续接收视觉和听觉信号,并对情境变化做出即时反应。
目前,大多数AI服务只有在用户说完一句话后才能进行处理和响应。公司方面判断,这使得人们习惯于像写电子邮件那样,将问题整理冗长后一次性抛出,而不是自然地插话或随声附和。思考机器实验室认为,这种结构反而让人去适应界面,并强调需要更自然的“实时交互”环境。
本次公布的核心模型名为“TML-Interaction-Small”。这是一款拥有2760亿参数的专家混合(Mixture-of-Experts)模型,负责快速对话流程和即时反应。此外,还附加了一个独立的异步“后台模型”,在后台处理复杂的推理、网络搜索、工具调用等繁重任务。简单来说,就是前端模型负责自然地延续对话,同时后端模型准备所需信息和计算,并将结果实时融入对话中。
在技术上,该模型没有采用将音频或视频通过独立的编码器进行繁重转换的方式,而是通过轻量级的嵌入层直接接收原始信号,采用了“无编码器早期融合”方法。公司声称,这可以在Transformer内部进行快速处理,从而减少延迟。其解释称,为了兼顾响应速度和深度推理,设计了“双模型”结构。
性能指标也已公布。在衡量AI交互质量的“FD-Bench”测试中,TML-Interaction-Small的轮询延迟时间低于0.4秒。这一速度快于谷歌的Gemini-3.1-Flash-Live的0.57秒和GPT-Realtime-2.0的1.18秒。不过,由于这是公司自身给出的基准测试结果,在实际服务环境中能否复现同等水平的性能,还有待进一步验证。
市场上认为,这种低延迟AI的意义可能超越单纯的“更快聊天机器人”,在企业级应用场景中更为重大。例如,持续监控实验室或制造设施的视频流,并在出现安全违规迹象时立即发出警报,或者在客服中心通话中像与人交谈一样自然地回应。此外,由于能在内部处理时间概念,即便没有额外的时间戳,也能处理诸如“如果这次化学反应比上次耗时更长,请通知我”这样的指令,这一点也颇为引人注目。
思考机器实验室目前仅向部分合作伙伴有限度地提供TML-Interaction-Small和后台模型。预计将于今年晚些时候向公众开放。在生成式AI竞争从“性能”转向“交互质量”的潮流中,此次的实时交互模型正成为衡量下一代AI界面发展方向的关键变量。
TP AI注意事项 本文基于TokenPost.ai的语言模型进行摘要。正文主要内容可能被遗漏或与事实不符。

