Techub News 消息,谷歌研究院发布全新检索框架 Retrieve-for-Train(R4T),旨在解决推荐系统需返回多样化结果集而非单一最佳匹配的问题。R4T 使用强化学习学习查询扩散策略,并将其蒸馏成一个小型扩散模型,可在单次推理中生成全部检索方向,使查询扩散效率提升 12 至 20 倍。 该框架解决了通用大语言模型在执行查询扩散时的两大问题:近义坍塌(产生过于相似的子查询)和延迟过高。其通过三阶段流程实现:首先训练一个查询扩散语言模型,然后合成监督数据,最终训练一个参数为 5390 万的扩散变换器模型来直接生成目标嵌入集合。 在 Polyvore 时尚搭配数据集和专有音乐数据集上的测试显示,基于 Gemma3-4B 的 R4T 框架在开放检索质量上优于最佳采样法,其生成的子查询多样性从零样本的 56.0 提升至 76.8。该方法无需在推理时重复调用大模型,显著降低了成本与延迟。(MarkTechPost)