Techub News 消息,Meta FAIR 联合牛津大学、伦敦大学学院的研究团队发布 AI 研究偏好模型(RPM),旨在让 AI 研究智能体在执行耗时的 GPU 实验前,对候选实验方案进行排序,仅运行最有潜力的方案。该模型包含仅推理和智能体驱动两种变体,使用冻结的预训练大模型(Qwen3.6-27B),相关框架 AIRA-dojo 和基准 AIRS-Bench 已开源。 在 AIRS-Bench 的测试中,使用 RPM 后,平均归一化得分从随机选择的 0.684 提升至 0.711(仅推理)和 0.729(智能体驱动)。效率方面,两种 RPM 均能在约 15 小时内达到基线模型 24 小时的性能水平,实现约 1.5-1.6 倍的加速。此外,研究在 WinoGrande 和 SVAMP 基准上取得了新的最高性能记录。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,Meta FAIR 联合牛津大学、伦敦大学学院的研究团队发布 AI 研究偏好模型(RPM),旨在让 AI 研究智能体在执行耗时的 GPU 实验前,对候选实验方案进行排序,仅运行最有潜力的方案。该模型包含仅推理和智能体驱动两种变体,使用冻结的预训练大模型(Qwen3.6-27B),相关框架 AIRA-dojo 和基准 AIRS-Bench 已开源。 在 AIRS-Bench 的测试中,使用 RPM 后,平均归一化得分从随机选择的 0.684 提升至 0.711(仅推理)和 0.729(智能体驱动)。效率方面,两种 RPM 均能在约 15 小时内达到基线模型 24 小时的性能水平,实现约 1.5-1.6 倍的加速。此外,研究在 WinoGrande 和 SVAMP 基准上取得了新的最高性能记录。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。