扫码下载
搜索“Transformer”共有10条相关结果
Techub News 消息,美国金融科技公司 Affirm 宣布推出基于 Transformer 架构的机器学习模型,用于实时信贷审批。该 AI 驱动的承销模型旨在重新定义信用风险评估,有望提高先买后付(BNPL)行业的批准率和利润率。 (Crypto Briefing)
Techub News 消息,谷歌研究院发布全新检索框架 Retrieve-for-Train(R4T),旨在解决推荐系统需返回多样化结果集而非单一最佳匹配的问题。R4T 使用强化学习学习查询扩散策略,并将其蒸馏成一个小型扩散模型,可在单次推理中生成全部检索方向,使查询扩散效率提升 12 至 20 倍。 该框架解决了通用大语言模型在执行查询扩散时的两大问题:近义坍塌(产生过于相似的子查询)和延迟过高。其通过三阶段流程实现:首先训练一个查询扩散语言模型,然后合成监督数据,最终训练一个参数为 5390 万的扩散变换器模型来直接生成目标嵌入集合。 在 Polyvore 时尚搭配数据集和专有音乐数据集上的测试显示,基于 Gemma3-4B 的 R4T 框架在开放检索质量上优于最佳采样法,其生成的子查询多样性从零样本的 56.0 提升至 76.8。该方法无需在推理时重复调用大模型,显著降低了成本与延迟。(MarkTechPost)
Techub News 消息,Nunchux AI 发布 VC-Attention,一种无需训练的低比特注意力内核,专为视频扩散 Transformer 设计。它同时解决值量化误差和 softmax 阶段缓慢两个问题,通过 V-Smooth 处理值异常值和 ExpCast-FP8 优化 softmax 瓶颈。 在 B200、H200、RTX 5090 等 GPU 上的测试显示,该内核能实现 1.13 倍至 1.70 倍的端到端加速,注意力计算速度提升最高达 3.58 倍。在 Wan2.2 等开源视频生成模型上,其保真度优于 SageAttention2 等先前方法。(MarkTechPost)
Techub News 消息,Prior Labs 发布了其表格基础模型 TabPFN-3.5 的最新版本。该模型无需针对特定数据集进行训练或调优,即可在单次前向传播中完成表格预测。Prior Labs 报告称,该模型在七项表格基准测试中均排名第一。 一项独立演示显示,TabPFN-3.5 在默认设置下,其预测性能超越了 2015 年一场著名 Kaggle 竞赛的获胜解决方案。该模型在 Otto 竞赛的私有排行榜上获得了 0.375 的分数,优于原获胜方案的 0.382。模型仅使用合成数据进行预训练,未接触过 Otto 或任何 Kaggle 数据集。 该模型系列包括开放权重的 TabPFN-3.5(2.2 亿参数)和 TabPFN-3.5-Fast(8400 万参数,速度提升高达 6 倍),以及仅限 API 和企业使用的 TabPFN-3.5-Plus 和 TabPFN-3.5-Thinking。生产使用需要 Prior Labs 的 API 或商业许可。(MarkTechPost)
Techub News 消息,AI 公司 Cohere 发布开源翻译模型 North Small Translate。该模型为稀疏专家混合模型,总参数量 2180 亿,激活参数量 250 亿,支持从阿尔巴尼亚语到越南语等 50 种语言。在 Cohere 的 WMT26 评估中,其平均得分为 83.6。 Cohere 表示,该模型性能优于 DeepL、Google Translate 以及 GLM 5.2 和 Mistral Large 3 等开源选项。模型可通过 Cohere API 免费调用(受速率限制),也可非商业自托管或商业授权使用。 根据 Cohere 公布的成本图表,该模型每项任务(平均 661 个词元)的成本为 0.000676 美元,而 Gemini 3.1 Pro Preview 的成本约为其 58 倍。 (MarkTechPost)
Techub News 消息,谷歌研究团队发布 TimesFM-3,这是一个拥有 3.3 亿参数的多变量时间序列预测基础模型。该模型在超过 1 万亿时间点的真实与合成序列上进行预训练,无需针对特定任务进行微调即可处理多目标、历史协变量及已知未来协变量。 TimesFM-3 在 GIFT-Eval、fev-bench 和 TIME 排行榜上的点预测和概率指标均位列预训练基础模型平均排名第一。不过,其 3.0 版本的权重受限于非商业、非生产用途的许可证,不能用于生产预测 API。(MarkTechPost)
Techub News 消息,谷歌研究院与悉尼新南威尔士大学联合发布用于连续血糖监测的自监督基础模型 GlucoFM。该模型将血糖信号分解为慢速生理“状态”流和瞬态“事件”流进行双流处理,参数量仅 72 万,在单张 H100 GPU 上完成预训练。在 14 项队列-任务评估中,其任务平均 PR-AUC 达 58.8,优于基线模型。 研究团队强调,GlucoFM 目前仅为研究原型,未获任何监管机构批准,不用于疾病诊断或治疗。其代码与复现脚本将公开,任何拥有血糖监测数据集的团队均可基于此方案在 CPU 或设备端进行推理。(MarkTechPost)
Techub News 消息,IBM 发布了 Granite 4.2 系列开源推理语言模型,提供 3B、8B 和 30B 三种参数规模。该模型系列围绕显式推理构建,每个模型在回答前都能生成思维链,并设有思考/非思考开关及低功耗模式。模型采用仅解码器的密集 Transformer 架构,从头预训练约 15 万亿个 token,并通过多阶段强化学习链进行后训练。 其中 8B 和 30B 模型包含智能体强化学习模块,模型可在真实沙盒环境中学习编辑代码、驱动终端和运行网络搜索。所有模型均基于 Apache 2.0 协议开源,允许下载、微调及商业生产使用。IBM 同时发布了两个 470M 参数的 Granite Speech 5.0 Turbo CTC 语音模型。 在 SWE-Bench Verified 基准测试中,8B 和 30B 模型的得分分别为 47.67 和 57.00。模型适用于软件开发、金融、医疗、电信及公共部门等行业,应用场景包括软件工程智能体、终端自动化、深度研究及长文档 RAG 等。(MarkTechPost)
Techub News 消息,Accelerated Understanding Inc 今日发布一款全新 AI 模型,该模型采用名为 neural operators 的非 Transformer 架构,并支持大上下文窗口。 与传统 Transformer 架构不同,该模型通过神经算子技术处理数据,或将在 AI 基准测试中带来新变量。目前业界正关注其在主流评测中的表现,以及 Anthropic、Google 等头部公司的后续回应。(cryptobriefing.com)
Techub News 消息,英伟达在本周德国科隆游戏展上宣布,其将于今秋推出的RTX Spark平台将获得包括艺电、Embark Studios和育碧在内的多家游戏发行商支持,多款3A大作将登陆该平台。平台将原生集成艺电的Javelin反作弊技术,并支持DLSS 4.5等RTX技术。 此外,英伟达还宣布了多项游戏技术更新,包括现已可用的DLSS 4.5光线重建技术、为《CONTROL Resonant》等游戏引入路径追踪,以及NVIDIA ACE技术将于2027年初登陆《Aniimo》等。RTX Spark平台旨在将个人AI代理、高级内容创作和高性能游戏整合于专为下一代Windows PC设计的平台中。 (NVIDIA Blog)