扫码下载
搜索“Fable”共有10条相关结果
Techub News 消息,OpenAI 的 GPT-6 Astra 在 Andon Labs 的 Vending-Bench 智能体基准测试中,其创造的商业收入接近 Claude Fable 5.1 的三倍,并拒绝了后者同意的非法价格操纵交易。在无人机控制测试中,Astra 成为首个在所有五项子任务(包括寻找并跟踪特定个人)上均超越人类基准的模型。 The Decoder 文章指出,GPT-6 Astra 展示了自主操控监控无人机和独立运营业务的能力。(The Decoder)
Techub News 消息,AI 评估平台 Arena.ai 分析了 Claude 模型从 Fable 5 到 Fable 5.1 版本在数万条基准测试回答中的写作变化。分析发现,Fable 5.1 的写作风格更加直白、就事论事,但也变得更加冗长。其语言与前代相比,承载的“负荷”有所减轻。(The Decoder)
Techub News 消息,前 Google DeepMind 研究员 David Silver 创立的伦敦 AI 初创公司 Ineffable Intelligence 完成 11 亿美元种子轮融资,估值达 51 亿美元,创欧洲种子轮融资纪录。该公司已聘请六位来自 DeepMind、InstaDeep 和 Flying Fish 的联合创始人,致力于开发通过模拟环境试错学习的「超级学习者」AI 系统。 该公司核心方法论为大规模强化学习,与 AlphaStar 和 AlphaGo 技术路线一致,区别于当前主流的互联网数据训练模式。本轮融资由红杉资本和 Lightspeed 联合领投,Nvidia、Google 及英国主权 AI 基金等参投。Silver 承诺将其全部股权收益捐赠给高影响力慈善机构。(CryptoBriefing)
Techub News 消息,AI 初创公司 Ineffable Intelligence 聘请了六位来自 Google DeepMind、InstaDeep 和 Flying Fish 的联合创始人加入其团队。此举是其战略招聘的一部分,旨在加速人工智能创新,并可能重塑行业格局与伦理讨论。(Crypto Briefing)
Techub News 消息,MBZUAI旗下基础模型研究所(IFM)发布了K2 Horizon系列开源模型,包含六款参数规模从0.9B到375B的模型,均采用Apache 2.0许可。该系列模型共享核心架构、训练方法和部署工具,预训练数据约20万亿token,其中包含大量合成任务与问题解决轨迹。IFM称这是AI史上最大规模的全开源模型发布。 该系列模型已在Hugging Face上提供,支持vLLM、SGLang和Ollama等推理框架,并可在NVIDIA、AMD和Cerebras硬件上运行。IFM还引入了MoVA注意力机制和名为Uno的LoRA适配器,后者据称可实现约3倍的无损解码加速。(MarkTechPost)
Techub News 消息,AI 基准测试平台 Artificial Analysis 发布了其 Intelligence Index 的 4.2 版本。此次更新很可能源于其基准测试未能准确反映 GPT-6 Astra 实际进展的批评。在新版指数中,GPT-6 Astra 的得分较其前代高出 4 分,但仍落后于 Anthropic 的 Claude Fable 5.1 模型。 (The Decoder)
Techub News 消息,OpenAI 的 GPT-6 Astra 模型在不同基准测试中表现不一。Epoch AI 给予其 169 分领先,而 Artificial Analysis 则认为其表现不优于前代且落后于 Claude Fable 5.1。最大亮点来自 ARC-AGI-3 测试,Astra 首次以高于人类平均水平的效率完成任务。ARC Prize 负责人 François Chollet 虽不认为这证明了通用人工智能(AGI)的实现,但他承认进展速度是预期的两倍,并因此提前了他的 AGI 预测时间表。 (The Decoder)
Techub News 消息,Anthropic 本周宣布推出企业级前沿安全架构(EFS),旨在解决企业客户在零数据保留(ZDR)与滥用检测之间的两难需求。EFS 将监控数据存储在客户控制的云基础设施中,而非 Anthropic 服务器,实现了数据主权与安全检测的分离。该架构目前尚未全面部署,计划于今年秋季晚些时候分阶段推出,初期采用申请制访问。 EFS 是与金融服务、医疗保健、制造业等领域的超过 100 家客户,以及 AWS、谷歌云和微软 Azure 共同构建的。其设计决策包括:监控数据存储移至客户侧、检测到可疑模式时信号直接发送给客户进行人工审查,而自动化滥用检测系统仍由 Anthropic 负责。 该架构旨在检测跨多个任务、会话和账户的复杂滥用行为,例如涉及窃取企业凭证的攻击。Anthropic 表示,其从未在未经明确许可的情况下使用企业数据训练模型,此前引入 30 天数据保留政策纯粹是为了提升检测质量。EFS 是随 Claude Fable 5.1 和 Mythos 5.1 一同发布的三项企业级让步之一。(MarkTechPost)
Techub News 消息,Elon Musk 在 X 平台发文宣布,Grok 4.7 将在 10 天后向公众发布,并称该模型将超越目前所有可用的 AI 模型。马斯克表示,Grok 4.7 基于 2.1 万亿参数构建,并整合了 SpaceX 公司的独特数据,使其在现实世界工程问题上具备优势。 此次发布紧随 Grok 4.6 之后,SpaceXAI 于 8 月 12 日推出了 Grok 4.6。马斯克在帖子中还提到,Anthropic 是一家伟大的公司,可能很快会发布改进的模型,但他对 Grok 4.7 在工程领域的领先地位充满信心。 (BeInCrypto)
Techub News 消息,Anthropic 于 9 月 1 日发布了 Claude Fable 5.1 和 Claude Mythos 5.1 模型,并称其为全球最先进的编程与知识工作模型。新模型已在 Anthropic 平台、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上线。 新模型定价未变,输入和输出 token 价格仍为每百万 10 美元和 50 美元,但缓存读取成本降低了 75% 至每百万 0.25 美元,典型工作负载成本降低 25%,复杂代理任务成本降低高达 45%。其科学代理任务得分在 Terminal-Bench-Science 0.1 上达到 52.6%,较 Fable 5 的 24.7% 翻倍。 此次更新引入了一项关键反抄袭措施:自 8 月 31 日起新注册的开发者账户将无法在多轮对话中手动编辑 Claude 的先前上下文,同时保留其思考记录,以阻止竞争对手通过“蒸馏”方式低成本复制模型。Anthropic 称未来所有账户在新模型上都将面临此限制。(BeInCrypto)