扫码下载
搜索“DeepSeek”共有10条相关结果
Techub News 消息,英伟达(NVIDIA)组织在 HuggingFace 平台新上架了模型权重「nvidia/DeepSeek-V4.1-Flash-NVFP4」。此类权重文件的上架时间常早于官方正式发布,在官方宣布前,该模型可被描述为“疑似”或“即将发布”。(HuggingFace)
Techub News 消息,加密货币领域知名人物 Erik Voorhees 在 X 平台发文,推荐其个人目前最喜爱的 AI 模型 DeepSeek V4.1 Flash,并建议用户可私下使用该模型构建自己的智能体(Agent)。 (@ErikVoorhees)
Techub News 消息,模型聚合平台 OpenRouter 上线新模型「DeepSeek: DeepSeek Pro Latest」。该模型将始终重定向至 DeepSeek Pro 系列的最新版本,平台模型上架时间常早于厂商官方宣布。 (OpenRouter 官方公告)
Techub News 消息,DeepSeek 发布 V4.1 Flash 模型,采用「因果编码器-解码器」架构与混合专家设计,在 Terminal-Bench 2.1 基准测试中得分 90.6,超越 OpenAI GPT-5.6 SOL、Moonshot AI Kimi K3 及自家 V4 Pro。 该模型基于 5520 亿参数框架,但仅激活 80 亿参数处理输入和 160 亿参数生成响应,显著降低计算成本。面对芯片出口限制,中国 AI 厂商正通过高效架构在低成本下提供高端推理能力。(南华早报)
Techub News 消息,DeepSeek AI 发布了 DeepSeek-V4.1-Flash 模型。该模型为多模态混合专家模型,拥有 5520 亿骨干参数和 1960 亿额外记忆参数,上下文窗口扩展至 100 万 token。其核心优化在于将全局 KV 缓存占用降至每 token 890 字节,约为 V4-Flash 的四分之一。 模型采用因果编码器-解码器架构,将预填充计算量减少近半。同时引入压缩稀疏注意力 2 代技术,并采用 FP4 量化 KV 缓存,进一步降低了存储需求。模型权重已在 Hugging Face 上以 MIT 许可证开源,并提供公开 API。 研究团队表示,该模型在保持与 DeepSeek-V4-Pro-Base 相当的世界知识和编码能力的同时,仅使用了后者三分之一的总体参数和四分之一的激活参数。单 token 解码的计算量在上下文从 4K 增长到 100 万时仅增加四分之一。(MarkTechPost)
Techub News 消息,deepseek-ai 组织在开源模型平台 HuggingFace 上新上架了权重文件「deepseek-ai/DeepSeek-V4.1-Flash」。该模型权重文件的发布通常早于官方正式公告,目前尚未有官方消息。 (HuggingFace)
Techub News 消息,AI 公司 DeepSeek 在完成一轮 750 亿美元的私募融资后,已开始为今年在上海市场进行首次公开募股(IPO)做准备。 该消息由预测市场平台 Kalshi 在社交媒体平台 X 上发布。若成功上市,这将是近期规模最大的 AI 相关 IPO 之一。(@Kalshi)
Techub News 消息,智谱 AI(Z.ai)、DeepSeek、MiniMax 及阿里云等多家中国人工智能开发商近期入驻天猫平台,通过线上店铺销售 AI 模型订阅与代币充值产品。天猫已推出「AI Space Station」聚合专区,集中展示并销售各品牌的 AI 订阅服务。 平台数据显示,智谱 AI 店铺上线后 48 小时内,淘宝及天猫的 AI 代币与订阅产品交易量增长逾 160%。通过将软件订阅转化为日常零售商品,AI 开发商正在拓展直接官网销售之外的新渠道,以寻求更可持续的营收模式。(SCMP)
Techub News 消息,@laurashin 发推称,DeepSeek V4 Pro 在智能合约安全竞赛中捕获 12 个漏洞标志中的 11 个,计算成本仅 1.45 美元,而 Claude Opus 4.8 捕获 10 个且花费 7.61 美元。 该对比显示 DeepSeek 在 AI 编码安全检测领域展现出显著的成本优势,反映出不同模型在区块链代码审计应用中的性能与价格差距正逐渐扩大。
Techub News 消息,AI 公司 DeepSeek 计划部署超过 10 万枚华为芯片,以降低对英伟达 GPU 的依赖。此举旨在应对全球 AI 芯片供应链的紧张局面,并寻求多元化的硬件解决方案。 (@Kalshi)