Techub News 消息,阿里巴巴通义千问团队发布多模态大模型 Qwen3.8-Omni-Flash。该模型被描述为首个围绕智能体能力构建的“全能模态”模型,可接受文本、图像、音频和视频输入,并输出文本,将音视频理解、推理和工具调用集成于单一模型。其工作流程为理解内容、规划任务、使用工具执行并交付结果。 模型基于 Qwen3.8-Flash-Next 架构,上下文窗口为 100 万 token。目前已通过 QwenCloud、阿里云 Model Studio 和 Qwen Studio 提供托管 API 服务,但未开源权重。其 API 兼容 DashScope 和 OpenAI 协议,支持函数调用、网络搜索、结构化输出等功能。 研究团队称,在长视频理解任务中,该模型采用基于问题的智能体感知路径,能显著降低 token 消耗。在 OmniVideoBench 基准测试中,准确率从 63.4 提升至 67.8,token 使用量从 145,736 降至 79,117,降幅约 45.7%。官方数据显示,在 29 项评估中,其平均得分较 Qwen3.5-Omni-Plus 提升超 25%,音视频性能接近 Gemini 3.8 Flash,整体音频性能声称优于后者。 (MarkTechPost)

如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,阿里巴巴通义千问团队发布多模态大模型 Qwen3.8-Omni-Flash。该模型被描述为首个围绕智能体能力构建的“全能模态”模型,可接受文本、图像、音频和视频输入,并输出文本,将音视频理解、推理和工具调用集成于单一模型。其工作流程为理解内容、规划任务、使用工具执行并交付结果。 模型基于 Qwen3.8-Flash-Next 架构,上下文窗口为 100 万 token。目前已通过 QwenCloud、阿里云 Model Studio 和 Qwen Studio 提供托管 API 服务,但未开源权重。其 API 兼容 DashScope 和 OpenAI 协议,支持函数调用、网络搜索、结构化输出等功能。 研究团队称,在长视频理解任务中,该模型采用基于问题的智能体感知路径,能显著降低 token 消耗。在 OmniVideoBench 基准测试中,准确率从 63.4 提升至 67.8,token 使用量从 145,736 降至 79,117,降幅约 45.7%。官方数据显示,在 29 项评估中,其平均得分较 Qwen3.5-Omni-Plus 提升超 25%,音视频性能接近 Gemini 3.8 Flash,整体音频性能声称优于后者。 (MarkTechPost)

如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。