扫码下载
搜索“Realtime”共有3条相关结果
Techub News 消息,Microsoft 宣布推出 MAI-Realtime 双向语音模型预览版,该模型支持实时双向音频处理,可实现更自然的对话体验,并支持多语言及与 Copilot 等工具的集成。 该模型与此前发布的 MAI-Voice-1 和 MAI-Transcribe-1 共同构成 Microsoft 的端到端语音 AI 体系。此举旨在减少对 OpenAI 的依赖,使公司能够自主掌控产品路线图并降低推理成本。(CryptoBriefing)
Techub News 消息,AI 初创公司 Boson AI 正准备发布其首款端到端语音模型 Higgs RealTime,支持直接从语音到语音的处理,无需经过文本转换,以实现更低延迟的自然人机交互。 与 OpenAI、Google 及 ElevenLabs 等厂商的语音产品相比,Higgs RealTime 专注于生产级低延迟场景。Boson AI 此前已推出支持 100 余种语言的 Higgs TTS 3 文本转语音模型,以及可根据单张图片生成实时说话人视频的 Higgs Avatar API。该公司早期模型 Higgs TTS 2 曾在 Hugging Face 开源,训练数据超过 1000 万小时。(CryptoBriefing)
Techub News 消息,据 CryptoBriefing 报道,阶跃星辰(StepFun)发布的语音模型 StepAudio 2.5 Realtime 在 2026 年 4 月的五项主流基准测试中均排名第一,主观人类评价得分 80.41 分,较前代基线提升 10 分。 该模型采用端到端架构,支持中英文实时交互,并引入副语言理解能力以识别语调、情绪和语速。技术报告显示,其通过角色扮演特定的 RLHF 技术保持角色一致性,区别于传统的语音识别-语言模型-语音合成流水线。