跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

7条精选相关主题多模态AI 视频产品更新

最新精选

第 1–7 条 · 共 7 条
9月16日周三
8月27日周四
7月1日周三
  1. Hugging Face Blog60

    Hugging Face 与 Cerebras 联手推出实时语音 AI 演示

    Hugging Face 与 Cerebras 合作推出实时语音 AI 演示,构建了全开源的级联式语音到语音流水线:语音输入经 Nvidia Parakeet 识别,由 Cerebras 上的 Gemma 4 31B 处理,再经阿里 Qwen3TTS 合成语音输出。该流水线已驱动超过 9,000 台 Reachy Mini 机器人,旨在通过低延迟和稳定推理改善对话的自然感。

    推荐理由:原文展示了开源语音流水线与 Cerebras 推理速度结合后的实时对话体验,读者可据此评估端到端语音方案的延迟表现。

4月16日周四
  1. Google DeepMind60

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,支持 70 多种语言和原生多说话人对话。模型引入音频标签功能,可通过自然语言指令控制语速、语气和表达方式,在 Artificial Analysis TTS 排行榜上 Elo 得分 1,211。

    推荐理由:官方介绍了新模型的音频标签控制能力和多语言覆盖,读者可据此评估它在语音生成应用中的可用性。

2月5日周四
7月17日周四
  1. Mistral AI62

    Mistral 发布 Le Chat 多项新功能,含 Deep Research、语音模式与图像编辑

    Mistral 为 Le Chat 推出多项新功能:Deep Research 预览模式可生成结构化研究报告,语音模式由新模型 Voxtral 驱动,Think 模式由推理模型 Magistral 提供多语言思考能力,Projects 用于组织对话,并与 Black Forest Labs 合作支持直接在聊天内编辑图像。所有新功能现已在 chat.mistral.ai 及移动应用上线,无需信用卡。

    推荐理由:官方一口气上线五项新能力,读者可据此判断 Le Chat 在深度研究、语音和图像编辑上的完整能力版图。

7月15日周二
  1. Mistral AI78

    Mistral 发布开源语音理解模型 Voxtral,提供 24B 与 3B 两个版本

    Mistral AI 发布开源语音理解模型 Voxtral,提供 24B 生产级和 3B 端侧两个版本,均采用 Apache 2.0 许可并开放 API。Voxtral 支持 32k token 上下文、最长 30 分钟转写或 40 分钟理解、内置问答与摘要、多语言识别及语音直接触发函数调用。

    推荐理由:原文给出了两个开源语音模型的规模、许可和定价,读者可据此评估其在生产场景中的成本与部署选择。