跳到正文

#语音

今日 2 条
今天9月29日周二
  1. TechCrunch · AI38

    Modulate 获 2500 万美元融资,用于语音模型与深度伪造检测分析套件

    波士顿语音智能初创公司 Modulate 完成 2500 万美元新融资,由 Future Ventures 领投,Hyperplane 和 Lakestar 参投。该公司运行 100 多个小模型,为企业提供转录、情绪分析、深度伪造与 AI 音乐检测,以及面向受监管行业语音智能体的政策执行。本轮前,Modulate 已累计融资 4100 万美元,估值达 1.7 亿美元。

9月26日周六
9月25日周五
9月16日周三
9月10日周四
8月27日周四
7月1日周三
  1. Hugging Face Blog60

    Hugging Face 与 Cerebras 联手推出实时语音 AI 演示

    Hugging Face 与 Cerebras 合作推出实时语音 AI 演示,构建了全开源的级联式语音到语音流水线:语音输入经 Nvidia Parakeet 识别,由 Cerebras 上的 Gemma 4 31B 处理,再经阿里 Qwen3TTS 合成语音输出。该流水线已驱动超过 9,000 台 Reachy Mini 机器人,旨在通过低延迟和稳定推理改善对话的自然感。

    推荐理由:原文展示了开源语音流水线与 Cerebras 推理速度结合后的实时对话体验,读者可据此评估端到端语音方案的延迟表现。

4月16日周四
  1. Google DeepMind60

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,支持 70 多种语言和原生多说话人对话。模型引入音频标签功能,可通过自然语言指令控制语速、语气和表达方式,在 Artificial Analysis TTS 排行榜上 Elo 得分 1,211。

    推荐理由:官方介绍了新模型的音频标签控制能力和多语言覆盖,读者可据此评估它在语音生成应用中的可用性。

2月5日周四
7月17日周四
  1. Mistral AI62

    Mistral 发布 Le Chat 多项新功能,含 Deep Research、语音模式与图像编辑

    Mistral 为 Le Chat 推出多项新功能:Deep Research 预览模式可生成结构化研究报告,语音模式由新模型 Voxtral 驱动,Think 模式由推理模型 Magistral 提供多语言思考能力,Projects 用于组织对话,并与 Black Forest Labs 合作支持直接在聊天内编辑图像。所有新功能现已在 chat.mistral.ai 及移动应用上线,无需信用卡。

    推荐理由:官方一口气上线五项新能力,读者可据此判断 Le Chat 在深度研究、语音和图像编辑上的完整能力版图。

7月15日周二
  1. Mistral AI78

    Mistral 发布开源语音理解模型 Voxtral,提供 24B 与 3B 两个版本

    Mistral AI 发布开源语音理解模型 Voxtral,提供 24B 生产级和 3B 端侧两个版本,均采用 Apache 2.0 许可并开放 API。Voxtral 支持 32k token 上下文、最长 30 分钟转写或 40 分钟理解、内置问答与摘要、多语言识别及语音直接触发函数调用。

    推荐理由:原文给出了两个开源语音模型的规模、许可和定价,读者可据此评估其在生产场景中的成本与部署选择。