跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 41–58 条 · 共 58 条
5月12日周二
  1. Google DeepMind75

    Google DeepMind 发布 Co-Scientist 多智能体科研助手

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科研假设。该系统通过 Hypothesis Generation 工具向个人研究者开放,未来几周开始推出,研究者可在 labs.google/science 注册。合作案例显示其在肝纤维化药物重定位、ALS、细胞衰老等方向取得进展。

    推荐理由:原文给出了多智能体系统的架构、开放入口和多个实验室应用案例,读者可以据此判断它如何加速科研假设生成。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 研究计划,探索医疗AI协作模式

    Google DeepMind 宣布 AI co-clinician 研究计划,探索AI作为护理团队协作成员、在医生临床监督下与患者互动的模式。在98个真实初级保健查询的盲评中,系统在97例中零关键错误,优于两个常用AI系统;在OpenFDA的RxQA开放式药物问答中超越前沿模型。

    推荐理由:原文给出了AI co-clinician在证据综合、药物问答和远程医疗模拟中的具体评测结果,读者可据此判断医疗AI当前的能力边界。

4月23日周四
  1. Google Research65

    Google Photos Auto frame 新增三维感知重构图功能

    Google 宣布在 Google Photos 的 Auto frame 功能中加入三维感知重构图方法,利用 ML 模型理解场景空间布局,并用生成式 AI 从新视角想象照片。该方法分两阶段,先估计 3D 场景和相机参数,再用生成式扩散模型补全渲染产生的空洞,可自动调整相机位姿和焦距,修复广角镜头造成的透视畸变。该功能现已上线,符合条件的含人照片可一键获得自动调整视角的第二版本。

    推荐理由:原文解释了三维感知重构图背后的两阶段方法,读者可以据此理解它与传统修图工具的本质区别。

4月16日周四
  1. Google DeepMind60

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,支持 70 多种语言和原生多说话人对话。模型引入音频标签功能,可通过自然语言指令控制语速、语气和表达方式,在 Artificial Analysis TTS 排行榜上 Elo 得分 1,211。

    推荐理由:官方介绍了新模型的音频标签控制能力和多语言覆盖,读者可据此评估它在语音生成应用中的可用性。

4月13日周一
4月3日周五
3月29日周日
  1. Google DeepMind69

    Google DeepMind 推出 AI 指针,用指向和语音替代复杂提示词

    Google DeepMind 推出由 Gemini 驱动的 AI 指针,让用户通过指向和语音与 AI 交互,无需编写复杂提示词。该功能已集成到 Chrome 中,并将在 Googlebook 笔记本上推出 Magic Pointer,用户可在 Google AI Studio 体验实验版本。

    推荐理由:原文给出了AI指针的原理和落地入口,读者可以据此判断这种交互方式会怎样改变日常使用AI的方式。

3月25日周三
  1. Google Research62

    Google 发布 Vibe Coding XR:用 Gemini 在 60 秒内生成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 XR Blocks 框架,将自然语言直接转化为带物理感知的 Android XR 应用,生成时间在 60 秒内。

    推荐理由:原文给出了从自然语言到可运行 XR 应用的完整流程和实测成功率,读者可据此评估该工作流的成熟度与上手成本。

3月24日周二
  1. Mistral AI77

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,4B 参数,支持 9 种语言,具备情感表达、低延迟和零样本跨语言声音适配。模型基于 Ministral 3B,采用 Transformer 自回归流匹配架构,模型延迟 70ms,实时因子约 9.7x。

    推荐理由:原文给出了模型架构、定价和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的适用性。

3月17日周二
3月12日周四
  1. Google Research78

    Google 推出 AI 驱动的城市突发洪水预报,提前 24 小时预警

    Google Research 宣布在 Flood Hub 上推出城市突发洪水预报,利用 AI 方法可提前 24 小时预测城市地区突发洪水风险。该方法使用 Gemini 分析新闻报告构建历史洪水数据集,模型在人口密度超过每平方公里 100 人的区域运行,空间分辨率 20x20 公里,并已在南美、东南亚等地区达到与发达国家相当的精度。

    推荐理由:原文给出了新方法、覆盖范围和与现有系统的对比,读者可以据此判断城市洪水预警的实际能力。

  2. Google Research62

    Google Research 发布 AMIE 对话式诊断 AI 真实门诊可行性研究

    Google Research 与 Beth Israel Deaconess 医学中心合作,开展了一项前瞻性单中心可行性研究,在真实门诊场景中部署对话式诊断 AI 系统 AMIE,用于患者就诊前的病史采集。

    推荐理由:原文给出了真实门诊场景下的安全性、诊断准确率和医患体验数据,读者可据此评估对话式医疗 AI 的落地可行性。

12月17日周三
  1. Mistral AI62

    Mistral 发布 OCR 3,文档解析性能大幅提升

    Mistral 发布 OCR 3,在表单、扫描件、复杂表格和手写内容上对 OCR 2 取得 74% 综合胜率,支持输出带 HTML 表格结构的 markdown。定价为每 1000 页 2 美元,Batch API 五折后降至 1 美元,模型 mistral-ocr-2512 已通过 API 和 Mistral AI Studio 的 Document AI Playground 开放使用。

    推荐理由:原文给出了 OCR 3 相对上一代的性能提升、定价与开放入口,读者可据此评估其在文档解析管线中的适用性。

12月3日周三
7月17日周四
  1. Mistral AI62

    Mistral 发布 Le Chat 多项新功能,含 Deep Research、语音模式与图像编辑

    Mistral 为 Le Chat 推出多项新功能:Deep Research 预览模式可生成结构化研究报告,语音模式由新模型 Voxtral 驱动,Think 模式由推理模型 Magistral 提供多语言思考能力,Projects 用于组织对话,并与 Black Forest Labs 合作支持直接在聊天内编辑图像。所有新功能现已在 chat.mistral.ai 及移动应用上线,无需信用卡。

    推荐理由:官方一口气上线五项新能力,读者可据此判断 Le Chat 在深度研究、语音和图像编辑上的完整能力版图。

7月15日周二
  1. Mistral AI78

    Mistral 发布开源语音理解模型 Voxtral,提供 24B 与 3B 两个版本

    Mistral AI 发布开源语音理解模型 Voxtral,提供 24B 生产级和 3B 端侧两个版本,均采用 Apache 2.0 许可并开放 API。Voxtral 支持 32k token 上下文、最长 30 分钟转写或 40 分钟理解、内置问答与摘要、多语言识别及语音直接触发函数调用。

    推荐理由:原文给出了两个开源语音模型的规模、许可和定价,读者可据此评估其在生产场景中的成本与部署选择。

3月17日周一
  1. Mistral AI72

    Mistral Small 3.1 发布:128k 上下文、多模态、Apache 2.0 开源

    Mistral AI 发布 Mistral Small 3.1,在文本性能、多模态理解和 128k 上下文窗口上较前代升级,推理速度达每秒 150 tokens,性能超越 Gemma 3 和 GPT-4o Mini,并以 Apache 2.0 许可开源。

    推荐理由:官方公布了性能对比、推理速度和开源许可,读者可据此判断它相对同类小模型的定位与适用场景。

3月7日周五
  1. Mistral AI75

    Mistral 发布 OCR API,支持多模态文档理解与自托管

    Mistral 发布 Mistral OCR,一个光学字符识别 API,可理解文档中的媒体、文本、表格和公式,并输出有序的交错文本与图像。API mistral-ocr-latest 定价为 1000 页/美元,批量推理约翻倍,已在 la Plateforme 上线,并成为 Le Chat 的默认文档理解模型。

    推荐理由:原文给出了 Mistral OCR 的基准对比、定价和自托管选项,读者可据此判断它相对现有 OCR 服务的定位。