跳到正文

#多模态

今日 2 条
7月13日周一
7月9日周四
  1. Google Research70

    Google Research 发布 SensorFM,用一万亿分钟可穿戴数据训练通用健康传感器基础模型

    Google Research 发布 SensorFM,一个基于超过一万亿分钟、来自五百万名同意参与者的多模态可穿戴数据预训练的大型传感器基础模型。SensorFM 通过自监督重建学习,可跨心血管、代谢、睡眠和心理健康等任务迁移,在 35 项健康任务中 34 项优于特征工程监督基线。模型还结合了智能体课堂自动构建预测头,并能支撑个人健康智能体的端到端应用。

    推荐理由:原文给出了一万亿分钟级可穿戴数据训练的通用传感器基础模型,读者可据此判断它能否替代单任务健康模型。

7月1日周三
6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块分类和逐页逐词置信度分数,支持 170 种语言,可在单容器内自托管部署。API 定价为每 1000 页 4 美元,Batch API 折扣后 2 美元,Document AI 为 5 美元。独立标注者在人类偏好评测中更倾向于 OCR 4,平均胜率 72%,OlmOCRBench 得分 85.20。

    推荐理由:原文给出了新模型在结构化输出、多语言覆盖和自托管方面的能力变化,读者可据此判断它如何接入现有文档处理流程。

6月13日周六
  1. Google Research62

    Google Research 发布AI辅助皮肤问题理解研究

    Google Research 发布两项关于AI辅助用户理解皮肤问题的研究。一项发表于 JAMA Dermatology 的量化研究显示,使用AI工具时参与者命名皮肤状况的准确率约为对照组的三倍(23% vs 8%),但确定下一步医疗行动的能力提升不显著。另一项与斯坦福医疗AI团队合作的真实世界研究显示,使用应用后参与者命名状况的能力提升260%,临床医生认为预测与自身评估一致的比例为86%。

    推荐理由:原文给出两项研究的具体数据,读者可据此判断AI辅助皮肤问题识别对用户理解的实际增益与局限。

6月11日周四
  1. Google DeepMind79

    Google DeepMind 发布开源扩散模型 DiffusionGemma,推理速度最高提升 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。

    推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。

6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是最新的音频模型,支持 70 多种语言的近实时语音到语音翻译,能保留说话者的语调、节奏和音高,并连续生成语音而非逐轮等待。

    推荐理由:原文给出了新模型的连续语音翻译能力、覆盖语言数和各产品入口,读者可据此判断它如何改变跨语言实时沟通。

6月5日周五
  1. Google Research62

    Google 在 Nature 发表论文:用手机前置摄像头实现被动心率监测

    Google Research 在 Nature 发表论文,介绍被动心率监测系统 PHRM,利用手机前置摄像头在面部解锁后拍摄视频,通过深度学习估计心率,MAPE 小于 10%,并估算每日静息心率,MAE 小于 5 bpm,准确度达到可穿戴设备水平。

    推荐理由:原文给出了PHRM系统的技术路线、跨肤色准确率数据和公开数据集,读者可据此评估被动心率监测的可行性与局限。

5月29日周五
  1. Google Research62

    Google Research 在 I/O 2026 发布 Gemini for Science 与 Antigravity 2.0 等多项成果

    Google Research 在 I/O 2026 上发布多项成果,包括面向科学研究的 Gemini for Science 工具套件(含 Computational Discovery、Hypothesis Generation 等)、升级的智能体开发平台 Antigravity 2.0,以及基于 Coral NPU 的 Synaptics Coralboard 开发板。

    推荐理由:原文汇总了 Gemini for Science、Antigravity 2.0、Coralboard 等多项发布,读者可借此把握 Google 在科学研究和开发者工具上的整体布局。

5月18日周一
  1. Google DeepMind58

    Google DeepMind 推出 Project Genie 街景锚定能力并面向全球 AI Ultra 订阅者开放

    Google DeepMind 宣布将 Genie 世界模型与 Google 街景真实影像结合,推出 Project Genie 的街景锚定能力,用户可选择美国地点并套用风格生成以真实位置为起点的互动世界。该功能即日起逐步向全球符合条件的 Google AI Ultra 200 美元订阅者开放,Project Genie 仍是 Google Labs 的实验性研究原型。

5月17日周日
5月16日周六
  1. Google DeepMind38

    Google DeepMind 与新加坡政府达成新国家 AI 合作伙伴关系

    Google DeepMind 宣布与新加坡政府建立新的国家 AI 合作伙伴关系,聚焦医疗、教育、科研与可持续发展。合作包括探索 AI 共诊、推进传染病研究、开发 Gemma 驱动的视障跑步助手,并向中小学至初院全体教师提供 Gemini for Education。据估算,AI 加速研发有望到 2040 年为新加坡带来额外 33 亿新元(25 亿美元)经济价值。

  2. Google DeepMind78

    Google DeepMind 详解 WeatherNext 如何帮助美国国家飓风中心提前五天预测飓风 Melissa 登陆牙买加

    Google DeepMind 发布文章,介绍其 AI 天气模型 WeatherNext 在 2025 年飓风 Melissa 中帮助美国国家飓风中心(NHC)提前五天以 80% 置信度预测其将以五级强度登陆牙买加,三天前置信度升至接近 100%。

    推荐理由:原文展示了 WeatherNext 在飓风预报中的实际应用与验证数据,读者可据此了解 AI 天气模型如何辅助官方预警决策。

  3. Google DeepMind85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。

5月12日周二
  1. Google DeepMind75

    Google DeepMind 发布 Co-Scientist 多智能体科研助手

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科研假设。该系统通过 Hypothesis Generation 工具向个人研究者开放,未来几周开始推出,研究者可在 labs.google/science 注册。合作案例显示其在肝纤维化药物重定位、ALS、细胞衰老等方向取得进展。

    推荐理由:原文给出了多智能体系统的架构、开放入口和多个实验室应用案例,读者可以据此判断它如何加速科研假设生成。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 研究计划,探索医疗AI协作模式

    Google DeepMind 宣布 AI co-clinician 研究计划,探索AI作为护理团队协作成员、在医生临床监督下与患者互动的模式。在98个真实初级保健查询的盲评中,系统在97例中零关键错误,优于两个常用AI系统;在OpenFDA的RxQA开放式药物问答中超越前沿模型。

    推荐理由:原文给出了AI co-clinician在证据综合、药物问答和远程医疗模拟中的具体评测结果,读者可据此判断医疗AI当前的能力边界。

4月23日周四
  1. Google Research65

    Google Photos Auto frame 新增三维感知重构图功能

    Google 宣布在 Google Photos 的 Auto frame 功能中加入三维感知重构图方法,利用 ML 模型理解场景空间布局,并用生成式 AI 从新视角想象照片。该方法分两阶段,先估计 3D 场景和相机参数,再用生成式扩散模型补全渲染产生的空洞,可自动调整相机位姿和焦距,修复广角镜头造成的透视畸变。该功能现已上线,符合条件的含人照片可一键获得自动调整视角的第二版本。

    推荐理由:原文解释了三维感知重构图背后的两阶段方法,读者可以据此理解它与传统修图工具的本质区别。

4月16日周四
  1. Google DeepMind60

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,支持 70 多种语言和原生多说话人对话。模型引入音频标签功能,可通过自然语言指令控制语速、语气和表达方式,在 Artificial Analysis TTS 排行榜上 Elo 得分 1,211。

    推荐理由:官方介绍了新模型的音频标签控制能力和多语言覆盖,读者可据此评估它在语音生成应用中的可用性。

4月13日周一
4月9日周四
4月3日周五
3月29日周日
  1. Google DeepMind69

    Google DeepMind 推出 AI 指针,用指向和语音替代复杂提示词

    Google DeepMind 推出由 Gemini 驱动的 AI 指针,让用户通过指向和语音与 AI 交互,无需编写复杂提示词。该功能已集成到 Chrome 中,并将在 Googlebook 笔记本上推出 Magic Pointer,用户可在 Google AI Studio 体验实验版本。

    推荐理由:原文给出了AI指针的原理和落地入口,读者可以据此判断这种交互方式会怎样改变日常使用AI的方式。

3月25日周三
  1. Google Research62

    Google 发布 Vibe Coding XR:用 Gemini 在 60 秒内生成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 XR Blocks 框架,将自然语言直接转化为带物理感知的 Android XR 应用,生成时间在 60 秒内。

    推荐理由:原文给出了从自然语言到可运行 XR 应用的完整流程和实测成功率,读者可据此评估该工作流的成熟度与上手成本。

  2. Google Research38

    S2Vec:谷歌如何用自监督框架学习城市“语言”

    Google Research 推出 S2Vec,一个用于学习建成环境通用嵌入向量的自监督框架。它通过 S2 Geometry 分区和特征栅格化将地理数据转化为多层图像,再用掩码自编码(MAE)学习位置特征,无需人工标注即可预测人口密度、收入等社会经济指标。评测中,S2Vec 在零样本地理泛化任务上表现最佳,与图像嵌入融合后效果更优。

3月24日周二
  1. Mistral AI77

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,4B 参数,支持 9 种语言,具备情感表达、低延迟和零样本跨语言声音适配。模型基于 Ministral 3B,采用 Transformer 自回归流匹配架构,模型延迟 70ms,实时因子约 9.7x。

    推荐理由:原文给出了模型架构、定价和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的适用性。

3月18日周三
3月17日周二
3月12日周四
  1. Google Research78

    Google 推出 AI 驱动的城市突发洪水预报,提前 24 小时预警

    Google Research 宣布在 Flood Hub 上推出城市突发洪水预报,利用 AI 方法可提前 24 小时预测城市地区突发洪水风险。该方法使用 Gemini 分析新闻报告构建历史洪水数据集,模型在人口密度超过每平方公里 100 人的区域运行,空间分辨率 20x20 公里,并已在南美、东南亚等地区达到与发达国家相当的精度。

    推荐理由:原文给出了新方法、覆盖范围和与现有系统的对比,读者可以据此判断城市洪水预警的实际能力。

  2. Google Research62

    Google Research 发布 AMIE 对话式诊断 AI 真实门诊可行性研究

    Google Research 与 Beth Israel Deaconess 医学中心合作,开展了一项前瞻性单中心可行性研究,在真实门诊场景中部署对话式诊断 AI 系统 AMIE,用于患者就诊前的病史采集。

    推荐理由:原文给出了真实门诊场景下的安全性、诊断准确率和医患体验数据,读者可据此评估对话式医疗 AI 的落地可行性。

1月10日周六
  1. Berkeley AI Research40

    信息驱动式成像系统设计:直接评估与优化成像信息含量

    伯克利AI研究团队提出一种直接基于信息含量评估与优化成像系统的框架,无需训练重建或分类网络。该方法利用成像系统已知的噪声物理特性,仅从含噪测量中估计互信息,并在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证了其预测性能。优化该信息指标可达到与端到端方法相当的设计效果,同时减少内存与计算需求,且无需任务特定的解码器设计。

12月17日周三
  1. Mistral AI62

    Mistral 发布 OCR 3,文档解析性能大幅提升

    Mistral 发布 OCR 3,在表单、扫描件、复杂表格和手写内容上对 OCR 2 取得 74% 综合胜率,支持输出带 HTML 表格结构的 markdown。定价为每 1000 页 2 美元,Batch API 五折后降至 1 美元,模型 mistral-ocr-2512 已通过 API 和 Mistral AI Studio 的 Document AI Playground 开放使用。

    推荐理由:原文给出了 OCR 3 相对上一代的性能提升、定价与开放入口,读者可据此评估其在文档解析管线中的适用性。

12月3日周三
8月1日周五
7月17日周四
  1. Mistral AI62

    Mistral 发布 Le Chat 多项新功能,含 Deep Research、语音模式与图像编辑

    Mistral 为 Le Chat 推出多项新功能:Deep Research 预览模式可生成结构化研究报告,语音模式由新模型 Voxtral 驱动,Think 模式由推理模型 Magistral 提供多语言思考能力,Projects 用于组织对话,并与 Black Forest Labs 合作支持直接在聊天内编辑图像。所有新功能现已在 chat.mistral.ai 及移动应用上线,无需信用卡。

    推荐理由:官方一口气上线五项新能力,读者可据此判断 Le Chat 在深度研究、语音和图像编辑上的完整能力版图。

7月15日周二
  1. Mistral AI78

    Mistral 发布开源语音理解模型 Voxtral,提供 24B 与 3B 两个版本

    Mistral AI 发布开源语音理解模型 Voxtral,提供 24B 生产级和 3B 端侧两个版本,均采用 Apache 2.0 许可并开放 API。Voxtral 支持 32k token 上下文、最长 30 分钟转写或 40 分钟理解、内置问答与摘要、多语言识别及语音直接触发函数调用。

    推荐理由:原文给出了两个开源语音模型的规模、许可和定价,读者可据此评估其在生产场景中的成本与部署选择。

3月17日周一
  1. Mistral AI72

    Mistral Small 3.1 发布:128k 上下文、多模态、Apache 2.0 开源

    Mistral AI 发布 Mistral Small 3.1,在文本性能、多模态理解和 128k 上下文窗口上较前代升级,推理速度达每秒 150 tokens,性能超越 Gemma 3 和 GPT-4o Mini,并以 Apache 2.0 许可开源。

    推荐理由:官方公布了性能对比、推理速度和开源许可,读者可据此判断它相对同类小模型的定位与适用场景。

3月7日周五
  1. Mistral AI75

    Mistral 发布 OCR API,支持多模态文档理解与自托管

    Mistral 发布 Mistral OCR,一个光学字符识别 API,可理解文档中的媒体、文本、表格和公式,并输出有序的交错文本与图像。API mistral-ocr-latest 定价为 1000 页/美元,批量推理约翻倍,已在 la Plateforme 上线,并成为 Le Chat 的默认文档理解模型。

    推荐理由:原文给出了 Mistral OCR 的基准对比、定价和自托管选项,读者可据此判断它相对现有 OCR 服务的定位。