跳到正文

全部动态

今日 4 条
9月3日周四
  1. Google DeepMind62

    Google DeepMind 推出 Fairwind 计划,向政府和合作伙伴开放高级网络防御能力

    Google DeepMind 今日推出 Fairwind 计划,这是一个面向政府和受信任合作伙伴的有限访问项目,提供其最先进的网络防御能力。该计划首先让防御者使用 Gemini 3.8 Flash Cyber 模型和 CodeMender 工具,自主发现并修复漏洞,在组织安全云环境中几分钟内生成可部署的补丁。

    推荐理由:原文给出了 Fairwind 计划的准入对象、能力组合和开放范围,读者可据此判断该计划对自身组织的适用性。

9月2日周三
  1. Google DeepMind80

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,可将 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。

    推荐理由:官方给出了 token 与成本降幅和准确率提升的具体数字,读者可据此判断该功能对长视频分析的实际价值。

9月1日周二
  1. GitHub · Dify18

    Dify v1.16.1 发布:Bug 修复与安全增强

    Dify v1.16.1 发布,主要包含 Bug 修复与安全增强。新增工具多选输入、工作流节点定位、侧边栏导出 Agent DSL 等功能。安全方面,Agent 沙箱现通过 Squid 正向代理运行并采用令牌认证,同时修复了 Jinja2 模板注入漏洞。性能上,新增轻量级 recent apps 端点,使首页“继续工作”区域延迟降低约 69%(3.2 倍提速)。

  2. Hugging Face Blog73

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核加速本地 AI 推理

    Hugging Face 发布 @huggingface/kernels,一个用于从 Hub 加载和运行优化 WebGPU 内核的库,并推出 207 个内核的初始集合,Apache-2.0 许可。在 Apple M4 GPU 上与 ORT WebGPU 对比,几何平均快 2.57 倍,中位数快 1.90 倍。同时推出 Fleet 浏览器基准测试套件,用于众包收集真实 GPU 上的正确性和性能证据。

    推荐理由:原文给出了 207 个 WebGPU 内核的发布、性能对比数据和开源许可,读者可据此评估浏览器端推理的加速空间。

8月31日周一
  1. GitHub · Open WebUI28

    Open WebUI v0.11.2 发布:终端文件预览增强、消息开销降低及多项修复

    Open WebUI v0.11.2 发布,为终端生成的 Word 文档和幻灯片提供成品级预览,并新增可点击的页码缩略图。未配置管道的部署不再为每条消息支付额外开销,多 worker 部署的模型列表刷新和 Redis 后端 websocket 服务器负载也显著降低。此版本还包含安全与访问控制修复,并建议生产环境尽快更新。

8月28日周五
  1. Hugging Face Blog69

    Open ASR Leaderboard 新增首个全球南方语言印地语评测集

    Hugging Face 与 Voice Arena 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测集 Monsoon,这是该榜单多语言标签页首次覆盖印度语言。四个子集共 4,888 位说话人,记录 12 项说话人属性,并采用私有分割防止针对榜单的优化。印地语集因拼写变体众多改用 OIWER 指标,并开源实现 voi-oiwer 以便复现。

    推荐理由:原文展示了区域、设备等元数据如何暴露榜单上被平均掩盖的模型差异,读者可据此理解评测设计对模型选型的影响。

  2. Google Research62

    Google Earth AI 推出行星预测引擎 PPE,自主完成地理空间建模全流程

    Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。

    推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。

8月27日周四
  1. Google DeepMind62

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在加密环境中,防止模型提前看到测试题。该评测与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,用 Gemini Flash Lite 模型在隐私保护环境中测试机密基准,以提升评测完整性。

    推荐理由:原文介绍了用加密环境做双盲评测的具体做法,读者可借此理解如何缓解基准污染、提升评测可信度。

8月26日周三
  1. GitHub · Open WebUI62

    Open WebUI v0.11.1 发布:新增人工审批工具调用与多项性能优化

    Open WebUI 发布 v0.11.1,新增人工审批工具调用功能,管理员开启后可在对话中逐次允许或拒绝模型使用工具;模型还可暂停并提问最多三个选择题。同时重构了流式传输,长回复数据传输量最高减少 1000 倍,并修复了知识库越权访问、文档解压炸弹等多项安全漏洞,建议生产环境尽快升级。

8月25日周二
  1. Hugging Face Blog62

    Gradio 推出 gr.Workflow,把 AI 流程变成可视化画布与 REST API

    Gradio 发布内置的 gr.Workflow,让用户把多步 AI 流程描述为类型化节点图,Gradio 会提供可拖拽画布,每个节点可运行且中间结果可见。同一张图同时是 REST API,并支持一键部署到 Hugging Face Spaces。文中给出图像编辑、媒体工作室、并行生成、数据集分析等可复制的示例 Space。

    推荐理由:原文展示了把多步 AI 流程变成可视化画布、REST API 和一键部署的具体用法,读者可据此判断它能否简化自己的管线搭建。

8月23日周日
8月21日周五
8月20日周四
  1. Mistral AI72

    Mistral 发布 Agentic Search,提升复杂文档检索准确率并降低延迟

    Mistral 发布 Agentic Search,一个多步骤检索层,让模型能搜索、导航、读取并验证复杂文档中的信息。在 FinanceBench 上,准确率从 26.7% 提升至 86%,OfficeQA Pro 上提升 45.6 个百分点;p90 延迟降低最多 39.6%,token 消耗减少三分之一。

    推荐理由:官方给出了基准测试的准确率、延迟和 token 消耗数据,读者可据此判断 Agentic Search 相比传统 RAG 的实际收益。

8月13日周四
  1. Hugging Face Blog62

    OlmoEarth Studio 推出自定义嵌入向量导出功能

    OlmoEarth Studio 现支持计算并导出嵌入向量,用户可通过 UI 或 API 选择感兴趣区域、时间范围、编码器变体和分辨率,得到 Cloud-Optimized GeoTIFF。嵌入向量支持相似性搜索、少样本分割、变化检测和 PCA 探索等下游任务,模型权重和源码已公开。Studio 还支持监督微调(SFT)以提升性能。

    推荐理由:原文给出了嵌入向量的导出方式、参数选项和下游任务示例,读者可据此判断它是否适合自己的遥感分析场景。

8月11日周二
7月30日周四
  1. Google DeepMind55

    Google DeepMind 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。

7月27日周一
  1. Hugging Face Blog62

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式模拟器

    NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式模拟器。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上实现约 160 帧每秒的交互式运行,支持键盘、Meta Quest 控制器或学习策略闭环控制。

    推荐理由:原文给出了从离线世界模型到实时交互模拟器的能力跃迁和具体帧率数字,读者可据此判断它在手术机器人训练与评估中的适用场景。

7月23日周四
7月21日周二
  1. Hugging Face Blog70

    Hugging Face 发布 Grabette 开源手持采集系统

    Hugging Face 发布 Grabette,一套开源、低成本的机器人操作数据采集系统,手持夹爪配合双摄像头即可记录演示并自动生成 LeRobot 格式数据集,无需机器人或实验室。整套硬件与处理管线全部开源,配套 Gripette 机械夹爪用于训练后执行,目标是推动社区共建大规模操作数据集。

    推荐理由:原文给出了低成本手持采集方案的全套开源硬件与处理流程,读者可据此判断它能否降低机器人数据采集门槛。

7月13日周一
7月9日周四
  1. GitHub · Dify62

    Dify 1.16.0-rc1 实验性推出 Dify Agent

    Dify 发布 1.16.0-rc1,实验性推出 Dify Agent,可在 Linux 沙箱中运行,支持通过 UI 构建、上传 Skills 和文件、连接工具与知识,并集成到 Dify Workflow 或发布为 Web 应用。当前所有 Agent 共享同一沙箱,隔离将在未来版本实现,官方警告仅向可信用户提供服务。

  2. Mistral AI50

    Mistral Studio 为 Prompts 和 Skills 提供系统化记录

    Mistral Studio 今日起为 Prompts 和 Skills 提供系统化记录,实现版本管理、明确归属与全程可追溯。每个版本不可变,支持对比回滚,变更记录含操作者与时间,并通过标签分类和审计日志确保合规。资产可直接作为 MCP 服务器运行,结合可观测性追踪生产输出与版本关联,数据始终留在企业边界内。

7月8日周三
  1. Hugging Face Blog75

    vLLM transformers 建模后端提速至原生速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。

    推荐理由:原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。

7月7日周二
  1. Hugging Face Blog78

    LeRobot v0.6.0 发布:引入世界模型、新 VLA 与统一评测基准

    LeRobot v0.6.0 正式发布,旨在闭环机器人学习流程。新版本引入三种世界模型策略(VLA-JEPA、LingBot-VA、FastWAM),新增多个 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),并推出统一的奖励模型 API(Robometer、TOPReward)。

    推荐理由:官方发布 LeRobot v0.6.0,涵盖世界模型、新 VLA、奖励模型、评测基准与部署 CLI,可帮助读者了解开源机器人学习框架的最新能力。

  2. Hugging Face Blog78

    SkyPilot 与 Hugging Face 联合推出零出口流量存储,跨云训练直接挂载 Hub 数据

    SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。

    推荐理由:原文给出了 hf:// 挂载、零出口流量和 Xet 去重的具体机制与实测数字,读者可据此判断跨云训练的数据成本能省多少。

7月6日周一
  1. Hugging Face Blog62

    Hugging Face 重构 Kernels 项目:新增内核仓库类型、代码签名与智能体开发支持

    Hugging Face 发布 Kernels 项目重大更新,在 Hub 上引入新的 kernel 仓库类型,并默认只加载受信任发布者的内核,同时加入基于 Sigstore cosign 的代码签名机制。

    推荐理由:原文梳理了内核仓库类型、签名验证和 CLI 重构等关键变化,读者可据此判断新内核工作流的安全边界与适配范围。

7月1日周三
  1. Hugging Face Blog60

    Hugging Face 与 Cerebras 联手推出实时语音 AI 演示

    Hugging Face 与 Cerebras 合作推出实时语音 AI 演示,构建了全开源的级联式语音到语音流水线:语音输入经 Nvidia Parakeet 识别,由 Cerebras 上的 Gemma 4 31B 处理,再经阿里 Qwen3TTS 合成语音输出。该流水线已驱动超过 9,000 台 Reachy Mini 机器人,旨在通过低延迟和稳定推理改善对话的自然感。

    推荐理由:原文展示了开源语音流水线与 Cerebras 推理速度结合后的实时对话体验,读者可据此评估端到端语音方案的延迟表现。

  2. Google Research62

    Google Research 发布 50+ 城市建筑级屋顶反照率数据集及 Heat Resilience Earth Engine App

    Google Research 发布覆盖 50+ 城市、9 个国家的建筑级屋顶反照率数据集,并上线 Heat Resilience Earth Engine App 供公众使用。

    推荐理由:原文给出了数据覆盖范围、精度验证和开放入口,读者可以据此判断这类建筑级反照率数据对城市热缓解规划的实际可用性。

6月30日周二
6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 内置计算机使用能力,支持跨平台智能体构建

    Google DeepMind 宣布计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面端看、推理并行动的智能体。

    推荐理由:原文说明了计算机使用能力从独立模型并入主模型后的性能提升与安全机制,读者可据此评估企业自动化场景的适用性。