跳到正文

全部动态

今日 4 条
今天9月29日周二
  1. The Verge · AI40

    Engram 采样器:将 AI 幻觉变成音乐

    音乐初创公司 Thoughtful Things 为旗下首款乐器 Engram 发起 Kickstarter 众筹。这是一款采样器与律动工作站,利用本地运行的“微型 AI”处理输入音频,甚至能幻觉出全新声音,旨在探索实验性音色而非生成流行歌曲。其模型基于仅含商用授权音频的开放数据集自研训练,公司计划开源固件,众筹限量版起价 $675。

  2. TechCrunch · AI47

    Google 关停 Gemini 的 Gems,将其迁移为“skills”

    Google 宣布关停 Gemini 的 Gems 功能,用户创建的 Gems 将自动迁移为可跨任务使用的“skills”,无需用户手动操作,迁移自 2026 年 11 月 17 日起生效。Gems 于 2024 年推出,旨在让用户无需重复指令即可定制 AI 助手,但新交互需在任务线程中输入“/”选择技能,对普通用户不够友好。

  3. AWS Machine Learning Blog70

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度

    xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。

    推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。

9月28日周一
  1. The Decoder62

    英伟达推出内置芯片的智能体看门狗 Sentry

    英伟达推出智能体安全看门狗 Sentry,作为 BlueField-4 DPU 的参考设计,与主计算分离运行,可在智能体试图越界时于毫秒内隔离。Sentry 结合 3 月开源的 OpenShell 沙箱和 9 月 10 日推出的形式化验证工具,用于检测权限是否越限。英伟达称兼容系统只需软件更新即可启用,但未公布独立上市日期,也未给出检测可靠性数据。

  2. The Verge · AI62

    Nvidia 推出 Open Agent Safety Platform,可在毫秒内隔离越界 AI 智能体

    Nvidia 推出新的 Open Agent Safety Platform,用于监控和隔离 AI 智能体,可在毫秒内隔离试图越界的智能体。该平台基于 Nvidia 的 OpenShell 开源软件,运行在 Vera AI CPU 上,用户可选择智能体可访问的信息,OpenShell 在任务前和任务中检查这些限制,并借助独立芯片上的 Sentry 技术持续监控和执行边界。

9月26日周六
  1. GitHub · gpt-load12

    gpt-load v2.0.0-rc.34 发布

    gpt-load 发布 v2.0.0-rc.34,2.x 为全新重写版本,与 1.x 数据不兼容,需以全新数据库和新的 encryption.key 部署。本次更新为网关新增语音模式和实时通话重试,恢复 WebSocket 错误恢复,并为渠道新增七个兼容预设及 OpenCode Go 和 Zen 预设。

9月25日周五
  1. GitHub · Langfuse15

    Langfuse v4.45.4 发布

    Langfuse 发布 v4.45.4 版本,主要更新包括刷新 assistant 中嵌入的 Langfuse 技能,并跳过 Azure LLM 连接测试直至 CI 密钥更换。完整变更记录见 v4.45.3...v4.45.4。

  2. GitHub · Langfuse8

    Langfuse v4.45.3 发布

    Langfuse 发布 v4.45.3,主要包含多项修复:更新 image-size 依赖至 2.0.4,API key 查找失败时记录公钥,拒绝以 /systemone 结尾或含查询字符串的 TypeSafe 基础 URL,切换上游时保留自定义 TypeSafe 基础 URL,以及修复 evals 中决策模型的选择与去重问题。

  3. GitHub · Langfuse8

    Langfuse v4.45.2 发布

    Langfuse 发布 v4.45.2,为 AI 网关新增按项目批处理推理遥测并自动重试瞬时故障。该版本还修复了元数据键冲突、批量导出报错、OpenAPI 类型定义及 SSO 发现错误等问题,并优化了评分查询性能。

  4. Google DeepMind62

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为对话模型加入实时视频形象

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成能力,可边听边看边用动态视觉形象说话。该功能支持精确唇形同步、自然表情和流畅轮换,并可在后台异步调用工具的同时保持对话不中断。即日起在 Gemini Enterprise 中可用,支持跨 97 种语言无缝切换,所有输出均带 SynthID 水印。

    推荐理由:原文给出了实时视频形象、异步工具调用和 97 语言同步等能力细节,读者可据此判断企业客服等场景的落地方式。

9月24日周四
  1. Ars Technica · AI65

    Meta 将 AI 助手 Muse 带上眼镜,推出无摄像头 Ray-Ban 与轻量 VR 眼镜

    Meta 宣布将 AI 助手 Muse 引入其眼镜产品,并推出无摄像头的 Ray-Ban 音频眼镜及多款新镜框,同时发布比 Quest 3 轻五倍、售价 1300 美元的 VR 眼镜。Muse 助手将支持超逼真数字替身用于视频通话,但公司需说服用户连接个人数据,且已修复可被黑客控制 Muse 代理的漏洞,亚马逊也阻止了其代理访问购物平台。

  2. GitHub · Langfuse15

    Langfuse v4.45.1 发布

    Langfuse v4.45.1 发布,修复了 PieChart 颜色与其他图表不一致的问题,并更新了评分测试逻辑。该版本还为 TypeSafe 连接新增了默认及自定义模型支持。

  3. Ars Technica · AI28

    YouTube 承诺今年晚些时候推出自定义信息流和更多 AI 功能

    YouTube 在年度 Made on YouTube 活动上预告了未来数月将上线的新功能,包括面向观众和创作者的大量 AI 更新。平台将推出 Custom Feeds,用户可通过输入描述创建个性化标签页,并支持保存“多个”信息流,该功能即将在美国的网页、移动端和电视端上线。此外,评论框将支持发布 GIF,私信功能也将新增群聊支持,后者初期仅在美国、英国、新加坡、巴西及部分欧洲国家可用。

  4. Google DeepMind62

    Google 为 Private AI Compute 引入安全服务端内存,实现跨设备持久记忆

    Google 公布 Private AI Compute 架构更新,新增安全服务端内存层,让 AI 助手在云端获得跨设备持久记忆,同时保持设备端隐私标准。数据被密封在加密存储中,解锁密钥仅存于个人设备,即使 Google 也无法访问;处理时通过端到端加密通道在安全隔离区临时解密,随后立即重新加密。Google 还发布了防篡改的服务器软件公开记录及独立安全审计结果,供社区验证。

    推荐理由:原文给出了加密存储与设备端密钥分离的架构细节,读者可据此判断云端持久记忆的隐私边界。

9月23日周三
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建自定义角色声音、逐行导演表演,并覆盖 100 多种语言。

    推荐理由:原文给出了两款新语音模型的能力边界、开放入口和评测排名,读者可据此判断其适用场景。