Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
微软亚洲研究院(新加坡)迎来成立一周年。该实验室于2025年7月24日启用,是微软在东南亚的首个研究实验室,聚焦下一代AI模型与智能体系统、领域特定AI、AI原生研究实践及生态与人才发展四大支柱。其研究通过医疗、金融、教育等领域的合作推动现实应用,并与新加坡经济发展局等机构建立了战略合作。
Nvidia 在周一发布 Open Agent Safety Platform,通过 OpenShell 软件边界与运行在 BlueField-4 上的 Sentry 监控系统,为 AI 智能体提供独立于 CPU/GPU 的硬件级安全层,可在毫秒内隔离越界行为。该平台已获 Anthropic、Arm、Microsoft、Oracle、SpaceX 等多家公司支持,OpenAI 未在参与名单中。
AWS 发布教程,演示如何在 SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS 模型,实现文本流式输入和音频流式输出的双向实时语音应用。
本文展示如何在 Amazon SageMaker AI 上部署两个基于同一 AWS vLLM-Omni DLC 的端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像动画化为短视频。
Mistral 在慕尼黑开设新中心,聚焦 Physics AI 与工业 AI,并直接服务企业合作伙伴。该中心将组建 Physics AI 和工业 AI 专项研究团队,并与宝马、西门子能源及慕尼黑工业大学合作。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重架构支持模型在客户自有基础设施上运行,数据不离开组织。
Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,以自然语言指令驱动浏览器工作流,在早期企业用例中对浏览器工作流准确率超过 90%。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的解决方案,涵盖适配器提升、文档路由与生产安全三大挑战。通过将适配器 ID 外部化到 AWS Systems Manager Parameter Store,更新生产引用可实现零停机、无需重新部署应用,将原本耗时数小时或数天的协调工作缩短至数秒。
英伟达推出智能体安全看门狗 Sentry,作为 BlueField-4 DPU 的参考设计,与主计算分离运行,可在智能体试图越界时于毫秒内隔离。Sentry 结合 3 月开源的 OpenShell 沙箱和 9 月 10 日推出的形式化验证工具,用于检测权限是否越限。英伟达称兼容系统只需软件更新即可启用,但未公布独立上市日期,也未给出检测可靠性数据。
gpt-load 发布 v2.0.0-rc.37,新增 Mistral 原生路由支持,并修复了 bifrost 协议下 provider base URL 语义不一致的问题。2.x 为全新重写版本,与 1.x 数据不兼容,需使用全新数据库和新的 encryption.key 部署。
LiteLLM v1.104.0-rc.1 发布,所有 Docker 镜像均使用 cosign 签名,并支持通过固定提交哈希或发布标签进行签名验证。该版本还包含多项修复,如 Azure code_interpreter 容器文件测试覆盖、预算 Redis 管道同步读取修复,以及将 SDK 回调迁移至 Langfuse v4。
LiteLLM v1.103.0 发布,所有 Docker 镜像均使用 cosign 签名,并支持通过固定 commit hash 或 release tag 进行签名验证。
Apache APISIX 发布 3.19.0 版本,由 shreemaan-abhishek 于 9 月 28 日发布。该版本包含多项更新,具体变更内容需查看标签对比或发布说明。
针对 Bluesky 上日益增多的自动回复机器人,Simon Willison 用 Opus 5.5 通过 vibe coding 开发了一款检测工具。该工具通过分析账户回复速度、是否从不发布原创内容以及回复中是否含问号等信号,识别疑似回复机器人。Bluesky 仍提供免费可用的 API,使这类调查成为可能。
gpt-load 发布 v2.0.0-rc.36,新增 Cline API key 通道支持,并将 guardrails 的审查限制为一次有界 JEV 调用。2.x 为全新重写版本,与 1.x 数据不兼容,需以全新数据库和新的 encryption.key 部署。
gpt-load v2.0.0-rc.35 发布,修复网关实时日志与 teardown 绑定问题,并优化 guardrails 对不透明内容的过滤及审查失败处理。2.x 为全新重写版本,与 1.x 数据不兼容,需以全新数据库和新的 encryption.key 部署。
gpt-load 发布 v2.0.0-rc.34,2.x 为全新重写版本,与 1.x 数据不兼容,需以全新数据库和新的 encryption.key 部署。本次更新为网关新增语音模式和实时通话重试,恢复 WebSocket 错误恢复,并为渠道新增七个兼容预设及 OpenCode Go 和 Zen 预设。
AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。
AWS 展示了如何在 SageMaker HyperPod 上运行开源 RL 框架 SkyRL,以 GRPO 算法训练 Qwen3-VL-8B 视觉语言模型导航视觉迷宫。
AWS 机器学习博客发布 NarrateAI 系列第二篇,详解在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。该系统为超过 4,000 名 AWS 高管提供商业智能服务,实测数值准确率约 99%,流式响应约 13 秒开始输出,相比顺序评估延迟降低 86.8%。
Qwen3-TTS-12Hz-1.7B-Base 现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点,支持从数秒参考音频克隆说话人音色,无需重新训练模型。
Datacor 将 Amazon Quick Sight 集成进 TrackAbout 解决方案,为工业气体与焊接分销商提供自助式租赁分析,用户可通过交互式仪表盘和自然语言搜索直接查询租赁绩效数据,无需再提交 IT 工单或等待定制报告。
gpt-load 发布 v2.0.0-rc.33,新增 Gemini 原生嵌入协议、Codex 实时语音中继,并改进访问密钥控制台。该版本为 2.x 重写版,与 1.x 数据不兼容,需以全新数据库和新的 encryption.key 部署。
Langfuse v4.46.0 发布,新增基础技能管理、数据集条目 JSON 格式化,并为追踪表格增加 100 行分页选项。该版本还优化了 trace 播放功能移除、图表改进及多项界面修复,并将数据集运行项读取路由至只读副本以提升性能。
Langfuse 发布 v4.45.4 版本,主要更新包括刷新 assistant 中嵌入的 Langfuse 技能,并跳过 Azure LLM 连接测试直至 CI 密钥更换。完整变更记录见 v4.45.3...v4.45.4。
Langfuse 发布 v4.45.3,主要包含多项修复:更新 image-size 依赖至 2.0.4,API key 查找失败时记录公钥,拒绝以 /systemone 结尾或含查询字符串的 TypeSafe 基础 URL,切换上游时保留自定义 TypeSafe 基础 URL,以及修复 evals 中决策模型的选择与去重问题。
LiteLLM v1.104.0-dev.2 发布,所有 Docker 镜像均使用 cosign 签名,可通过固定 commit hash 或 release tag 验证签名。本次更新同步了 Google Gemini、OpenAI、AWS Bedrock、Vertex AI 等多家模型价格,并修复了 Bedrock 流式传输、Claude Opus 4.7/4.8 强制工具调用等问题。
LiteLLM v1.100.3 发布,所有 Docker 镜像均使用 cosign 签名,并支持通过固定 commit hash 或 release tag 进行签名验证。该版本还通过 backport 合并了 #39631、#39729、#40639 三个 PR 至 stable/1.100.x 分支。
LiteLLM v1.99.4 发布,所有 Docker 镜像均使用 cosign 签名,并可通过固定 commit hash 或 release tag 验证签名完整性。该版本还从 stable/1.99.x 分支反向移植了 #39631、#39729、#40639 三个补丁。
Langfuse 发布 v4.45.2,为 AI 网关新增按项目批处理推理遥测并自动重试瞬时故障。该版本还修复了元数据键冲突、批量导出报错、OpenAPI 类型定义及 SSO 发现错误等问题,并优化了评分查询性能。
AWS 推出 WhisperX 深度学习容器(DLC),将 OpenAI Whisper 与 wav2vec2 强制对齐及说话人分离结合,提供逐词时间戳和说话人标签。
亚马逊云科技发布参考架构,通过 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户 AI 智能体,让数据留在各业务账户本地,查询时仅流出所需数据。
Aderant 通过 Amazon Bedrock 使用 Amazon Nova Lite 构建了智能工单分析器,为法律行业业务管理软件的 SierraOps 团队自动化工单分类、路由和知识补充流程。该系统在生产前 2.5 周内审查了 109 个工单,路由准确率约 96%,预计每周节省 8-14 个工程小时,总运营成本低于每月 30 美元,其中 Bedrock 推理成本低于每月 1 美元。
光环新网拟对和林格尔智算中心项目追加投资至25.00亿元,较原规划增加12.65亿元,增幅102.43%。调整后项目IT负载由60-100MW提升至90-120MW,总建筑面积增至约12.12万平方米,机柜规模扩至7,000-10,000个,设计PUE降至<1.2。项目满负载运营后预计年营业收入7.22亿元,净利润1.11亿元。
光环新网董事会审议通过,对和林格尔智算中心项目追加投资不超过12.65亿元,总投资额增至约25.00亿元。调整后项目IT负载产能由60-100MW提升至90-120MW,可部署7,000-10,000个2N 12-16KW标准机柜,设计PUE<1.2,满负荷年净利润预计增至11,132.45万元。追加投资源于AI大模型训练与推理需求进入规模化商用期,北方区域智算算力需求持续增长。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
Remedy Entertainment 的《CONTROL Resonant》本周登陆 GeForce NOW 云游戏平台,终极会员可借 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪、NVIDIA Reflex 与最高 5K HDR。
NVIDIA 发布教程,讲解如何用 NVIDIA Warp 与 MuJoCo Warp(MJWarp)将 SO-101 机械臂场景从单世界 CPU 仿真迁移到最多 2048 个并行 GPU 环境。文章覆盖单世界校验、批量分配、容量调优与吞吐测量,并给出 pip install warp-lang 与 mujoco-warp 的安装入口。
推荐理由:原文给出从单世界 MuJoCo 迁移到 2048 并行 MJWarp 环境的完整步骤,读者可直接照做并复现吞吐测量。
荷兰零售商 HEMA 基于 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,通过 Model Context Protocol (MCP) 将分散知识整合为单一可信来源,并接入 HAL 聊天、Kiro、Claude 等日常工具。
GitHub Copilot 应用重构了 Pull Request 视图,以应对 2200 个文件、超百万行改动和 400 多条评论的极端场景。方案将文档高度拆分为确定性代码高度与动态块高度两个独立域,用单次空闲与滚动门控的测量通道替代逐块 ResizeObserver,并通过按身份而非像素的滚动锚定避免跳动。团队还构建了自主的变更、测量、改进循环,用真实信号自动定位性能问题。
推荐理由:原文拆解了超大 diff 渲染的虚拟化、测量调度与滚动锚定方案,读者可借鉴其工程取舍。