跳到正文

#部署/工程

今日 5 条
今天9月29日周二
  1. AWS Machine Learning Blog70

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度

    xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。

    推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。

  2. Microsoft Research18

    微软亚洲研究院(新加坡)成立一周年:推进研究、合作与人才培养

    微软亚洲研究院(新加坡)迎来成立一周年。该实验室于2025年7月24日启用,是微软在东南亚的首个研究实验室,聚焦下一代AI模型与智能体系统、领域特定AI、AI原生研究实践及生态与人才发展四大支柱。其研究通过医疗、金融、教育等领域的合作推动现实应用,并与新加坡经济发展局等机构建立了战略合作。

9月28日周一
  1. Mistral AI38

    Mistral 在慕尼黑开设德国中心,推进欧洲工业 AI

    Mistral 在慕尼黑开设新中心,聚焦 Physics AI 与工业 AI,并直接服务企业合作伙伴。该中心将组建 Physics AI 和工业 AI 专项研究团队,并与宝马、西门子能源及慕尼黑工业大学合作。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重架构支持模型在客户自有基础设施上运行,数据不离开组织。

  2. AWS Machine Learning Blog38

    跨账户自动化管理 Amazon Textract 适配器生命周期

    AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的解决方案,涵盖适配器提升、文档路由与生产安全三大挑战。通过将适配器 ID 外部化到 AWS Systems Manager Parameter Store,更新生产引用可实现零停机、无需重新部署应用,将原本耗时数小时或数天的协调工作缩短至数秒。

  3. The Decoder62

    英伟达推出内置芯片的智能体看门狗 Sentry

    英伟达推出智能体安全看门狗 Sentry,作为 BlueField-4 DPU 的参考设计,与主计算分离运行,可在智能体试图越界时于毫秒内隔离。Sentry 结合 3 月开源的 OpenShell 沙箱和 9 月 10 日推出的形式化验证工具,用于检测权限是否越限。英伟达称兼容系统只需软件更新即可启用,但未公布独立上市日期,也未给出检测可靠性数据。

  4. Simon Willison40

    Bluesky 回复机器人检测工具

    针对 Bluesky 上日益增多的自动回复机器人,Simon Willison 用 Opus 5.5 通过 vibe coding 开发了一款检测工具。该工具通过分析账户回复速度、是否从不发布原创内容以及回复中是否含问号等信号,识别疑似回复机器人。Bluesky 仍提供免费可用的 API,使这类调查成为可能。

9月26日周六
  1. GitHub · gpt-load12

    gpt-load v2.0.0-rc.34 发布

    gpt-load 发布 v2.0.0-rc.34,2.x 为全新重写版本,与 1.x 数据不兼容,需以全新数据库和新的 encryption.key 部署。本次更新为网关新增语音模式和实时通话重试,恢复 WebSocket 错误恢复,并为渠道新增七个兼容预设及 OpenCode Go 和 Zen 预设。

  2. AWS Machine Learning Blog38

    AWS 如何用 EKS、EFA 与 DeepEP 将 MoE 强化学习吞吐提升 40%

    AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。

  3. AWS Machine Learning Blog57

    NarrateAI 在 Amazon Bedrock 上的生产级 LLM 质量保障实践

    AWS 机器学习博客发布 NarrateAI 系列第二篇,详解在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。该系统为超过 4,000 名 AWS 高管提供商业智能服务,实测数值准确率约 99%,流式响应约 13 秒开始输出,相比顺序评估延迟降低 86.8%。

9月25日周五
  1. GitHub · Langfuse15

    Langfuse v4.45.4 发布

    Langfuse 发布 v4.45.4 版本,主要更新包括刷新 assistant 中嵌入的 Langfuse 技能,并跳过 Azure LLM 连接测试直至 CI 密钥更换。完整变更记录见 v4.45.3...v4.45.4。

  2. GitHub · Langfuse8

    Langfuse v4.45.3 发布

    Langfuse 发布 v4.45.3,主要包含多项修复:更新 image-size 依赖至 2.0.4,API key 查找失败时记录公钥,拒绝以 /systemone 结尾或含查询字符串的 TypeSafe 基础 URL,切换上游时保留自定义 TypeSafe 基础 URL,以及修复 evals 中决策模型的选择与去重问题。

  3. GitHub · Langfuse8

    Langfuse v4.45.2 发布

    Langfuse 发布 v4.45.2,为 AI 网关新增按项目批处理推理遥测并自动重试瞬时故障。该版本还修复了元数据键冲突、批量导出报错、OpenAPI 类型定义及 SSO 发现错误等问题,并优化了评分查询性能。

  4. AWS Machine Learning Blog38

    Aderant 用 Amazon Nova 构建智能工单分类系统

    Aderant 通过 Amazon Bedrock 使用 Amazon Nova Lite 构建了智能工单分析器,为法律行业业务管理软件的 SierraOps 团队自动化工单分类、路由和知识补充流程。该系统在生产前 2.5 周内审查了 109 个工单,路由准确率约 96%,预计每周节省 8-14 个工程小时,总运营成本低于每月 30 美元,其中 Bedrock 推理成本低于每月 1 美元。

  5. 巨潮公告 · 智算中心23

    光环新网对和林格尔智算中心项目追加投资至25亿元,IT负载提升至90-120MW

    光环新网拟对和林格尔智算中心项目追加投资至25.00亿元,较原规划增加12.65亿元,增幅102.43%。调整后项目IT负载由60-100MW提升至90-120MW,总建筑面积增至约12.12万平方米,机柜规模扩至7,000-10,000个,设计PUE降至<1.2。项目满负载运营后预计年营业收入7.22亿元,净利润1.11亿元。

  6. 巨潮公告 · 智算中心18

    光环新网对和林格尔智算中心项目追加投资12.65亿元

    光环新网董事会审议通过,对和林格尔智算中心项目追加投资不超过12.65亿元,总投资额增至约25.00亿元。调整后项目IT负载产能由60-100MW提升至90-120MW,可部署7,000-10,000个2N 12-16KW标准机柜,设计PUE<1.2,满负荷年净利润预计增至11,132.45万元。追加投资源于AI大模型训练与推理需求进入规模化商用期,北方区域智算算力需求持续增长。

9月24日周四
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,加速视觉语言模型推理

    Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。

    推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。

  2. Hugging Face Blog62

    NVIDIA 教程:用 Warp 与 MJWarp 将 MuJoCo 机器人仿真扩展到 2048 并行环境

    NVIDIA 发布教程,讲解如何用 NVIDIA Warp 与 MuJoCo Warp(MJWarp)将 SO-101 机械臂场景从单世界 CPU 仿真迁移到最多 2048 个并行 GPU 环境。文章覆盖单世界校验、批量分配、容量调优与吞吐测量,并给出 pip install warp-lang 与 mujoco-warp 的安装入口。

    推荐理由:原文给出从单世界 MuJoCo 迁移到 2048 并行 MJWarp 环境的完整步骤,读者可直接照做并复现吞吐测量。

  3. GitHub Blog · AI & ML60

    GitHub Copilot 应用如何渲染超大 Pull Request

    GitHub Copilot 应用重构了 Pull Request 视图,以应对 2200 个文件、超百万行改动和 400 多条评论的极端场景。方案将文档高度拆分为确定性代码高度与动态块高度两个独立域,用单次空闲与滚动门控的测量通道替代逐块 ResizeObserver,并通过按身份而非像素的滚动锚定避免跳动。团队还构建了自主的变更、测量、改进循环,用真实信号自动定位性能问题。

    推荐理由:原文拆解了超大 diff 渲染的虚拟化、测量调度与滚动锚定方案,读者可借鉴其工程取舍。