OpenRouter 推出 Batch API,批量请求享半价推理
OpenRouter 上线 Batch API,把请求打包提交后由供应商在 24 小时窗口内自行选择完成时间,换取通常为正常每 token 价格 50% 的折扣,目前已支持 70 多个模型。
推荐理由:原文给出批量 API 的价格折扣、延迟分布与支持范围,可据此判断哪些离线任务适合迁移。
OpenRouter 模型路由平台动态:新模型上架、用量排行与开发者选型的真实市场信号。
OpenRouter 上线 Batch API,把请求打包提交后由供应商在 24 小时窗口内自行选择完成时间,换取通常为正常每 token 价格 50% 的折扣,目前已支持 70 多个模型。
推荐理由:原文给出批量 API 的价格折扣、延迟分布与支持范围,可据此判断哪些离线任务适合迁移。
OpenRouter 发文介绍 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合 Mamba-2 与 MoE 开源权重模型,面向高频智能体执行步骤,支持工具调用、编码与指令遵循。
推荐理由:梳理了 Nemotron 3.5 Lightning 的规格、与 Ultra 的分工及路由与本地部署方式,便于评估智能体执行层选型。
OpenRouter 用 Banking77 的 3,080 条客服语句对比 TypeSafe 的 Jev 1.13 与 Claude Opus 5,Jev 准确率 81.0%,落后 Opus 的 84.4% 约 3.3 个百分点,但中位延迟 175 ms 对 2,266 ms,每千次请求成本 $0.11 对 $2.42。
推荐理由:用同一数据集对比小模型与前沿模型的准确率、延迟和成本,并给出按置信度级联的取舍方法。
小米发布开源基础模型 MiMo-V2.6-Flash,采用 MoE 架构,总参数 309B、每 token 激活 15B,并使用混合注意力机制。该模型已上架 OpenRouter 模型目录。
推荐理由:材料给出 MiMo-V2.6-Flash 的参数量与架构要点,可据此了解小米开源模型的规格定位。
小米在 OpenRouter 上架旗舰基础模型 MiMo-V2.6-Pro,该模型参数量超过 1T,面向高难度任务设计以提升能力上限。目前仅有摘要信息,具体能力与开放细节尚未披露。
SpaceXAI 的旗舰模型 Grok 4.7 在 OpenRouter 上架,接替 Grok 4.6,面向编码、智能体任务和知识工作。该模型在长时间运行的软件工程任务和自我验证方面表现突出。
推荐理由:Grok 4.7 在 OpenRouter 上架,读者可据此了解它在编码与智能体任务上的定位及与前代的关系。
阿里在 OpenRouter 上架 Qwen3.8 Omni Flash 全模态推理模型,官方称这是首个围绕智能体能力构建、具备原生音视频理解能力的 Qwen 模型。该模型适用于音视频分析与摘要等场景。
推荐理由:Qwen3.8 Omni Flash 把原生音视频理解与智能体能力结合,可据此判断多模态推理模型的落地方向。
OpenRouter 博客介绍了 TypeSafe 的决策模型 Jev,它接收文本和带类型的提问,返回预设选项之一及校准概率,而非生成文本。
推荐理由:通过真实 API 调用示例拆解 Jev 的三种决策原语,读者可据此判断何时用决策模型替代 LLM 加正则的流程。
OpenRouter 在 60 张客服工单上对比 TypeSafe 的决策模型 Jev 1.13 与 GPT Luna、Claude Opus,Jev 意图准确率 59/60、升级判断 60/60,每千张工单成本 0.0248 美元,GPT Luna 为 0.0921 美元,Claude Opus 为 2.88 美元。
推荐理由:OpenRouter 用同一批工单对比决策模型与生成式 LLM 的成本和延迟,并给出可复用的路由与校验代码。
Z.ai 的 GLM-5.3-FlashX 已在 OpenRouter 模型目录上架,是 GLM-5.3-Flash 的高速变体,推理速度最高可达 200 tokens/s。该模型为原生多模态模型,沿用与 GLM-5.3-Flash 相同的混合稀疏与线性注意力架构。
推荐理由:OpenRouter 上架 GLM-5.3-FlashX,读者可据此了解该高速多模态变体的推理速度与架构定位。
OpenRouter 用同一提示词实测 20 个图像生成模型,读取每次响应的 usage.cost,单张默认设置计费从 openai/gpt-image-2 的 $0.006 到 google/gemini-3-pro-image 的 $0.134,相差 22 倍。
推荐理由:同一提示词实测 20 个图像模型的真实计费与参数差异,可据此按成本、参考图和文字渲染选型。
DeepSeek V4.1 Flash 在 OpenRouter 上架,是 DeepSeek 的稀疏 MoE 模型,也是首个基于其 Causal Encoder-Decoder(CED)架构构建的模型。该模型在输入端激活 8B 参数、在另一端激活 16B 参数。
推荐理由:DeepSeek V4.1 Flash 上架 OpenRouter,可据此了解其 MoE 稀疏结构与 CED 架构的首次落地。
DeepSeek 在 OpenRouter 上架 V4.1 Flash,这是一个稀疏 MoE 模型,也是首个基于其 Causal Encoder-Decoder(CED)架构构建的模型。该模型在输入端激活 8B 参数,在输出端激活 16B 参数。
推荐理由:DeepSeek V4.1 Flash 采用稀疏 MoE 与新的 CED 架构,可据此了解其参数激活方式与架构取向。
OpenRouter 发布 Presets 使用教程,介绍如何把模型选择、系统提示词、提供商路由和采样参数存成一个命名配置,在请求中用 "model": "@preset/your-preset-name" 引用。
推荐理由:OpenRouter 官方教程,展示如何用预设把模型、提示词和路由配置从代码中抽离,适合多应用共用同一套 LLM 配置的团队参考。
OpenRouter 发布复合推理系统 Fusion,把一次提示词同时发给 1 至 8 个面板模型并行作答,由 judge 比较共识、矛盾与盲点后,再由调用模型写出最终答案。
推荐理由:原文给出 Fusion 的调用方式、成本与延迟代价,读者可据此判断何时该用它替代单模型调用。
OpenRouter 评测 ByteDance 的 Seedance 2.5,该模型自 2026 年 8 月 7 日上线其视频 API,支持 4 至 30 秒、480p 或 720p 生成,按视频 token 计费,480p 约每秒 0.103 美元、720p 约 0.231 美元。
推荐理由:OpenRouter 用自家目录数据拆解 Seedance 2.5 的计费公式与适用边界,可据此判断长镜头和改片场景该选哪个视频模型。
OpenRouter 在去年 10 月上线的欧盟路由基础上推出美国 In-Region Routing,请求发往 us.openrouter.ai 后在美国境内解密并只路由到美国供应商端点,eu.openrouter.ai 同理。
推荐理由:原文区分了仅推理区域路由与端到端区域路由的差别,并给出可切换的域名和失败行为,便于评估数据驻留方案。
OpenRouter 发布教程,演示如何通过其 API 用文本提示词编辑图像:把源图放进 input_references、指令放进 prompt,编辑后的图像以 base64 从 data[0].b64_json 返回。
推荐理由:OpenRouter 官方给出 Gemini 图像编辑的完整请求结构与多步编辑方法,可直接照抄复用。
Inception 在 OpenRouter 上架 Mercury 2.5,称其为最快的推理 LLM,也是其最新的扩散 LLM(dLLM)。该模型不再按顺序逐 token 生成,而是并行生成并精炼多个 token。
Nex AGI 在 OpenRouter 上架 Nex-N2.5-Mini,属于 Nex-N2.5 系列。该模型定位为智能体模型,目标是把目标转化为可运行、可验证的结果,核心能力是在可视化反馈回路中进行智能体编码,可探索代码库并实现多文件改动。
推荐理由:Nex AGI 新上架的小型智能体模型,读者可了解其在代码库探索与多文件实现上的定位。