🌐 OpenRouter 模型调用排行

📅 2026-08-31商业 API 按每日 token 用量 | 含排名升降与趋势

📈 近 30 天调用量趋势(Top 6)

03517.5B7034.9B10552.4B14069.8B08-2908-3109-0209-0409-06tencent/hy4-preview-20260827 2026-08-29: 0tencent/hy4-preview-20260827 2026-08-30: 0tencent/hy4-preview-20260827 2026-08-31: 3065.7Btencent/hy4-preview-20260827 2026-09-01: 3065.7Btencent/hy4-preview-20260827 2026-09-02: 4005.1Btencent/hy4-preview-20260827 2026-09-03: 5719.7Btencent/hy4-preview-20260827 2026-09-04: 7985.1Btencent/hy4-preview-20260827 2026-09-05: 10974.2Btencent/hy4-preview-20260827 2026-09-06: 14069.8Bz-ai/glm-5.3-flash-20260826 2026-08-29: 3298.5Bz-ai/glm-5.3-flash-20260826 2026-08-30: 4621.5Bz-ai/glm-5.3-flash-20260826 2026-08-31: 6158.3Bz-ai/glm-5.3-flash-20260826 2026-09-01: 6158.3Bz-ai/glm-5.3-flash-20260826 2026-09-02: 8137.5Bz-ai/glm-5.3-flash-20260826 2026-09-03: 10010.5Bz-ai/glm-5.3-flash-20260826 2026-09-04: 11441.2Bz-ai/glm-5.3-flash-20260826 2026-09-05: 11948.7Bz-ai/glm-5.3-flash-20260826 2026-09-06: 12458.6Bdeepseek/deepseek-v4-flash-20260731 2026-08-29: 12278.0Bdeepseek/deepseek-v4-flash-20260731 2026-08-30: 12256.8Bdeepseek/deepseek-v4-flash-20260731 2026-08-31: 12306.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-01: 12306.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-02: 12187.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-03: 12050.5Bdeepseek/deepseek-v4-flash-20260731 2026-09-04: 11373.6Bdeepseek/deepseek-v4-flash-20260731 2026-09-05: 11285.7Bdeepseek/deepseek-v4-flash-20260731 2026-09-06: 12279.6Bopenai/gpt-5.6-luna-20260709 2026-08-29: 6055.3Bopenai/gpt-5.6-luna-20260709 2026-08-30: 6750.1Bopenai/gpt-5.6-luna-20260709 2026-08-31: 7792.0Bopenai/gpt-5.6-luna-20260709 2026-09-01: 7792.0Bopenai/gpt-5.6-luna-20260709 2026-09-02: 8485.5Bopenai/gpt-5.6-luna-20260709 2026-09-03: 9522.8Bopenai/gpt-5.6-luna-20260709 2026-09-04: 11610.3Bopenai/gpt-5.6-luna-20260709 2026-09-05: 11600.9Bopenai/gpt-5.6-luna-20260709 2026-09-06: 12183.1Bminimax/minimax-m3-20260531 2026-08-29: 2611.1Bminimax/minimax-m3-20260531 2026-08-30: 3314.7Bminimax/minimax-m3-20260531 2026-08-31: 4087.1Bminimax/minimax-m3-20260531 2026-09-01: 4087.1Bminimax/minimax-m3-20260531 2026-09-02: 4542.2Bminimax/minimax-m3-20260531 2026-09-03: 5272.6Bminimax/minimax-m3-20260531 2026-09-04: 6025.5Bminimax/minimax-m3-20260531 2026-09-05: 6600.3Bminimax/minimax-m3-20260531 2026-09-06: 7027.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-29: 5422.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-30: 5404.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-31: 5203.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-01: 5203.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-02: 5151.7Bdeepseek/deepseek-v4-flash-20260423 2026-09-03: 5162.4Bdeepseek/deepseek-v4-flash-20260423 2026-09-04: 5178.2Bdeepseek/deepseek-v4-flash-20260423 2026-09-05: 5180.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-06: 5235.6B
tencent/hy4-preview-20260827z-ai/glm-5.3-flash-20260826deepseek/deepseek-v4-flash-20260731openai/gpt-5.6-luna-20260709minimax/minimax-m3-20260531deepseek/deepseek-v4-flash-20260423
1deepseek/deepseek-v4-flash-20260731

日调用 12306.41B tokens · 426,048,605 次请求

定位与擅长场景

DeepSeek V4 Flash 以超高频调用登顶,单日请求量破4.26亿次,日均Token消耗超12.3万亿,显然定位为高吞吐、低成本推理的普惠型模型。其核心场景是大规模实时交互(如聊天机器人、代码补全、客服系统),而非复杂推理或长文本生成。Flash后缀暗示其牺牲部分深度换取速度,适合对延迟敏感、并发量极高的生产环境。

与竞品对比

对比同系列V4正式版或Claude/GPT-4级模型,Flash在响应速度和单位成本上具备碾压优势,但逻辑严谨性和多步推理能力大概率弱于旗舰款。从调用量看,其热度远超其他模型,说明开发者已用脚投票——在“够用就好”的场景中,性能过剩的旗舰款并非最优解。与OpenAI的GPT-4o-mini相比,DeepSeek Flash在中文生态和性价比上可能更激进。

是否值得接入

结论:值得接入,但需分场景。 若你的业务是高并发、短交互、容忍一定错误率(如问答、分类、草稿生成),接入后能显著降本增效;但若涉及数学证明、法律分析或长文逻辑链,请务必搭配旗舰模型兜底。当前排名证明其市场接受度极高,建议优先在非核心链路试运行,再逐步扩大流量。

2xiaomi/mimo-v2.5-20260422

日调用 9136.73B tokens · 107,081,172 次请求

定位与擅长场景

小米MiMo-V2.5以高性价比通用对话为核心定位,凭借超大上下文窗口与多模态能力,在中文知识问答、代码生成及长文档处理场景表现突出。其调用量稳居第二,反映中小开发者对低延迟、高吞吐的实用型模型需求旺盛,尤其适合成本敏感的国内企业级应用。

与竞品对比

相较头部闭源模型(如GPT-4o),MiMo在复杂推理和创意写作上略逊,但通过开源权重+云端API双轨策略,在定制化部署和隐私合规场景占据优势。对比同梯队开源模型(如DeepSeek-V3),其日均请求量更高,说明生态整合更完善,但极端长文本下的连贯性仍存提升空间。

是否值得接入

结论:值得接入,但需场景化取舍。 若业务追求实时交互、中文优化和低成本扩展,MiMo是当前最优选择;若任务涉及高阶逻辑链或跨语言专业领域,建议混合调用更强模型。其排名稳定且无下滑,市场热度真实可信,长期可用性有保障。

3openai/gpt-5.6-luna-20260709

日调用 7791.98B tokens · 328,177,100 次请求

定位与擅长场景

GPT-5.6 Luna 稳居 OpenRouter 调用量前三,日均处理 7.79 万亿 token、3.28 亿次请求,是当之无愧的“流量巨兽”。其核心优势在于超长上下文理解复杂多步推理,尤其适合高并发、高吞吐的 API 场景,如代码生成、数据分析、智能客服等规模化应用。作为最新迭代版本,它在指令遵循和结构化输出上表现突出,是生产环境的“全能型选手”。

与竞品对比

相比 Claude 系列(更侧重安全与文学性)和 Gemini(多模态原生),Luna 在纯文本任务性价比生态兼容性上更胜一筹。其调用量是排名第 4 的模型的数倍,说明开发者已将其视为“默认选项”。不过,在创意写作和长尾知识覆盖上,它仍略逊于 Claude 的深度调优版。

是否值得接入

明确结论:值得接入,且应作为主力模型。 其超高的调用量证明了稳定性和社区信任度,尤其适合对延迟和成本敏感、需要大规模并行处理的企业级应用。若预算有限,可优先用于高频核心链路;若追求极致创意,可搭配其他小众模型做补充。整体而言,Luna 是当前市场“最稳的牌”,闭眼入不亏。

4tencent/hy3-20260706

日调用 6656.45B tokens · 89,127,258 次请求

定位与擅长场景

腾讯混元(hy3-20260706)位列 OpenRouter 调用量第 4,日处理 token 超 6656 亿、请求近 9000 万次,稳居国产模型第一梯队。其核心优势在于中文语义理解与多模态生成,尤其适合企业级文本处理、营销内容创作及复杂中文对话场景,在长文本任务中表现稳定,兼顾效率与成本。

与竞品对比

对比同榜头部模型(如 DeepSeek、Qwen),混元在中文语境下的文化适配性更优,但国际通用知识广度略逊于 Claude 或 GPT 系列。其调用量远超多数开源模型,但低于榜首的闭源旗舰,说明其在中低复杂度任务上性价比突出,而在尖端推理或代码生成上仍有差距。

是否值得接入

明确结论:值得接入,尤其适合中文为主、高并发、成本敏感的业务。若团队已有腾讯云生态,集成成本极低;若追求极致推理能力,可混合接入更强模型作为补充。当前调用量持续高位,且无排名下滑迹象,市场验证充分,可放心作为主力模型之一。

5z-ai/glm-5.3-flash-20260826

日调用 6158.34B tokens · 161,637,414 次请求

定位与擅长场景

z-ai/glm-5.3-flash-20260826 位列调用量第五,日处理超 6.1 万亿 tokens,请求量达 1.6 亿次,属于高频、轻量级任务的主力模型。其“flash”后缀表明主打低延迟、高吞吐场景,适合实时对话、内容审核、批量文本分类等对成本敏感且需快速响应的业务,而非复杂推理或长文本生成。

与竞品对比

相较同梯队头部模型(如 DeepSeek 或 Qwen 的 turbo 版本),GLM 系列在中文语义理解与指令跟随上通常更稳,且 z-ai 作为独立供应商,在 API 稳定性上表现突出。但相比 Claude Haiku 或 GPT-4o mini,其多语言泛化能力和工具调用生态略逊,尤其在复杂 Agent 任务中可能需更多微调。从调用量看,其热度稳定,但 rankChange 为 null,暗示近期无爆发式增长,处于成熟期。

是否值得接入

值得接入。若你的业务以中文为主、追求极致性价比和响应速度,这款模型是当前 OpenRouter 上最可靠的选项之一。但若涉及多模态或深度推理,建议搭配更强模型混合使用。其高调用量也印证了社区信任度,可作为生产环境默认后备方案。

6nvidia/nemotron-3-ultra-550b-a55b-20260604

日调用 5364.32B tokens · 44,075,652 次请求

定位与擅长场景

NVIDIA Nemotron-3 Ultra 550B(A55B 稀疏激活)是专为企业级高吞吐推理设计的旗舰模型。其日均 5.36T tokens 的调用量(排名第 6)和 4400 万次请求,表明它被大量用于实时客服、代码生成、金融风控等需要低延迟、高并发的生产环境。稀疏架构让 550B 总参数仅激活 55B,兼顾复杂任务精度与成本效率。

与竞品对比

相比同量级的 GPT-4o 或 Claude 3.5,Nemotron 在长文本理解结构化输出上更稳,且对 NVIDIA GPU 生态(如 H200)优化极深,推理速度提升明显。但创意写作多轮对话自然度略逊于 Claude 系列,且生态工具链不如 OpenAI 丰富。其排名稳定(无波动),说明企业客户粘性高,但缺乏消费级爆款场景。

是否值得接入

值得接入,尤其适合已有 NVIDIA 算力底座、追求性价比的 B 端团队。若你的场景是高并发 API 服务私有化部署,Nemotron 是当前最优选择之一;但若侧重交互体验或需要丰富插件生态,建议混合接入 GPT-4o 作为补充。注意其排名虽高,但调用量增速未披露,需评估长期稳定性。

7deepseek/deepseek-v4-flash-20260423

日调用 5203.47B tokens · 488,074,841 次请求

定位与擅长场景

DeepSeek-V4-Flash 定位为高吞吐、低延迟的轻量级推理模型,主打性价比与规模化实时应用。其日均调用量超5200亿 tokens、近4.9亿次请求,稳居OpenRouter第七,说明它极适合高频、短文本任务,如聊天助手、代码补全、客服机器人等场景,尤其在需要快速响应的生产环境中表现突出。

与竞品对比

相较同榜的Claude或GPT-4级别模型,V4-Flash牺牲部分复杂推理深度,换取更低的单次调用成本和更高的并发能力。与自家DeepSeek-V3等旗舰版比,Flash版明显偏向“量”而非“质”,在长文档理解或多步推理上可能逊色,但胜在峰值吞吐稳定,适合流量波动大的业务。

是否值得接入

结论:值得接入。 若你的业务对响应速度敏感、且请求量巨大(如日均百万级),V4-Flash是当前性价比极高的选择。其市场热度印证了开发者对“实用主义”模型的强需求。但若涉及专业分析或创意写作,建议保留旗舰模型作为补充。总体而言,作为流量入口的默认模型,它非常可靠。

8minimax/minimax-m3-20260531

日调用 4087.06B tokens · 59,232,415 次请求

定位与擅长场景

Minimax M3 位列 OpenRouter 调用量第 8,日处理 Token 超 408 亿、请求近 6000 万次,属于高频主力模型。其核心优势在于中文场景的深度优化,尤其适合长文本生成、多轮对话、内容创作(如营销文案、小说续写)及企业级知识库问答。凭借高吞吐和稳定输出,它在国内开发者生态中占据重要位置。

与竞品对比

相比同梯队的 DeepSeek V3(侧重代码/数学)和 GLM-4(强调工具调用),M3 在中文语义理解、情感表达和上下文连贯性上更细腻,但逻辑推理和复杂代码生成能力略逊于前者。与 Claude Opus 相比,M3 在成本效率上明显占优,但多语言泛化能力仍有差距。其调用量排名第 8,说明市场认可度较高,但未进入前五,反映其在高端复杂任务上尚未形成绝对壁垒。

是否值得接入

值得接入。若你的业务以中文内容生产、客服对话或长文档处理为主,M3 是性价比极高的选择。其高调用量已验证稳定性,且生态成熟。但若核心需求是顶级数学推理或代码生成,建议优先考虑专用模型。总体而言,M3 是中文场景的“六边形战士”,值得作为主力备选。

9google/gemini-3.7-flash-20260813

日调用 3963.40B tokens · 95,152,154 次请求

定位与擅长场景

google/gemini-3.7-flash-20260813 当前位列 OpenRouter 调用量第 9 名,日处理 token 达 3.96 万亿,请求量超 9500 万次。作为 Google 的轻量级 Flash 系列,其核心优势在于高吞吐、低延迟,尤其适合实时交互、批量内容生成、代码补全等对成本敏感且需快速响应的场景。在同类小参数模型中,它凭借 Google 的生态整合(如与 Search、Android 深度联动)占据独特生态位。

与竞品对比

相较于同列前茅的 Anthropic Claude Haiku 或 OpenAI GPT-4o-mini,Gemini Flash 在多模态理解(图像+文本混合任务)上表现更均衡,且上下文窗口通常更大。但其劣势在于复杂推理和长链指令遵循略逊于旗舰级模型(如 Gemini Pro 或 Claude Sonnet),在需要深度逻辑链的编程或数学任务上可能需多次尝试。不过,其 token 单价通常低于同性能竞品,性价比优势明显。

是否值得接入

结论:值得接入,但需按场景分层。 若你的业务是高频、低复杂度任务(如客服摘要、内容分类、实时翻译),此模型是当前市场验证过的优选,调用量排名已证明其稳定性和接受度。但若涉及高精度专业分析,建议搭配旗舰模型做兜底,避免单一依赖。整体而言,它应是中型团队构建 AI 功能时的“默认选项”之一。

10tencent/hy4-preview-20260827

日调用 3065.75B tokens · 20,039,627 次请求

定位与擅长场景

腾讯混元(hy4-preview)位列调用量前十,日处理超3万亿token,请求量破2000万,说明其已被广泛用于高并发、大规模的中文场景,如智能客服、内容审核、实时翻译及企业级RAG应用。其“预览版”定位暗示腾讯正重点打磨推理与长文本能力,适合对中文语义理解要求高、需稳定API支撑的业务。

与竞品对比

相比同榜的DeepSeek或智谱GLM,混元在中文语境上更贴近腾讯生态(如微信、广告),但灵活性与开源生态不及DeepSeek;与Claude或GPT-4相比,其多模态和复杂逻辑推理仍有差距,不过胜在成本效益与国内合规性。排名稳定(rankChange为null)说明其用户粘性强,但缺乏爆发式增长。

是否值得接入

值得接入,但需明确场景:若你的业务以中文为主、追求性价比和低延迟,混元是优选;若需顶尖推理或高度定制化,建议混合接入其他模型。当前排名证明其市场认可度,且腾讯持续迭代,风险可控。结论:优先用于生产环境的中文任务,同时保留备用模型以应对复杂需求。