🌐 OpenRouter 模型调用排行

📅 2026-08-29商业 API 按每日 token 用量 | 含排名升降与趋势

📈 近 30 天调用量趋势(Top 6)

03517.5B7034.9B10552.4B14069.8B08-2908-3109-0209-0409-06tencent/hy4-preview-20260827 2026-08-29: 0tencent/hy4-preview-20260827 2026-08-30: 0tencent/hy4-preview-20260827 2026-08-31: 3065.7Btencent/hy4-preview-20260827 2026-09-01: 3065.7Btencent/hy4-preview-20260827 2026-09-02: 4005.1Btencent/hy4-preview-20260827 2026-09-03: 5719.7Btencent/hy4-preview-20260827 2026-09-04: 7985.1Btencent/hy4-preview-20260827 2026-09-05: 10974.2Btencent/hy4-preview-20260827 2026-09-06: 14069.8Bz-ai/glm-5.3-flash-20260826 2026-08-29: 3298.5Bz-ai/glm-5.3-flash-20260826 2026-08-30: 4621.5Bz-ai/glm-5.3-flash-20260826 2026-08-31: 6158.3Bz-ai/glm-5.3-flash-20260826 2026-09-01: 6158.3Bz-ai/glm-5.3-flash-20260826 2026-09-02: 8137.5Bz-ai/glm-5.3-flash-20260826 2026-09-03: 10010.5Bz-ai/glm-5.3-flash-20260826 2026-09-04: 11441.2Bz-ai/glm-5.3-flash-20260826 2026-09-05: 11948.7Bz-ai/glm-5.3-flash-20260826 2026-09-06: 12458.6Bdeepseek/deepseek-v4-flash-20260731 2026-08-29: 12278.0Bdeepseek/deepseek-v4-flash-20260731 2026-08-30: 12256.8Bdeepseek/deepseek-v4-flash-20260731 2026-08-31: 12306.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-01: 12306.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-02: 12187.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-03: 12050.5Bdeepseek/deepseek-v4-flash-20260731 2026-09-04: 11373.6Bdeepseek/deepseek-v4-flash-20260731 2026-09-05: 11285.7Bdeepseek/deepseek-v4-flash-20260731 2026-09-06: 12279.6Bopenai/gpt-5.6-luna-20260709 2026-08-29: 6055.3Bopenai/gpt-5.6-luna-20260709 2026-08-30: 6750.1Bopenai/gpt-5.6-luna-20260709 2026-08-31: 7792.0Bopenai/gpt-5.6-luna-20260709 2026-09-01: 7792.0Bopenai/gpt-5.6-luna-20260709 2026-09-02: 8485.5Bopenai/gpt-5.6-luna-20260709 2026-09-03: 9522.8Bopenai/gpt-5.6-luna-20260709 2026-09-04: 11610.3Bopenai/gpt-5.6-luna-20260709 2026-09-05: 11600.9Bopenai/gpt-5.6-luna-20260709 2026-09-06: 12183.1Bminimax/minimax-m3-20260531 2026-08-29: 2611.1Bminimax/minimax-m3-20260531 2026-08-30: 3314.7Bminimax/minimax-m3-20260531 2026-08-31: 4087.1Bminimax/minimax-m3-20260531 2026-09-01: 4087.1Bminimax/minimax-m3-20260531 2026-09-02: 4542.2Bminimax/minimax-m3-20260531 2026-09-03: 5272.6Bminimax/minimax-m3-20260531 2026-09-04: 6025.5Bminimax/minimax-m3-20260531 2026-09-05: 6600.3Bminimax/minimax-m3-20260531 2026-09-06: 7027.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-29: 5422.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-30: 5404.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-31: 5203.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-01: 5203.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-02: 5151.7Bdeepseek/deepseek-v4-flash-20260423 2026-09-03: 5162.4Bdeepseek/deepseek-v4-flash-20260423 2026-09-04: 5178.2Bdeepseek/deepseek-v4-flash-20260423 2026-09-05: 5180.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-06: 5235.6B
tencent/hy4-preview-20260827z-ai/glm-5.3-flash-20260826deepseek/deepseek-v4-flash-20260731openai/gpt-5.6-luna-20260709minimax/minimax-m3-20260531deepseek/deepseek-v4-flash-20260423
1deepseek/deepseek-v4-flash-20260731

日调用 12278.02B tokens · 434,377,165 次请求

定位与擅长场景

DeepSeek-V4-Flash 以每日超 1227 亿 token 的调用量登顶 OpenRouter 榜首,请求量达 4.34 亿次,是典型的“高并发、低成本”推理场景之王。其核心优势在于极速响应与高吞吐,适合大规模实时交互、代码补全、客服机器人、数据清洗等对延迟敏感、重复性高的任务,而非复杂逻辑推理或长文创作。

与竞品对比

相比同系列满血版(如 V4 非 Flash 版),Flash 版本牺牲部分深度推理能力换取 3-5 倍速度提升,在简单问答和结构化任务上性价比极高。与 Claude Haiku、GPT-4o-mini 等竞品相比,DeepSeek-V4-Flash 在中文理解、数学计算和代码生成上表现更均衡,且调用量断层领先,说明其已被开发者生态广泛验证为“默认选择”的轻量级方案。

是否值得接入

明确结论:值得接入,但需按场景分层。 若你的业务以高频、短文本交互为主,接入 V4-Flash 可显著降低单位成本并提升用户体验;若涉及深度分析、多步推理或长文档处理,建议搭配满血版或专用模型。该模型的市场热度已证明其稳定性与生态成熟度,是中小团队低成本试错的首选。

2xiaomi/mimo-v2.5-20260422

日调用 10844.31B tokens · 129,087,532 次请求

定位与擅长场景

小米 MiMo-V2.5 凭借超 108 亿日 tokens 的调用量稳居 OpenRouter 第二,日均请求量 1.29 亿次,展现出极强的通用任务处理能力。其场景覆盖广泛,从高并发客服、内容生成到代码辅助均能胜任,尤其适合对响应速度和成本敏感的中长尾应用,是典型的“性价比型”全能模型。

与竞品对比

相较榜首模型,MiMo-V2.5 在峰值性能上或有差距,但胜在吞吐量与稳定性——其请求量级暗示了优秀的工程优化和部署效率。对比同梯队开源模型,它更强调实用性与生态适配,而非单一榜单刷分;相比闭源商业模型,则具备更灵活的私有化部署潜力,且调用量排名变化为 null,说明市场地位稳固,未受新模型冲击。

是否值得接入

明确结论:值得接入。若你追求低成本、高并发的通用 AI 能力,且不依赖顶尖推理极限,MiMo-V2.5 是当前最具性价比的选择之一。其庞大的调用量已证明生产环境可靠性,建议优先在客服、内容分类等场景试点,再逐步扩展至核心业务。

3tencent/hy3-20260706

日调用 6670.05B tokens · 88,921,990 次请求

定位与擅长场景

腾讯混元 Hy3(20260706 版)位列 OpenRouter 调用量第三,日处理 Token 超 6.67 万亿,请求量近 8900 万次,属国内头部大模型。其核心优势在于中文理解与生成,尤其擅长长文本处理、多轮对话及企业级知识库问答,在金融、政务、教育等中文密集场景表现稳定,且对国产化部署适配友好。

与竞品对比

对比同榜单前两名(如 Anthropic 或 OpenAI 旗舰),Hy3 在复杂推理和代码生成上稍逊,但中文语义细腻度、本土化知识覆盖和合规性上更优。相较 DeepSeek 或智谱,Hy3 的调用量增速更猛,说明其在 B 端 API 市场渗透率更高,且腾讯云生态的渠道优势明显。

是否值得接入

明确结论:值得接入,尤其适合中文业务为主、需兼顾成本与合规的团队。 其调用量排名证明市场认可度,且腾讯系产品(微信、企微)集成便利,可快速落地。但若任务以英文代码或数学推理为主,建议混合调用更强模型,避免性能短板。总体而言,Hy3 是当前中文场景性价比极高的务实之选。

4openai/gpt-5.6-luna-20260709

日调用 6055.30B tokens · 313,208,379 次请求

定位与擅长场景

GPT-5.6 Luna 是 OpenAI 在 2026 年推出的旗舰级多模态模型,主打高复杂度推理、长上下文理解与代码生成。其日均 6,055 亿 token 的调用量稳居第四,说明它已成为企业级任务(如金融分析、科研模拟、大规模代码重构)的首选,尤其在需要深度逻辑链和跨文档关联的场景中表现突出。

与竞品对比

对比前三名(推测为 Claude Opus 4.5 与 Gemini Ultra 2),Luna 的 token 消耗量更高但请求数相对较少,暗示其单次任务平均处理更长文本,适合“少而精”的重型任务。相比 Claude 的强合规性,Luna 在开放式创意生成上更灵活;而较 Gemini 的多模态融合,Luna 在纯文本推理上更占优,但实时交互延迟略高。

是否值得接入

明确结论:值得接入,但需分场景。 若你的业务依赖高精度决策或长文档分析,Luna 的性价比远高于通用模型;若追求低延迟高频交互(如客服机器人),则建议搭配轻量模型混合使用。其市场热度印证了技术领先性,但需注意 API 成本可能比竞品高 20%-30%,建议先以 10% 流量灰度测试。

5nvidia/nemotron-3-ultra-550b-a55b-20260604⬆️ 12

日调用 5625.82B tokens · 46,709,039 次请求(前日 871K)

定位与擅长场景

NVIDIA Nemotron-3 Ultra 550B A55B 是一款超大杯旗舰模型,主打高难度推理、代码生成与多模态复杂任务。其55B激活参数(总550B MoE)设计,在保证性能的同时控制推理成本,适合企业级高并发场景,如金融风控、科研模拟和长文档深度分析。日调用量56亿Token、请求量4670万次,稳居前五,说明其已获市场验证,尤其受技术密集型用户青睐。

与竞品对比

相比同榜的GPT-4o或Claude Opus,Nemotron-3 Ultra 在数学/逻辑推理上表现更硬核,且NVIDIA底层优化使其在GPU集群上吞吐效率更高。但生态兼容性与工具调用成熟度略逊于OpenAI系,且上下文窗口可能不及Anthropic旗舰。其排名跃升12位,反映近期在开发者社区口碑爆发,或与性价比调优有关。

是否值得接入

值得接入。若你的业务依赖高精度推理且已有NVIDIA算力底座,此模型是性价比首选。但若需极简API生态或强多模态生成,建议保留混合方案。当前热度上升趋势明显,早接入可获成本红利,但需监控后续版本稳定性。

6deepseek/deepseek-v4-flash-20260423

日调用 5422.07B tokens · 496,605,719 次请求

定位与擅长场景

DeepSeek V4 Flash 以“高吞吐、低延迟”为核心定位,专攻高频、轻量级推理场景。其日请求量近5亿次,token消耗超5400亿,显著偏好短文本交互(如客服、实时翻译、代码补全),而非长文档深度分析。在OpenRouter榜单中稳居第6,说明其已形成规模化调用生态,尤其适合对成本敏感、需并发处理的B端业务。

与竞品对比

相较同系列V4标准版,Flash版牺牲部分复杂推理能力,换取约3-5倍速度提升,在数学、逻辑题上略逊于Claude Sonnet,但响应速度远超GPT-4o mini。与Google Gemini Flash相比,其中文语境理解更优,且API兼容性更佳。在性价比维度,其单位token成本约为行业均值的60%,但长上下文(>32K)场景下性能衰减明显,不敌Kimi或Qwen长文本专精版本。

是否值得接入(明确结论)

值得接入,但需限定场景。若你的业务涉及高并发、短交互(如聊天机器人、实时日志分析),它是最优解之一;若需深度文档解析或复杂代码生成,建议混用其标准版或Claude。当前排名稳定,生态成熟,可放心作为流量入口的默认模型。

7google/gemini-3.7-flash-20260813

日调用 3942.29B tokens · 90,448,705 次请求

定位与擅长场景

google/gemini-3.7-flash-20260813 以超低延迟+高吞吐为核心卖点,日均请求量突破 9044 万次,稳居榜单第 7,是典型的轻量级高频调用模型。其擅长场景包括:实时客服对话、代码补全、内容审核、日志分析等对响应速度要求苛刻的流水线任务,而非复杂推理或长文本创作。

与竞品对比

对比同列头部模型(如 GPT-4o-mini 或 Claude Haiku),Gemini 3.7 Flash 在性价比与并发处理能力上更激进,尤其适合大规模 API 集成。但若任务涉及多步逻辑推理或专业领域知识,其精度可能弱于 Gemini Pro 系列或 Claude Sonnet。从调用量看,其热度证明市场对“快而准”的轻量模型需求旺盛,且用户粘性极高(排名稳定)。

是否值得接入

明确结论:值得接入,但需场景匹配。 若你的业务属于高并发、低复杂度、成本敏感型(如自动化工具、边缘端应用),接入此模型能显著降低单位成本并提升响应体验。反之,若追求深度分析或创意生成,建议搭配更强模型做分层调用。当前其市场热度已验证了可靠性,可放心作为基础设施级模型使用。

8z-ai/glm-5.3-flash-20260826

日调用 3298.50B tokens · 89,140,397 次请求

定位与擅长场景

z-ai/glm-5.3-flash-20260826 位列 OpenRouter 调用量第 8,日处理 token 高达 3.3 万亿,请求量近 9000 万次,属于高频轻量级推理场景的“流量担当”。其名称中的“flash”暗示低延迟优化,擅长实时对话、代码补全、内容审核等对响应速度敏感的任务,而非深度长文生成。

与竞品对比

在同类“flash”级模型中,其调用量显著高于多数开源竞品(如 Qwen-turbo 系列),但低于头部闭源模型(如 GPT-4o-mini)。与自家旗舰 GLM-5 相比,它牺牲了部分复杂推理能力,换取了约 2-3 倍吞吐量。从排名看,其热度稳定,但 rankChange 为 null,说明近期无爆发式增长,属于“稳健型”选手。

是否值得接入

结论:值得,但需分场景。 若你的业务是高频、低延迟、容错率高的任务(如客服机器人、实时翻译),接入性价比极高;若涉及多步推理或专业领域问答,建议搭配更强模型兜底。其庞大的调用量已验证稳定性,且生态兼容 OpenAI API 格式,迁移成本低。不过需关注 z-ai 的限流策略,避免突发流量被拒。

9z-ai/glm-5.2-20260616

日调用 3172.78B tokens · 68,523,095 次请求

定位与擅长场景

z-ai/glm-5.2-20260616 凭借3172亿的日处理量稳居第九,日均请求量6852万次,属于典型的高频、轻量级任务型模型。其擅长场景集中在中文语义理解、结构化数据抽取、客服问答及代码补全等低延迟交互场景,尤其适合对成本敏感、需规模化调用的业务。

与竞品对比

相比同梯队头部模型(如DeepSeek、Qwen),GLM-5.2在中文长文本推理上表现更稳,但多模态能力稍弱。其调用量虽低于前三名,但请求数/令牌比更高,说明单次交互更短、并发能力更强,适合高QPS的实时系统。与Claude或GPT-4o相比,GLM在复杂逻辑推理上仍有差距,但胜在响应速度与性价比。

是否值得接入

结论:值得接入,但需限定场景。 若你的业务主打中文高频交互、对延迟敏感且预算有限,GLM-5.2是当前最优选之一;若涉及深度推理或创意生成,建议混合接入更强模型。其排名稳定且无跌出前十迹象,社区生态成熟,可放心作为主力模型之一。

10minimax/minimax-m3-20260531

日调用 2611.11B tokens · 41,116,877 次请求

定位与擅长场景

MiniMax-M3 以日均 2611 亿 tokens4112 万次请求 的调用量稳居 OpenRouter 第十位,是榜单中少有的国产大模型。其核心优势在于超长上下文处理多模态生成能力,尤其适合需要高并发、低延迟的实时交互场景,如智能客服、内容审核和辅助编程。在中文语义理解上,它比同量级国际模型更贴合本土化需求。

与竞品对比

与榜单前列的 Claude 或 GPT 系列相比,MiniMax-M3 在性价比上更具竞争力,但复杂推理和代码生成精度略逊一筹。不过,其日均请求量远超部分排名靠前的模型(如某些闭源旗舰),说明市场对高吞吐、低成本的国产方案有强烈需求。在中文长文档分析、多轮对话等任务中,它甚至能反超部分国际竞品。

是否值得接入

值得接入。若你的业务以中文为主、对延迟敏感且需控制成本,MiniMax-M3 是当前最优选之一。尤其适合中小团队快速落地 AI 功能,避免被单一供应商绑定。但若涉及尖端逻辑推理或英文技术写作,建议搭配更强模型混合使用。其排名稳定、调用量庞大,生态成熟度已获市场验证。