国产大模型实际成本实测:文本+多模态分任务横评(2026-08)
[方法]为什么测、以谁为准
这次不是比“纸面价”,而是同一批任务真实调用后比 token、耗时、折算成本和任务成功率。模型准入有一个硬规则:只测知乎答主 toyama nao(致知榜)评测过的国产模型——没被他评过的模型没有资格进入对比。他用自制题库累计测过 126 个模型、耗时超 400 小时,2025 年度知乎新知答主,榜单在 llm2014/llm_benchmark。
实测口径:
- 文本 6 类任务:写作 / 代码 / 长文档总结 / JSON 抽取 / 数学 / 翻译;
- 多模态 3 类任务(仅对支持图片/视频输入的模型):图片理解 / OCR / 视频理解,素材为自制标准图(3 红圆+2 蓝方块)、检验报告单、8 秒移动方块视频;
- 每任务自动评分(1.0 通过、0.5 部分、0.0 未过),先保质后价格;同模型多轮采样取最优;
- 渠道:官方 API 优先,SiliconFlow 仅作补充(表中带 *),价格单独计价;
- 成本:按官方刊例价(输入/输出/缓存命中)从真实 usage 折算;数据时间 2026-08-07。
toyama nao 的分析文章说了什么
核心观点(全文见文末来源):
- GLM-5.2:国产编程第一个代差,公开 5 工程 3 个 A 档持平 Opus 4.8;输出 token 比 Opus 省 35%;代码量最大但 Bug 少。
- Qwen3.8-Max:稳定性国产 SOTA、前端追平 K3,但推理长度 +17%,约束求解类个别题目 Token 暴涨 700%,复杂问题几乎必超长。
- DS V4 Flash:300B 极限打平自家 1.6T Pro,稳定性反超;但复杂 Agentic 任务缓存读取比 Pro 高 2.7~5 倍,只有原厂缓存效率才保得住成本优势。
- 豆包 Seed 2.1 Pro:UI 审美国模之冠,但 ¥30/M + 平均 65K Token,总成本当时国模第一。
- 方法论:红字=慢思考(推理模式)、黑字=快思考;按中位分数排序;记录 Token、耗时、测试成本、价格。
文本实测总表(6 任务整套)
| 模型 | 渠道 | 通过/6 | 整套成本 ¥ | 累计耗时 | 失败/备注 |
|---|---|---|---|---|---|
| 混元 Hy3 | 腾讯云 TokenHub | 6/6 | 0.0099 | 37s | 默认 low 思考档 |
| DeepSeek V4 Flash | SiliconFlow* | 6/6 | 0.0263 | 140s | - |
| MiMo V2.5 Pro | 官方 | 6/6 | 0.0544 | 49s | 纯文本模型 |
| DeepSeek V4 Pro | 官方 | 6/6 | 0.0563 | 126s | - |
| MiniMax-M3 | 官方 | 6/6 | 0.0730 | 193s | 思考型,翻译 5/5 |
| Qwen3.7-Plus | 官方 | 6/6 | 0.1096 | 232s | - |
| Step-3.7-Flash | 官方 | 6/6 | 0.1308 | 127s | 需要较高 token 预算 |
| GLM-5.2 | 官方 | 6/6 | 0.3419 | 167s | 思考链长 |
| DeepSeek V4 Pro | SiliconFlow* | 6/6 | 0.4239 | 344s | 平台价是官方 4 倍 |
| GLM-5.2 | SiliconFlow* | 6/6 | 0.5059 | 248s | 平台价口径 |
| Qwen3.7-Max | 官方 | 6/6 | 0.5640 | 419s | 编码 130~165s |
| DeepSeek V4 Flash | 官方 | 5/6 | 0.0154 | 34s | 代码思考链吃光预算 |
| Kimi K2.7-Code | 官方 | 5/6 | 0.2208 | 137s | 代码截断 |
| Qwen3.8-Max | 官方 | 5/6 | 0.2533 | 317s | 代码连续超时 |
| Kimi K3 | 官方 | 5/6 | 0.9964 | 247s | 代码截断,整套近 ¥1 |
* SiliconFlow 是聚合平台而非厂商:DeepSeek V4 Pro 平台价 ¥12/¥24,是官方 ¥3/¥6 的 4 倍;GLM-5.2 官方价 ¥8/¥28,SF 平台输入 ¥6 反而便宜。混元已整体迁移腾讯云 TokenHub(tokenhub.tencentmaas.com/v1),旧直连端点作废;hy3 默认 reasoning_effort=low(toyama 榜单用 high 档,分数更高但更贵)。
注意:GLM-5.2 与 Step-3.7-Flash 初测在默认 token 预算下“代码/翻译失败”,提高预算后 6/6 全过——这是思考型模型的典型特征:输出质量依赖足够长的输出预算。
多模态实测(图片 / OCR / 视频)
只测官方支持图片/视频输入的模型:
| 模型 | 图片理解 | OCR | 视频理解 | 说明 |
|---|---|---|---|---|
| 混元 YT-VITA | 1.0(¥0.0005,1.5s) | 1.0(¥0.0010,2.7s) | 上游 502 未计 | TokenHub 多模态,图片/视频/音频 |
| 混元 HY-Vision-2.0 | 1.0(¥0.0017,4.4s) | 1.0(¥0.0023,5.1s) | 不支持 | 仅图片 |
| 混元 HY-Vision-1.5-Thinking | 1.0(¥0.0020,6.3s) | 1.0(¥0.0055,16.8s) | 不支持 | 仅图片,OCR 较慢 |
| 混元 HY-Vision-Video | 不支持 | 不支持 | 1.0(¥0.0004,4.8s) | 仅视频 |
| MiniMax-M3 | 1.0(¥0.0026,3.6s) | 1.0(¥0.0042,6.3s) | 1.0(¥0.0045,7.6s) | 三件套 ¥0.0113,17.5s |
| Kimi K2.7-Code | 1.0(¥0.0067,7.0s) | 1.0(¥0.0088,7.3s) | 1.0(¥0.0177,9.8s) | 三件套 ¥0.0332,24.1s |
| Qwen3.8-Max | 1.0(¥0.0183,8.6s) | 1.0(¥0.0216,9.4s) | 1.0(¥0.0344,14.3s) | 三件套 ¥0.0743,32.3s |
所有模型图片理解、OCR(化验单 10/10 字段)、视频理解(数字 42 / ALPHA / 移动方向)全部满分。混元视觉走腾讯云 TokenHub:只接受公网 URL(base64 会 400/502),素材托管在 jerryli.cn/mmassets/;正确模型 ID 为 hy-vision-2.0-instruct、hunyuan-t1-vision-20250916、hunyuan-turbos-vision-video-20250728、youtu-vita(与 /v1/models 及官方文档一致)。图片/OCR 最便宜是 YT-VITA(两任务合计 ¥0.0015),视频最便宜是 HY-Vision-Video(¥0.0004/次),均低于 MiniMax-M3;不过 YT-VITA 的视频接口当前持续 502(上游引擎异常,重试 3 次均失败),视频任务暂用 HY-Vision-Video。MiniMax-M3 仍是三个“三件套全能”模型中最便宜、最快的。
GLM-5.2、Step-3.7-Flash、MiMo V2.5 Pro、DeepSeek 系列为纯文本/代码模型,未列入多模态对比。




分任务路由建议(质量优先)
| 任务 | 首选 | 次选 | 说明 |
|---|---|---|---|
| 写作 | DS V4 Flash 官方(¥0.0018/次) | 混元 Hy3(¥0.0021/次) | Flash 最便宜且质量满分 |
| 代码 | 混元 Hy3(¥0.0036/次,11s) | DS V4 Pro 官方(¥0.0185/次) | hy3 又快又便宜且代码通过 |
| 长文档 | DS V4 Flash 官方(¥0.0012/次) | 混元 Hy3(¥0.0013/次) | 差距极小 |
| JSON 抽取 | 混元 Hy3(¥0.0006/次) | DS V4 Flash 官方(¥0.0008/次) | 高频流水线首选 hy3 |
| 数学 | DS V4 Flash SF*(¥0.0012/次) | DS V4 Flash 官方(¥0.0016/次) | 都答对 18 公里 |
| 翻译 | 混元 Hy3(¥0.0007/次) | DS V4 Flash 官方(¥0.0014/次) | 术语 4/5,够用 |
| 图片理解 | 混元 YT-VITA(¥0.0005/次) | 混元 HY-Vision-2.0(¥0.0017/次) | 需公网 URL |
| OCR | 混元 YT-VITA(¥0.0010/次) | 混元 HY-Vision-2.0(¥0.0023/次) | 化验单 10/10 字段 |
| 视频理解 | 混元 HY-Vision-Video(¥0.0004/次) | MiniMax-M3(¥0.0045/次) | 42/ALPHA/方向全对 |
月度成本场景
假设每天:写作 20、代码 30、长文档 10、抽取 50、数学 5、翻译 15 次;多模态:图片 10、OCR 10、视频 2 次,按月 30 天:
注:本节是按"小任务量假设 × 官方刊例价"的理论推演,用于模型间横向对比;真实账单见下一节,两者差一个数量级。
- 全用 DS V4 Flash 官方:约 ¥11/月(代码任务需接受波动或换 Pro);
- 全用混元 Hy3(TokenHub):约 ¥6.4/月,文本 6/6 全过;
- 全用混元(文本 Hy3 + 视觉 YT-VITA/HY-Vision-Video):约 ¥6.9/月(多模态 3 任务约 ¥0.5/月);
- 全用 MiniMax-M3:约 ¥55/月(文本+多模态全通过,最省心的全能选择);
- 混合路由(文本用 Hy3+Flash,多模态用混元视觉):约 ¥7/月;多模态改用 MiniMax 则约 ¥9/月;
- 全用 Kimi K3:约 ¥652/月,且代码还过不了。
真实账单(2026-05-26 ~ 2026-08-08,75 天)
上节的推演只算"任务级单次成本";真实账单把主管对话、cron 管线和调试全算进去后,月费直接上一个数量级。DeepSeek 账单为全量出账(Codex 与 Hermes 共用同一 key),OCR 为百炼独立账单,其余渠道按实际出账汇总。

全渠道汇总
| 项目 | 金额 | 说明 |
|---|---|---|
| DeepSeek flash | ¥304.61 | 主力推理/Agent,5/26–8/8 |
| DeepSeek pro | ¥42.91 | 6 月集中调试(¥31.23),7 月后回落 |
| OCR(百炼) | ¥23.44 | 教材/复杂文档 OCR(qwen3.5-ocr 等),独立账单 |
| Kimi(Moonshot) | ¥4.64 | 两个月调试 |
| MiniMax | ¥2.00 | 代金券抵扣 |
| SiliconFlow | ¥0.72 | 已弃用,另有余额 ¥5+ 未计入 |
| StepFlash | ¥0.25 | 实测 |
| 小米 Mimo | ¥0.07 | 实测 |
| TokenHub / 智谱 | ¥0.00 | 免费额度 |
| 合计 | ≈ ¥378.6 | 日均 ≈ ¥5.0,月均 ≈ ¥152 |
DeepSeek 月度拆分
| 期间 | 总费用 | flash | pro | 说明 |
|---|---|---|---|---|
| 5/26–5/31(6 天) | ¥11.80 | ¥11.77 | ¥0.03 | 起步期 |
| 2026-06(30 天) | ¥150.86 | ¥119.63 | ¥31.23 | Hermes 管线时代 |
| 2026-07(31 天) | ¥127.26 | ¥116.08 | ¥11.18 | Hermes 管线时代 |
| 8/1–8/8(8 天) | ¥57.60 | ¥57.13 | ¥0.47 | 含 Codex 最后 5 天(¥33,与 cron 并行) |
关键结论
- 6–7 月的 ¥127–151/月主要由 Hermes cron 管线产生(日报、论文分析、邮件检查等高频调用),不是 Codex;Codex 只有 8/4–8/8 五天,且与 cron 并行(5 天合计 ¥33)。
- 缓存命中率 98%+,但缓存 token 量巨大(6 月 33.8 亿、7 月 28.6 亿),缓存重放占 flash 费用约一半(7 月 flash ¥116.08 = 缓存 ¥57.1 + 未命中输入 ¥39.5 + 输出 ¥19.5)。
- 调试试错是费用大头,干活反而便宜:单日 ≥¥10 的日子 6–8 月共 7 天(6/8、7/12、7/22、7/25、8/3、8/4、8/7),合计约 ¥94,基本都是模型实测、路由改造、管线调试;正常干活日(单日 <¥5)日均仅 ¥1.5–2.3(7 月 19 天合计 ¥28.7)。把 7 月三个峰值日封到 ¥5 后月费 ≈ ¥103,与 100 元预算基本持平;6 月是搭建/调试月(14 天 ≥¥5,pro 占 ¥31),属于一次性高支出。
- 预算结论修正:稳态月费约 ¥80–120(正常干活 + 少量中强度日),调试/试错集中月会冲到 ¥130–150+;100 元预算的合理用法是"干活正常、调试另计",降本重点仍是减少调试期无效调用和上下文重放。
Plan / 订阅怎么选
API 之外还有“plan”这条路,最典型的是阿里云百炼 Token Plan(2026-08 新版):
- Lite:39 元/月(2500 Credits/周 + 700 Credits/5 小时);
- Standard:139 元/月(10000 Credits/周 + 3000 Credits/5 小时);
- Pro:499 元/月(40000 Credits/周 + 12000 Credits/5 小时);
- 夜间 22:00-08:00 调用 qwen3.7 系列可低至 2 折抵扣;Credits 可在 Qwen/DeepSeek/Kimi/GLM 等 150+ 模型间通用。
- 阿里云还有“AI 通用型节省计划”(承诺 3/6/12/24 个月消费换折扣,最高约 4.5~5.3 折)。
用量稳定能填满套餐额度时,Token Plan 的综合单 token 成本明显低于按量;用量波动大时按量+混合路由更省。
结论与待办
- 文本成本王:混元 Hy3(腾讯云 TokenHub)——6/6 全过、整套 ¥0.0099、37 秒,代码 11 秒 ¥0.0036 即过;默认 low 思考档,复杂任务可切 high(更贵但更强)。
- 文本+多模态双料黑马:MiniMax-M3 官方——文本 6/6、多模态 3/3,整套文本 ¥0.073、多模态三件套 ¥0.011,全能且快。
- 最便宜的传统选手:DS V4 Flash 官方(文本整套 ¥0.015),但代码有思考链截断波动;SF 通道 Flash 代码反而通过,但依赖平台缓存效率。真实账单显示 flash 月费 ¥116–120(Hermes cron 时代口径),缓存重放占约一半;Codex 仅最后 5 天(¥33,与 cron 并行)。
- GLM-5.2 官方:6/6,质量接近 SF 通道表现,但思考链长(代码一次 9500+ token),适合精修不适合批量。
- Qwen3.8-Max:榜单编程国产第一,但本实测代码连续多次超时(180s×2、300s×1),多模态表现优秀;适合深度推理/多模态,不适合高频编码。
- 混元视觉已补测(TokenHub):图片理解/OCR 用 YT-VITA(两任务合计 ¥0.0015/次)、视频理解用 HY-Vision-Video(¥0.0004/次),全部满分。此前 400/502 的根因有两个:探针误用了不带日期后缀的旧模型名(正确 ID 是
hy-vision-2.0-instruct、hunyuan-t1-vision-20250916、hunyuan-turbos-vision-video-20250728、youtu-vita),且 TokenHub 只接受公网 URL,而素材链接当时因权限返回 403;YT-VITA 视频上游目前仍 502,视频任务暂用 HY-Vision-Video。其余上榜模型(豆包等)未测。
本文为 2026-08-07 实测,思考型模型输出有波动,同模型多轮采样取最优;toyama nao 的榜单与价格口径见文内链接,重要决策建议多轮复核。