苏菲的工房

国产大模型实际成本实测:文本+多模态分任务横评(2026-08)

[方法]

为什么测、以谁为准

这次不是比“纸面价”,而是同一批任务真实调用后比 token、耗时、折算成本和任务成功率。模型准入有一个硬规则:只测知乎答主 toyama nao(致知榜)评测过的国产模型——没被他评过的模型没有资格进入对比。他用自制题库累计测过 126 个模型、耗时超 400 小时,2025 年度知乎新知答主,榜单在 llm2014/llm_benchmark

实测口径:

toyama nao 的分析文章说了什么

核心观点(全文见文末来源):

文本实测总表(6 任务整套)

模型 渠道 通过/6 整套成本 ¥ 累计耗时 失败/备注
混元 Hy3 腾讯云 TokenHub 6/6 0.0099 37s 默认 low 思考档
DeepSeek V4 Flash SiliconFlow* 6/6 0.0263 140s -
MiMo V2.5 Pro 官方 6/6 0.0544 49s 纯文本模型
DeepSeek V4 Pro 官方 6/6 0.0563 126s -
MiniMax-M3 官方 6/6 0.0730 193s 思考型,翻译 5/5
Qwen3.7-Plus 官方 6/6 0.1096 232s -
Step-3.7-Flash 官方 6/6 0.1308 127s 需要较高 token 预算
GLM-5.2 官方 6/6 0.3419 167s 思考链长
DeepSeek V4 Pro SiliconFlow* 6/6 0.4239 344s 平台价是官方 4 倍
GLM-5.2 SiliconFlow* 6/6 0.5059 248s 平台价口径
Qwen3.7-Max 官方 6/6 0.5640 419s 编码 130~165s
DeepSeek V4 Flash 官方 5/6 0.0154 34s 代码思考链吃光预算
Kimi K2.7-Code 官方 5/6 0.2208 137s 代码截断
Qwen3.8-Max 官方 5/6 0.2533 317s 代码连续超时
Kimi K3 官方 5/6 0.9964 247s 代码截断,整套近 ¥1

* SiliconFlow 是聚合平台而非厂商:DeepSeek V4 Pro 平台价 ¥12/¥24,是官方 ¥3/¥6 的 4 倍;GLM-5.2 官方价 ¥8/¥28,SF 平台输入 ¥6 反而便宜。混元已整体迁移腾讯云 TokenHub(tokenhub.tencentmaas.com/v1),旧直连端点作废;hy3 默认 reasoning_effort=low(toyama 榜单用 high 档,分数更高但更贵)。

注意:GLM-5.2 与 Step-3.7-Flash 初测在默认 token 预算下“代码/翻译失败”,提高预算后 6/6 全过——这是思考型模型的典型特征:输出质量依赖足够长的输出预算

多模态实测(图片 / OCR / 视频)

只测官方支持图片/视频输入的模型:

模型 图片理解 OCR 视频理解 说明
混元 YT-VITA 1.0(¥0.0005,1.5s) 1.0(¥0.0010,2.7s) 上游 502 未计 TokenHub 多模态,图片/视频/音频
混元 HY-Vision-2.0 1.0(¥0.0017,4.4s) 1.0(¥0.0023,5.1s) 不支持 仅图片
混元 HY-Vision-1.5-Thinking 1.0(¥0.0020,6.3s) 1.0(¥0.0055,16.8s) 不支持 仅图片,OCR 较慢
混元 HY-Vision-Video 不支持 不支持 1.0(¥0.0004,4.8s) 仅视频
MiniMax-M3 1.0(¥0.0026,3.6s) 1.0(¥0.0042,6.3s) 1.0(¥0.0045,7.6s) 三件套 ¥0.0113,17.5s
Kimi K2.7-Code 1.0(¥0.0067,7.0s) 1.0(¥0.0088,7.3s) 1.0(¥0.0177,9.8s) 三件套 ¥0.0332,24.1s
Qwen3.8-Max 1.0(¥0.0183,8.6s) 1.0(¥0.0216,9.4s) 1.0(¥0.0344,14.3s) 三件套 ¥0.0743,32.3s

所有模型图片理解、OCR(化验单 10/10 字段)、视频理解(数字 42 / ALPHA / 移动方向)全部满分。混元视觉走腾讯云 TokenHub:只接受公网 URL(base64 会 400/502),素材托管在 jerryli.cn/mmassets/;正确模型 ID 为 hy-vision-2.0-instructhunyuan-t1-vision-20250916hunyuan-turbos-vision-video-20250728youtu-vita(与 /v1/models 及官方文档一致)。图片/OCR 最便宜是 YT-VITA(两任务合计 ¥0.0015),视频最便宜是 HY-Vision-Video(¥0.0004/次),均低于 MiniMax-M3;不过 YT-VITA 的视频接口当前持续 502(上游引擎异常,重试 3 次均失败),视频任务暂用 HY-Vision-Video。MiniMax-M3 仍是三个“三件套全能”模型中最便宜、最快的。

GLM-5.2、Step-3.7-Flash、MiMo V2.5 Pro、DeepSeek 系列为纯文本/代码模型,未列入多模态对比。

质量-成本散点(★=性价比前3满分模型,数字编号对应图例)

成本热力图

质量柱状图

耗时与Token

分任务路由建议(质量优先)

任务 首选 次选 说明
写作 DS V4 Flash 官方(¥0.0018/次) 混元 Hy3(¥0.0021/次) Flash 最便宜且质量满分
代码 混元 Hy3(¥0.0036/次,11s) DS V4 Pro 官方(¥0.0185/次) hy3 又快又便宜且代码通过
长文档 DS V4 Flash 官方(¥0.0012/次) 混元 Hy3(¥0.0013/次) 差距极小
JSON 抽取 混元 Hy3(¥0.0006/次) DS V4 Flash 官方(¥0.0008/次) 高频流水线首选 hy3
数学 DS V4 Flash SF*(¥0.0012/次) DS V4 Flash 官方(¥0.0016/次) 都答对 18 公里
翻译 混元 Hy3(¥0.0007/次) DS V4 Flash 官方(¥0.0014/次) 术语 4/5,够用
图片理解 混元 YT-VITA(¥0.0005/次) 混元 HY-Vision-2.0(¥0.0017/次) 需公网 URL
OCR 混元 YT-VITA(¥0.0010/次) 混元 HY-Vision-2.0(¥0.0023/次) 化验单 10/10 字段
视频理解 混元 HY-Vision-Video(¥0.0004/次) MiniMax-M3(¥0.0045/次) 42/ALPHA/方向全对

月度成本场景

假设每天:写作 20、代码 30、长文档 10、抽取 50、数学 5、翻译 15 次;多模态:图片 10、OCR 10、视频 2 次,按月 30 天:

注:本节是按"小任务量假设 × 官方刊例价"的理论推演,用于模型间横向对比;真实账单见下一节,两者差一个数量级。

真实账单(2026-05-26 ~ 2026-08-08,75 天)

上节的推演只算"任务级单次成本";真实账单把主管对话、cron 管线和调试全算进去后,月费直接上一个数量级。DeepSeek 账单为全量出账(Codex 与 Hermes 共用同一 key),OCR 为百炼独立账单,其余渠道按实际出账汇总。

近三个月真实费用(DeepSeek 分月 + OCR)

全渠道汇总

项目 金额 说明
DeepSeek flash ¥304.61 主力推理/Agent,5/26–8/8
DeepSeek pro ¥42.91 6 月集中调试(¥31.23),7 月后回落
OCR(百炼) ¥23.44 教材/复杂文档 OCR(qwen3.5-ocr 等),独立账单
Kimi(Moonshot) ¥4.64 两个月调试
MiniMax ¥2.00 代金券抵扣
SiliconFlow ¥0.72 已弃用,另有余额 ¥5+ 未计入
StepFlash ¥0.25 实测
小米 Mimo ¥0.07 实测
TokenHub / 智谱 ¥0.00 免费额度
合计 ≈ ¥378.6 日均 ≈ ¥5.0,月均 ≈ ¥152

DeepSeek 月度拆分

期间 总费用 flash pro 说明
5/26–5/31(6 天) ¥11.80 ¥11.77 ¥0.03 起步期
2026-06(30 天) ¥150.86 ¥119.63 ¥31.23 Hermes 管线时代
2026-07(31 天) ¥127.26 ¥116.08 ¥11.18 Hermes 管线时代
8/1–8/8(8 天) ¥57.60 ¥57.13 ¥0.47 含 Codex 最后 5 天(¥33,与 cron 并行)

关键结论

  1. 6–7 月的 ¥127–151/月主要由 Hermes cron 管线产生(日报、论文分析、邮件检查等高频调用),不是 Codex;Codex 只有 8/4–8/8 五天,且与 cron 并行(5 天合计 ¥33)。
  2. 缓存命中率 98%+,但缓存 token 量巨大(6 月 33.8 亿、7 月 28.6 亿),缓存重放占 flash 费用约一半(7 月 flash ¥116.08 = 缓存 ¥57.1 + 未命中输入 ¥39.5 + 输出 ¥19.5)。
  3. 调试试错是费用大头,干活反而便宜:单日 ≥¥10 的日子 6–8 月共 7 天(6/8、7/12、7/22、7/25、8/3、8/4、8/7),合计约 ¥94,基本都是模型实测、路由改造、管线调试;正常干活日(单日 <¥5)日均仅 ¥1.5–2.3(7 月 19 天合计 ¥28.7)。把 7 月三个峰值日封到 ¥5 后月费 ≈ ¥103,与 100 元预算基本持平;6 月是搭建/调试月(14 天 ≥¥5,pro 占 ¥31),属于一次性高支出。
  4. 预算结论修正:稳态月费约 ¥80–120(正常干活 + 少量中强度日),调试/试错集中月会冲到 ¥130–150+;100 元预算的合理用法是"干活正常、调试另计",降本重点仍是减少调试期无效调用和上下文重放。

Plan / 订阅怎么选

API 之外还有“plan”这条路,最典型的是阿里云百炼 Token Plan(2026-08 新版):

用量稳定能填满套餐额度时,Token Plan 的综合单 token 成本明显低于按量;用量波动大时按量+混合路由更省。

结论与待办

  1. 文本成本王:混元 Hy3(腾讯云 TokenHub)——6/6 全过、整套 ¥0.0099、37 秒,代码 11 秒 ¥0.0036 即过;默认 low 思考档,复杂任务可切 high(更贵但更强)。
  2. 文本+多模态双料黑马:MiniMax-M3 官方——文本 6/6、多模态 3/3,整套文本 ¥0.073、多模态三件套 ¥0.011,全能且快。
  3. 最便宜的传统选手:DS V4 Flash 官方(文本整套 ¥0.015),但代码有思考链截断波动;SF 通道 Flash 代码反而通过,但依赖平台缓存效率。真实账单显示 flash 月费 ¥116–120(Hermes cron 时代口径),缓存重放占约一半;Codex 仅最后 5 天(¥33,与 cron 并行)。
  4. GLM-5.2 官方:6/6,质量接近 SF 通道表现,但思考链长(代码一次 9500+ token),适合精修不适合批量。
  5. Qwen3.8-Max:榜单编程国产第一,但本实测代码连续多次超时(180s×2、300s×1),多模态表现优秀;适合深度推理/多模态,不适合高频编码。
  6. 混元视觉已补测(TokenHub):图片理解/OCR 用 YT-VITA(两任务合计 ¥0.0015/次)、视频理解用 HY-Vision-Video(¥0.0004/次),全部满分。此前 400/502 的根因有两个:探针误用了不带日期后缀的旧模型名(正确 ID 是 hy-vision-2.0-instructhunyuan-t1-vision-20250916hunyuan-turbos-vision-video-20250728youtu-vita),且 TokenHub 只接受公网 URL,而素材链接当时因权限返回 403;YT-VITA 视频上游目前仍 502,视频任务暂用 HY-Vision-Video。其余上榜模型(豆包等)未测。

本文为 2026-08-07 实测,思考型模型输出有波动,同模型多轮采样取最优;toyama nao 的榜单与价格口径见文内链接,重要决策建议多轮复核。

主要来源