跳到内容
Mortal

欲买桂花同载酒,终不似,少年游。 故人已远,山水依旧。

  • 随笔
  • 絮语
  • 小记
  • 归档
  • 关于
© 2026 Mortal认真写字,也认真生活。

一次网站内容改动:5 个Flash模型实测评测报告

更新于:2026-09-04#模型#AI#价格共 4,342 字约 14 分钟

一、测试说明

本次使用同一个网站内容修改任务,通过 Claude Code CLI 分别调用:

  • glm5.3-flash
  • deepseek-v4-flash
  • qwen3.8-flash API
  • qwen3.8-flash Token Plan
  • gpt5.6-luna-max

本报告按五个模型都完成任务进行评测。

评测重点有三项:

  1. 单任务消耗的 Token 数
  2. 完成任务所用的时间
  3. 完成任务产生的实际成本

在任务完成结果相同的情况下,使用 Token 越少、用时越短,说明执行效率越高。

二、模型价格和使用状态

模型 输入价格 输出价格 缓存命中 其它费用 价格状态
Qwen3.8-Flash API ¥0.80/M ¥2.70/M ¥0.10/M 缓存创建 ¥1.25/M 原价
GLM5.3-Flash ¥0.40/M ¥1.40/M ¥0.115/M 无单独缓存创建价格 限时半价
DeepSeek-V4-Flash ¥1.50/M ¥4.50/M ¥0.05/M 无单独缓存创建价格 21:00~22:00闲时价

其它说明:

  • Qwen API 使用普通原价,没有使用 Batch Chat 5 折价格。
  • GLM 本次使用的是测试期间的限时半价。
  • DeepSeek 本次使用的是 21:00~22:00 闲时价格。
  • Qwen Token Plan 按 ¥39/月计算。
  • GPT5.6-Luna-Max 按每月 20 美元的订阅额度计算。

因此,本文对比的是这次实际使用时产生的成本,并不是三家模型标准原价的横向对比。

三、实测数据汇总

模型 计费方式 实测总 Token 实测缓存命中 缓存命中率 请求数 实测用时 实测成本
glm5.3-flash API,限时半价 11,103,347 10,155,136 91.76% 121 35分钟 ¥1.583498
deepseek-v4-flash API,闲时价 21,319,868 20,967,296 98.76% 190 25分钟 ¥1.84
qwen3.8-flash API API,原价 65,843,099 62,509,786 95.18% 299 87分钟 ¥10.24
qwen3.8-flash Token Plan 订阅额度分摊 46,208,164 45,130,075 98.01% 未知 70分钟 ¥2.379
gpt5.6-luna-max 订阅额度分摊 54,568,584 52,273,920 96.28% 未知 107分钟 $0.20,约 ¥1.34

缓存命中率统一按照“缓存命中输入 ÷ 总输入”计算,输出 Token 不放进分母。

四、缓存命中数据

GLM5.3-Flash

text
UTF-8|3 Lines|
缓存命中率 =
10,155,136 ÷ (10,155,136 + 911,838)
= 91.76%

DeepSeek-V4-Flash

text
UTF-8|3 Lines|
缓存命中率 =
20,967,296 ÷ (20,967,296 + 263,641)
= 98.76%

原始记录中的 98.35%,是用缓存命中 Token 除以全部 Token 得出的结果,把输出 Token 也算进去了。只看输入的话,98.76% 更准确。

Qwen3.8-Flash API

Qwen API 的输入由三部分组成:

  • 普通输入:2,792 Token
  • 显式缓存创建:3,162,220 Token
  • 显式缓存命中:62,509,786 Token
text
UTF-8|3 Lines|
总输入 =
2,792 + 3,162,220 + 62,509,786
= 65,674,798 Token
text
UTF-8|3 Lines|
缓存命中率 =
62,509,786 ÷ 65,674,798
= 95.18%

缓存创建不等于缓存命中。缓存创建是第一次把内容放入缓存,不能算作已经命中。

Qwen3.8-Flash Token Plan

text
UTF-8|3 Lines|
缓存命中率 =
45,130,075 ÷ (45,130,075 + 916,119)
= 98.01%

GPT5.6-Luna-Max

text
UTF-8|3 Lines|
缓存命中率 =
52,273,920 ÷ 54,293,851
= 96.28%

GPT 的推理输出 98,817 Token 已经包含在 274,733 个输出 Token 中,不重复计算。

五、Token 和用时综合评分

为了不只看一个指标,采用以下评分方式:

text
UTF-8|5 Lines|
Token 得分 = 全部模型中最少 Token ÷ 当前模型 Token × 100
 
用时得分 = 全部模型中最短用时 ÷ 当前模型用时 × 100
 
综合效率分 = Token 得分和用时得分的平均值

Token 消耗和完成时间各占一半。

模型 Token 得分 用时得分 综合效率分 综合排名
glm5.3-flash 100.00 71.43 85.71 1
deepseek-v4-flash 52.08 100.00 76.04 2
qwen3.8-flash Token Plan 24.03 35.71 29.87 3
qwen3.8-flash API 16.86 28.74 22.80 4
gpt5.6-luna-max 20.35 23.36 21.86 5

这个评分只评价这次任务的执行效率,不代表模型整体能力排名。

六、Token 和用时分析

1. GLM 使用 Token 最少

GLM 这次一共使用了 11,103,347 个 Token,是五个模型中消耗最少的。

它用了 35 分钟完成任务,比 DeepSeek 多花了 10 分钟,但 Token 消耗只有 DeepSeek 的约一半。

按照 Token 和用时各占一半的评分方式,GLM 综合效率排名第一。

2. DeepSeek 完成速度最快

DeepSeek 这次只用了 25 分钟,是五个模型中完成任务最快的。

它消耗了 21,319,868 个 Token,接近 GLM 的两倍。不过从实际使用感受来看,它用更多 Token 换来了更快的完成速度。

本次测试使用的是 21:00~22:00 闲时价格,因此速度表现不能完全代表高峰期情况。

3. Qwen Token Plan 优于 Qwen API

Qwen Token Plan 使用了 46,208,164 个 Token,用时 70 分钟。

相比 Qwen API:

  • 少用了约 1,963 万 Token
  • 少用了 17 分钟
  • 缓存命中率更高

这说明同一个模型在不同调用方式下,实际执行过程可能有明显差异。

4. Qwen API 消耗最多

Qwen API 使用了 65,843,099 个 Token,是五个模型中消耗最多的。

它的缓存命中率达到 95.18%,但仍然用了 87 分钟才完成任务。

这说明缓存命中率高,并不代表整体执行效率一定高。上下文越长,即使大部分内容命中了缓存,整体 Token 数和缓存创建数量仍然可能很大。

5. GPT 用时最长

GPT5.6-Luna-Max 使用了 54,568,584 个 Token,用时 107 分钟,是五个模型中最慢的。

虽然它的订阅分摊成本很低,但从单任务 Token 消耗和完成时间来看,本次没有体现出效率优势。

七、API 成本分析

只比较实际 API 账单:

模型 实测费用 平均每百万总 Token
glm5.3-flash ¥1.583498 ¥0.143
deepseek-v4-flash ¥1.84 ¥0.086
qwen3.8-flash API ¥10.24 ¥0.156

按平均成本计算,DeepSeek 最便宜,每百万总 Token 约 ¥0.086。

GLM 的总账单虽然比 DeepSeek 低,但它这次消耗的 Token 也更少。按照平均成本计算,GLM 仍然高于 DeepSeek。

Qwen API 的平均成本最高,主要原因不是缓存命中率低,而是这次总 Token 消耗太大,达到了约 6,584 万。

八、Qwen API 账单核对

按照 Qwen 给出的价格表计算:

text
UTF-8|11 Lines|
普通输入:
2,792 × ¥0.80/M = ¥0.0022
 
缓存创建:
3,162,220 × ¥1.25/M = ¥3.9528
 
缓存命中:
62,509,786 × ¥0.10/M = ¥6.2510
 
输出:
168,301 × ¥2.70/M = ¥0.4544

理论费用约为:

text
UTF-8|1 Lines|
¥10.6604

但面板显示的实际费用是:

text
UTF-8|1 Lines|
¥10.24

两者相差约 ¥0.42。

因此,本文采用以下口径:

  • ¥10.24:Qwen API 面板显示的实测费用
  • ¥10.66:按照价格表重新计算出的理论费用

可能的原因包括缓存创建实际价格不同、平台存在折扣,或者平台统计费用的方式不同。

九、订阅制模型成本

Qwen3.8-Flash Token Plan

本次使用了 7 日额度的 24.4%,折算为月额度约 6.1%。

套餐价格为 ¥39/月,因此本次额度分摊成本为:

text
UTF-8|1 Lines|
¥39 × 6.1% = ¥2.379

也就是约 ¥2.38。

这次 Qwen Token Plan 消耗了约 4,621 万 Token,用时 70 分钟。相比 Qwen API,少用了约 1,963 万 Token,也少用了 17 分钟。

GPT5.6-Luna-Max

本次使用量相当于月额度的 1%。

订阅价格为每月 20 美元,因此本次额度分摊成本为:

text
UTF-8|1 Lines|
$20 × 1% = $0.20

约合 ¥1.34。美元换算按约 1 美元兑 6.72 元人民币估算,参考汇率。

需要注意,¥1.34 只是把订阅费分摊到本次使用上。如果订阅费已经支付,本次调用并没有额外扣除 ¥1.34。

十、成本、Token 和用时综合评价

综合效率第一:GLM5.3-Flash

GLM 是这次最省 Token 的模型。

它比 DeepSeek 多用了 10 分钟,但 Token 消耗只有 DeepSeek 的约一半。因此在 Token 和用时各占一半的综合评分中,GLM 排名第一。

速度和 API 单位成本第一:DeepSeek-V4-Flash

DeepSeek 是这次最快的模型,也是 API 平均成本最低的模型。

在允许使用闲时价格的情况下,DeepSeek 同时拥有较快速度和较低成本。

Qwen Token Plan:比 Qwen API 更适合本次任务

Qwen Token Plan 比 Qwen API 少用了约 30% 的 Token,也少用了 17 分钟。

如果按 ¥39/月进行额度分摊,本次成本约为 ¥2.38,整体表现明显好于 Qwen API。

Qwen API:这次成本和效率都比较弱

Qwen API 的缓存命中率不错,但总 Token 消耗最多,运行时间也比较长。

这说明缓存命中率只是其中一个指标,不能单独用来判断模型是否省钱。

GPT5.6-Luna-Max:订阅成本低,但任务效率最低

GPT 的订阅分摊成本最低,但这次使用了较多 Token,并且耗时最长。

如果已经购买了订阅,GPT 的额外调用成本很低;但如果只看这次任务的 Token 和用时,它的效率排名最低。

十一、最终排名

按 Token 和用时综合排名

  1. glm5.3-flash
  2. deepseek-v4-flash
  3. qwen3.8-flash Token Plan
  4. qwen3.8-flash API
  5. gpt5.6-luna-max

按 API 平均成本排名

  1. deepseek-v4-flash:约 ¥0.086/M
  2. glm5.3-flash:约 ¥0.143/M
  3. qwen3.8-flash API:约 ¥0.156/M

按完成速度排名

  1. deepseek-v4-flash:25分钟
  2. glm5.3-flash:35分钟
  3. qwen3.8-flash Token Plan:70分钟
  4. qwen3.8-flash API:87分钟
  5. gpt5.6-luna-max:107分钟

十二、最终结论

在五个模型都完成任务的前提下:

  • GLM 使用 Token 最少,综合效率排名第一。
  • DeepSeek 用时最短,API 平均成本最低。
  • Qwen Token Plan 比 Qwen API 消耗更少、用时更短。
  • Qwen API 缓存命中率不错,但整体 Token 消耗过大。
  • GPT 订阅分摊成本低,但本次 Token 消耗和用时都比较高。

如果主要使用 API,DeepSeek 是这次最值得选择的模型。

如果最在意单任务消耗量,GLM 表现最好。

如果已经购买订阅,GPT 和 Qwen Token Plan 的额外调用成本较低,但订阅分摊成本不能直接和 API 账单比较。

本次评测最客观的结论是:

在任务都完成的前提下,GLM 最省 Token,DeepSeek 最快且 API 单位成本最低;Qwen Token Plan 居中,Qwen API 和 GPT 在本次任务中的执行效率相对较低。

十三、评测限制

这次只有一个网站内容修改任务,样本量较小,不能代表模型长期表现。

另外:

  • GLM 使用了限时半价。
  • DeepSeek 使用了闲时价格。
  • Qwen API 使用原价。
  • Qwen Token Plan 和 GPT 使用订阅额度分摊。
  • 不同模型可能采用了不同的工具调用和上下文处理方式。
  • 本次没有单独记录最终代码质量、返工次数和测试结果。

因此,这份报告更准确地反映的是:

这些模型在一次真实网站内容修改任务中的 Token 消耗、完成速度和实际花费。

下一篇计划为小记升级一个收藏功能

还没有留言