一次网站内容改动:5 个Flash模型实测评测报告
一、测试说明
本次使用同一个网站内容修改任务,通过 Claude Code CLI 分别调用:
- glm5.3-flash
- deepseek-v4-flash
- qwen3.8-flash API
- qwen3.8-flash Token Plan
- gpt5.6-luna-max
本报告按五个模型都完成任务进行评测。
评测重点有三项:
- 单任务消耗的 Token 数
- 完成任务所用的时间
- 完成任务产生的实际成本
在任务完成结果相同的情况下,使用 Token 越少、用时越短,说明执行效率越高。
二、模型价格和使用状态
| 模型 | 输入价格 | 输出价格 | 缓存命中 | 其它费用 | 价格状态 |
|---|---|---|---|---|---|
| Qwen3.8-Flash API | ¥0.80/M | ¥2.70/M | ¥0.10/M | 缓存创建 ¥1.25/M | 原价 |
| GLM5.3-Flash | ¥0.40/M | ¥1.40/M | ¥0.115/M | 无单独缓存创建价格 | 限时半价 |
| DeepSeek-V4-Flash | ¥1.50/M | ¥4.50/M | ¥0.05/M | 无单独缓存创建价格 | 21:00~22:00闲时价 |
其它说明:
- Qwen API 使用普通原价,没有使用 Batch Chat 5 折价格。
- GLM 本次使用的是测试期间的限时半价。
- DeepSeek 本次使用的是 21:00~22:00 闲时价格。
- Qwen Token Plan 按 ¥39/月计算。
- GPT5.6-Luna-Max 按每月 20 美元的订阅额度计算。
因此,本文对比的是这次实际使用时产生的成本,并不是三家模型标准原价的横向对比。
三、实测数据汇总
| 模型 | 计费方式 | 实测总 Token | 实测缓存命中 | 缓存命中率 | 请求数 | 实测用时 | 实测成本 |
|---|---|---|---|---|---|---|---|
| glm5.3-flash | API,限时半价 | 11,103,347 | 10,155,136 | 91.76% | 121 | 35分钟 | ¥1.583498 |
| deepseek-v4-flash | API,闲时价 | 21,319,868 | 20,967,296 | 98.76% | 190 | 25分钟 | ¥1.84 |
| qwen3.8-flash API | API,原价 | 65,843,099 | 62,509,786 | 95.18% | 299 | 87分钟 | ¥10.24 |
| qwen3.8-flash Token Plan | 订阅额度分摊 | 46,208,164 | 45,130,075 | 98.01% | 未知 | 70分钟 | ¥2.379 |
| gpt5.6-luna-max | 订阅额度分摊 | 54,568,584 | 52,273,920 | 96.28% | 未知 | 107分钟 | $0.20,约 ¥1.34 |
缓存命中率统一按照“缓存命中输入 ÷ 总输入”计算,输出 Token 不放进分母。
四、缓存命中数据
GLM5.3-Flash
缓存命中率 =
10,155,136 ÷ (10,155,136 + 911,838)
= 91.76%DeepSeek-V4-Flash
缓存命中率 =
20,967,296 ÷ (20,967,296 + 263,641)
= 98.76%原始记录中的 98.35%,是用缓存命中 Token 除以全部 Token 得出的结果,把输出 Token 也算进去了。只看输入的话,98.76% 更准确。
Qwen3.8-Flash API
Qwen API 的输入由三部分组成:
- 普通输入:2,792 Token
- 显式缓存创建:3,162,220 Token
- 显式缓存命中:62,509,786 Token
总输入 =
2,792 + 3,162,220 + 62,509,786
= 65,674,798 Token缓存命中率 =
62,509,786 ÷ 65,674,798
= 95.18%缓存创建不等于缓存命中。缓存创建是第一次把内容放入缓存,不能算作已经命中。
Qwen3.8-Flash Token Plan
缓存命中率 =
45,130,075 ÷ (45,130,075 + 916,119)
= 98.01%GPT5.6-Luna-Max
缓存命中率 =
52,273,920 ÷ 54,293,851
= 96.28%GPT 的推理输出 98,817 Token 已经包含在 274,733 个输出 Token 中,不重复计算。
五、Token 和用时综合评分
为了不只看一个指标,采用以下评分方式:
Token 得分 = 全部模型中最少 Token ÷ 当前模型 Token × 100
用时得分 = 全部模型中最短用时 ÷ 当前模型用时 × 100
综合效率分 = Token 得分和用时得分的平均值Token 消耗和完成时间各占一半。
| 模型 | Token 得分 | 用时得分 | 综合效率分 | 综合排名 |
|---|---|---|---|---|
| glm5.3-flash | 100.00 | 71.43 | 85.71 | 1 |
| deepseek-v4-flash | 52.08 | 100.00 | 76.04 | 2 |
| qwen3.8-flash Token Plan | 24.03 | 35.71 | 29.87 | 3 |
| qwen3.8-flash API | 16.86 | 28.74 | 22.80 | 4 |
| gpt5.6-luna-max | 20.35 | 23.36 | 21.86 | 5 |
这个评分只评价这次任务的执行效率,不代表模型整体能力排名。
六、Token 和用时分析
1. GLM 使用 Token 最少
GLM 这次一共使用了 11,103,347 个 Token,是五个模型中消耗最少的。
它用了 35 分钟完成任务,比 DeepSeek 多花了 10 分钟,但 Token 消耗只有 DeepSeek 的约一半。
按照 Token 和用时各占一半的评分方式,GLM 综合效率排名第一。
2. DeepSeek 完成速度最快
DeepSeek 这次只用了 25 分钟,是五个模型中完成任务最快的。
它消耗了 21,319,868 个 Token,接近 GLM 的两倍。不过从实际使用感受来看,它用更多 Token 换来了更快的完成速度。
本次测试使用的是 21:00~22:00 闲时价格,因此速度表现不能完全代表高峰期情况。
3. Qwen Token Plan 优于 Qwen API
Qwen Token Plan 使用了 46,208,164 个 Token,用时 70 分钟。
相比 Qwen API:
- 少用了约 1,963 万 Token
- 少用了 17 分钟
- 缓存命中率更高
这说明同一个模型在不同调用方式下,实际执行过程可能有明显差异。
4. Qwen API 消耗最多
Qwen API 使用了 65,843,099 个 Token,是五个模型中消耗最多的。
它的缓存命中率达到 95.18%,但仍然用了 87 分钟才完成任务。
这说明缓存命中率高,并不代表整体执行效率一定高。上下文越长,即使大部分内容命中了缓存,整体 Token 数和缓存创建数量仍然可能很大。
5. GPT 用时最长
GPT5.6-Luna-Max 使用了 54,568,584 个 Token,用时 107 分钟,是五个模型中最慢的。
虽然它的订阅分摊成本很低,但从单任务 Token 消耗和完成时间来看,本次没有体现出效率优势。
七、API 成本分析
只比较实际 API 账单:
| 模型 | 实测费用 | 平均每百万总 Token |
|---|---|---|
| glm5.3-flash | ¥1.583498 | ¥0.143 |
| deepseek-v4-flash | ¥1.84 | ¥0.086 |
| qwen3.8-flash API | ¥10.24 | ¥0.156 |
按平均成本计算,DeepSeek 最便宜,每百万总 Token 约 ¥0.086。
GLM 的总账单虽然比 DeepSeek 低,但它这次消耗的 Token 也更少。按照平均成本计算,GLM 仍然高于 DeepSeek。
Qwen API 的平均成本最高,主要原因不是缓存命中率低,而是这次总 Token 消耗太大,达到了约 6,584 万。
八、Qwen API 账单核对
按照 Qwen 给出的价格表计算:
普通输入:
2,792 × ¥0.80/M = ¥0.0022
缓存创建:
3,162,220 × ¥1.25/M = ¥3.9528
缓存命中:
62,509,786 × ¥0.10/M = ¥6.2510
输出:
168,301 × ¥2.70/M = ¥0.4544理论费用约为:
¥10.6604但面板显示的实际费用是:
¥10.24两者相差约 ¥0.42。
因此,本文采用以下口径:
- ¥10.24:Qwen API 面板显示的实测费用
- ¥10.66:按照价格表重新计算出的理论费用
可能的原因包括缓存创建实际价格不同、平台存在折扣,或者平台统计费用的方式不同。
九、订阅制模型成本
Qwen3.8-Flash Token Plan
本次使用了 7 日额度的 24.4%,折算为月额度约 6.1%。
套餐价格为 ¥39/月,因此本次额度分摊成本为:
¥39 × 6.1% = ¥2.379也就是约 ¥2.38。
这次 Qwen Token Plan 消耗了约 4,621 万 Token,用时 70 分钟。相比 Qwen API,少用了约 1,963 万 Token,也少用了 17 分钟。
GPT5.6-Luna-Max
本次使用量相当于月额度的 1%。
订阅价格为每月 20 美元,因此本次额度分摊成本为:
$20 × 1% = $0.20约合 ¥1.34。美元换算按约 1 美元兑 6.72 元人民币估算,参考汇率。
需要注意,¥1.34 只是把订阅费分摊到本次使用上。如果订阅费已经支付,本次调用并没有额外扣除 ¥1.34。
十、成本、Token 和用时综合评价
综合效率第一:GLM5.3-Flash
GLM 是这次最省 Token 的模型。
它比 DeepSeek 多用了 10 分钟,但 Token 消耗只有 DeepSeek 的约一半。因此在 Token 和用时各占一半的综合评分中,GLM 排名第一。
速度和 API 单位成本第一:DeepSeek-V4-Flash
DeepSeek 是这次最快的模型,也是 API 平均成本最低的模型。
在允许使用闲时价格的情况下,DeepSeek 同时拥有较快速度和较低成本。
Qwen Token Plan:比 Qwen API 更适合本次任务
Qwen Token Plan 比 Qwen API 少用了约 30% 的 Token,也少用了 17 分钟。
如果按 ¥39/月进行额度分摊,本次成本约为 ¥2.38,整体表现明显好于 Qwen API。
Qwen API:这次成本和效率都比较弱
Qwen API 的缓存命中率不错,但总 Token 消耗最多,运行时间也比较长。
这说明缓存命中率只是其中一个指标,不能单独用来判断模型是否省钱。
GPT5.6-Luna-Max:订阅成本低,但任务效率最低
GPT 的订阅分摊成本最低,但这次使用了较多 Token,并且耗时最长。
如果已经购买了订阅,GPT 的额外调用成本很低;但如果只看这次任务的 Token 和用时,它的效率排名最低。
十一、最终排名
按 Token 和用时综合排名
- glm5.3-flash
- deepseek-v4-flash
- qwen3.8-flash Token Plan
- qwen3.8-flash API
- gpt5.6-luna-max
按 API 平均成本排名
- deepseek-v4-flash:约 ¥0.086/M
- glm5.3-flash:约 ¥0.143/M
- qwen3.8-flash API:约 ¥0.156/M
按完成速度排名
- deepseek-v4-flash:25分钟
- glm5.3-flash:35分钟
- qwen3.8-flash Token Plan:70分钟
- qwen3.8-flash API:87分钟
- gpt5.6-luna-max:107分钟
十二、最终结论
在五个模型都完成任务的前提下:
- GLM 使用 Token 最少,综合效率排名第一。
- DeepSeek 用时最短,API 平均成本最低。
- Qwen Token Plan 比 Qwen API 消耗更少、用时更短。
- Qwen API 缓存命中率不错,但整体 Token 消耗过大。
- GPT 订阅分摊成本低,但本次 Token 消耗和用时都比较高。
如果主要使用 API,DeepSeek 是这次最值得选择的模型。
如果最在意单任务消耗量,GLM 表现最好。
如果已经购买订阅,GPT 和 Qwen Token Plan 的额外调用成本较低,但订阅分摊成本不能直接和 API 账单比较。
本次评测最客观的结论是:
在任务都完成的前提下,GLM 最省 Token,DeepSeek 最快且 API 单位成本最低;Qwen Token Plan 居中,Qwen API 和 GPT 在本次任务中的执行效率相对较低。
十三、评测限制
这次只有一个网站内容修改任务,样本量较小,不能代表模型长期表现。
另外:
- GLM 使用了限时半价。
- DeepSeek 使用了闲时价格。
- Qwen API 使用原价。
- Qwen Token Plan 和 GPT 使用订阅额度分摊。
- 不同模型可能采用了不同的工具调用和上下文处理方式。
- 本次没有单独记录最终代码质量、返工次数和测试结果。
因此,这份报告更准确地反映的是:
这些模型在一次真实网站内容修改任务中的 Token 消耗、完成速度和实际花费。
还没有留言