小模型逆袭:DeepSeek-V4-Flash超越自家旗舰,便宜又好用

DeepSeek最近更新了其V4系列中的小参数模型。新版DeepSeek-V4-Flash-0731在第三方独立测试中,得分超过了自家体型更大的DeepSeek-V4-Pro,而运行成本只有那些智力水平相当的主流商业模型的一小部分。这个版本是今年4月预览版的正式升级,官方将其定位为V4家族中轻量但高性能的选择。

在Artificial Analysis的智能指数评测上,该模型开启最高推理模式后拿到50分,仅比OpenAI的GPT-5.6 Luna低1分。但完成同样一个基准任务,通过DeepSeek API调用Flash的成本约为0.03美元,而GPT-5.6 Luna最高推理模式则需0.05美元。即便与同属开源阵营的领先者Kimi K3相比,Flash也排在前列,后者在该指数上拿到57分。

更值得关注的是Agent任务上的跃升。在Terminal-Bench 2.1这类命令行环境测试中,新版Flash解决了82.7%的问题,比预览版高出约21个百分点。在模拟银行场景的多轮工具调用测试τ³-Bench Banking中,它的成功率也从前一版的约23%提高到31.1%。在开发者偏好的CodeArena WebDev前端编码对比评测里,该模型高推理模式以1577分位列所有模型第七,开源模型第三。


点击查看大图

这些提升并非来自架构改动。DeepSeek表示,他们只是对原有模型进行了一轮新的微调,总参数284B、每个token激活13B的混合专家结构都没有变。但公司没有披露这次微调与4月预览版的具体差异,也未说明训练数据或知识截止时间。

了解其训练方式有助于理解表现。DeepSeek先对模型进行了超过32万亿token的预训练,随后分两步微调。第一步,针对数学、编程、Agent任务等不同领域分别训练专门的专家模型,每个专家都经过监督微调和基于组相对策略优化的强化学习。第二步,将超过10个专家模型合并,通过同策略蒸馏让合并后的模型模仿各专家在相同提示下的输出,从而统一能力。

不同推理级别(低、高、最高)作为不同行为来训练。在强化学习阶段,系统对每种级别施加不同的长度惩罚和上下文窗口限制。最高级别会在系统提示中加入额外指令,强制模型完整拆解问题并检验边缘情况。在处理工具调用类任务时,Flash会保留整个推理历史并在各轮对话中持续引用,不像前代V3.2那样丢弃历史。

新版本还捆绑了推测解码模块DeepSeek-V4-Flash-DSpark。这个小型草稿模块先提前生成若干候选token,主模型再批量验证,而不是逐token生成,从而加快了输出速度。官方API支持最高100万token输入和38.4万token输出,输出速度约122.7 token/s。收费方面,输入每百万token 0.14美元,缓存输入0.0028美元,输出0.28美元,且权重在MIT许可下免费开放给商业和非商业用途。

这次发布恰逢同行密集调整定价。发布前一天,OpenAI将GPT-5.6 Luna的价格下调80%,GPT-5.6 Terra下调20%,理由是推理效率提升。此前一周,Google推出了Gemini 3.6 Flash和3.5 Flash-Lite,主打速度和成本,其中3.6 Flash在智能指数上维持50分,但每任务成本从0.59美元降至0.50美元。开源阵营同样在发力,Thinking Machines同期发布的Inkling Small仅用不到旗舰三分之一的参数量,智能指数就达到40分,仅差1分。

对开发者而言,Agent类应用会消耗大量token,因此生成成本直接影响哪些工作可以大规模自动化。DeepSeek-V4-Flash在接近顶级商业模型智能水平的同时,每任务成本不到它们的一半,这让Bug分类、账单核对、客服响应这类需要持续运行的任务从“昂贵”变成“可负担”。而且模型足够小,量化到3-bit后可在110GB内存的机器上本地运行,无需调用API。越来越多团队开始意识到,并不是每个场景都需要最大最全的模型。这一波Flash、Luna、Sonnet等产品表明,高智能、快速度、合理定价的小尺寸模型正成为竞争最激烈的赛道之一。

(素材来自:DeepSeek 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。