11月28日,深度求索(DeepSeek)宣布,新一代轻量级大模型DeepSeek-V4-Flash正式版API即日起面向全球开发者开启公测。作为V4系列的先锋版本,V4-Flash在继承旗舰级模型能力表现的同时,大幅优化了推理效率与成本结构,被视为公司在“高性能AI服务普惠化”道路上的一次重要落子。
据悉,V4-Flash采用深度求索自研的混合专家(MoE)架构,通过动态稀疏激活与注意力机制优化,使模型在推理时仅调用部分专家模块,显著降低单次请求的算力开销。官方技术白皮书显示,与上一代V3模型相比,V4-Flash的吞吐量提升约80%,首Token延迟降低50%以上,而在MMLU、HumanEval、C-Eval等多项主流评测中,其得分与V4标准版差距控制在2%以内,在实际业务场景中几乎感受不到质量差异。
在API功能设计上,V4-Flash完整支持32K上下文窗口,具备函数调用(Function Calling)、JSON结构化输出、多轮对话管理及工具调用等企业级能力,并延续了与OpenAI接口高度兼容的策略。开发者在现有应用中可以快速完成迁移,无需重写底层逻辑。同时,平台提供了“速度—质量”可调档位,用户能够根据业务需求灵活取舍响应延迟与生成效果,这一设计尤其适合对实时性敏感的交互式应用。
价格方面,公测期间V4-Flash的API定价较V3下浮30%,每百万输入Token收费1元,每百万输出Token收费4元。新注册开发者还可领取100万Token的免费体验额度。公测阶段的单账号QPS上限暂定为200,高并发需求的企业用户可提交申请临时扩容。深度求索商务负责人表示,此次低门槛定价旨在让更多中小团队有机会构建AI原生应用,加速大模型技术在细分行业的落地。
从应用场景来看,V4-Flash在智能客服、实时翻译、代码补全、内容审核等“低延迟、高并发”业务中表现尤为突出。一位参与前期内测的技术工程师反馈,此前使用云端大模型进行实时问答,延迟时常波动至1秒以上,而切换到V4-Flash后配合流式接口,用户几乎感知不到等待过程。社区评测亦显示,V4-Flash在中文理解和代码生成任务上优于同量级开源模型,且性价比高于国内外同类商业化API。
不过,由于仍处于公测阶段,部分开发者反映偶发出现请求超时与限流提示。深度求索官方回应称,问题主要源于短时流量激增,团队正在通过弹性调度与扩容机制进行优化,并承诺在正式商用前发布更加完备的SLA服务等级协议。此外,深度求索CEO通过社交媒体透露,V4-Flash的模型权重文件有望在公测结束后开源,允许开发者和研究者本地部署与微调。该消息进一步推高了社区的关注热度。
分析人士指出,V4-Flash的推出折射出国内大模型行业竞争逻辑的转变——从单纯比拼参数规模,转向更务实的工程效率、成本控制与用户体验。在“轻量化”与“高性能”之间取得平衡,或将成为下一阶段AI基础设施竞争的关键。目前,广大开发者可登录DeepSeek开放平台官网申请公测密钥并查阅技术文档,V4-Flash能否成为新一代AI应用的核心底座,值得持续观察。