Core capabilities
- 1M 上下文与最高 384K 输出
- 思考与非思考双模式
- JSON、工具调用及非思考模式 FIM
- 面向成本敏感任务的高并发执行
DeepSeek / current
DeepSeek V4 的高并发版本,同样支持思考开关与超长输出。
适合大批量结构化生成、工具调用和需要一定推理的成本敏感任务。 V4 Flash 采用 284B 总参数和 13B 激活参数,在保留 1M 上下文、384K 输出上限和双思考模式的同时提供更高并发。官方说明其推理接近 Pro,简单智能体任务可达到相近表现。
用于批量结构化生成和智能体子任务,困难样本回退到 Pro。为每个工具设置独立并发上限、JSON 校验和停止条件,避免模型吞吐压垮下游服务。
超长输出很少等于更好输出,应通过结构约束与分段验证控制错误累积。 Flash 的官方并发额度远高于 Pro,但下游工具和数据库可能先成为瓶颈;集成中也应移除旧模型别名。
Specifications and positioning checked against provider documentation.
Open official source↗