DeepSeek V4.1-Flash|区分输入/输出激活规模并缩小 KV Cache
552B MoE 采用因输入与输出而异的激活规模,并通过新 API 路由替换旧 Flash 型号。
本文核心看点
DeepSeek 于 9 月 10 日发布 V4.1-Flash,这是一款具备原生视觉理解的 552B 参数 MoE 模型。新型因果编码器—解码器架构在输入阶段激活 8B 参数、输出阶段激活 16B;官方称,相比上一代,其 KV Cache 只需四分之一 HBM 与八分之一 SSD。模型已通过 deepseek-flash API 提供,旧 Flash 别名临时路由到新模型;官方计划北京时间9月14日12:00起将 V4-Pro 请求暂时转入 V4.1-Flash,团队需把预定路由切换视为生产变更。
直接回答
DeepSeek 于 9 月 10 日发布 V4.1-Flash,这是一款具备原生视觉理解的 552B 参数 MoE 模型。新型因果编码器—解码器架构在输入阶段激活 8B 参数、输出阶段激活 16B;官方称,相比上一代,其 KV Cache 只需四分之一 HBM 与八分之一 SSD。模型已通过 deepseek-flash API 提供,旧 Flash 别名临时路由到新模型;官方计划北京时间9月14日12:00起将 V4-Pro 请求暂时转入 V4.1-Flash,团队需把预定路由切换视为生产变更。
事实来源
DeepSeek 将 V4.1-Flash 描述为 552B 参数 MoE;因果编码器—解码器架构在输入时激活 8B 参数,在输出时激活 16B。
官方称,相比上一代,V4.1-Flash 的 KV Cache 需要四分之一 HBM 与八分之一 SSD,并把这与代理任务的缓存命中成本联系起来。
模型以 deepseek-flash 名称上线 API 并支持原生多模态;旧 Flash 别名临时指向它,官方计划北京时间 9 月 14 日 12:00 起让 V4-Pro 流量临时改道。
核心变化
- 输入理解与输出生成采用不同的参数激活规模
- KV Cache 的 HBM 与 SSD 占用被官方大幅下调
- API 主模型名统一为 deepseek-flash
- 旧 Flash 别名提供临时兼容路由;V4-Pro 调用计划于北京时间 9 月 14 日 12:00 起临时改道
对普通 AI 用户的影响
非对称激活让团队必须分别观察首 token 前的输入处理和持续解码,而不能只用一个吞吐数字代表整条链路。缓存占用下降可能改善长上下文与代理循环的成本,但比例来自官方与特定上一代对比。更直接的上线风险是别名改道:即使应用没有改模型名,输出质量、视觉输入、延迟和账单也可能变化,因此需要固定评测集与明确回滚目标。
给团队的操作清单
- 盘点所有 deepseek-flash、旧 V4 Flash 与 deepseek-v4-pro 调用,记录实际解析到的模型和费率。
- 用真实任务分别测量输入阶段、首 token 延迟、解码速度、KV Cache 占用和端到端成本。
- 对文本、图像、长上下文和工具调用建立回归集,并把厂商基准与自有结果分开记录。
- 在路由切换窗口设置质量、延迟与费用阈值,保留显式模型配置和可执行回滚步骤。
AI 前沿资讯与趋势解读、AI 软件应用与模型工具、AI 技能教程与验证方法、AI 账号服务与权限说明
FAQ
552B 是否表示每个 token 都会使用全部参数?
不是。官方称这是 MoE 总参数规模,输入阶段激活 8B,输出阶段激活 16B。
旧的 V4 Flash API 名称会立即失效吗?
不会立即失效。DeepSeek 表示旧别名会临时路由到 V4.1-Flash,但没有在该公告中给出终止日期。
官方是否证明所有工作负载都会更便宜、更快?
没有。页面给出架构、缓存与厂商测试表述,具体质量、速度和总成本仍需用自身任务验证。
总结
V4.1-Flash 的工程看点是把输入、输出与缓存成本拆开优化;对 API 使用方,最紧迫的工作则是识别别名改道,并用自己的评测和费用护栏验证变化。
本文由 AI 辅助撰写;发布前由 ENHE AI 自动化审计核对官方来源、双语字段、图片权利、页面安全与历史去重。
这对普通用户意味着什么?
非对称激活让团队必须分别观察首 token 前的输入处理和持续解码,而不能只用一个吞吐数字代表整条链路。缓存占用下降可能改善长上下文与代理循环的成本,但比例来自官方与特定上一代对比。更直接的上线风险是别名改道:即使应用没有改模型名,输出质量、视觉输入、延迟和账单也可能变化,因此需要固定评测集与明确回滚目标。
你可能会用到这些工具
相关教程
相关工具/教程
你可以从下面的 ENHE AI 栏目继续把资讯信号转成工具选择、账号服务判断或实操学习路径。
相关阅读
Cohere North Small Translate|50+ 语言的开放权重专用翻译模型
Cohere 于 9 月 10 日发布 North Small Translate,一款面向 50 多种语言的开放权重 MoE 翻译模型。模型总参数 218B、激活参数 25B,输入和输出上下文均为 16K;最低部署配置标为单张 B200 或两张 H100 的 W4A4 量化。Cohere 报告其 WMT26 全语言得分为 83.60,Agentic 版本为 84.36,并称相同硬件与并发下吞吐最高为 Gemma 4 31B 的 1.4 倍。模型卡还要求遵守可接受使用附录与 Cohere Labs AUP;商业生产需单独取得 commercial license。
OpenAI为前沿模型保留零数据留存:Private Safety Processing进入预览
OpenAI于2026年8月19日宣布,为符合资格的API客户继续提供零数据留存,并预览Private Safety Processing。该方案尝试在不让OpenAI人员读取底层提示词与回复的前提下,跨相关交互识别风险模式。客户内容可留在客户控制的基础设施中,未来也计划支持由客户密钥加密的OpenAI托管存储。普通API团队应先确认自身项目是否获批ZDR、哪些数据仍受法定义务或审计日志规则影响,再决定敏感工作流是否上线。
OpenAI预览GPT-5.6 Sol Ultrafast:最高14倍速度,但仍是限量API预览
OpenAI于2026年8月13日预览GPT-5.6 Sol Ultrafast,称其在Cerebras硬件上最高可达标准版本14倍、输出速度最高约每秒750个token,并首先通过API向部分客户开放。它不是ChatGPT全面上线,也未公布统一价格或普遍可用日期。开发者应先确认邀请资格与地域,再用同一长上下文、结构化输出或代理任务比较首字延迟、总耗时、质量、费用、限流和失败重试,避免只凭峰值速度更换生产模型。
GitHub用量API新增Claude与Codex智能体活动:团队可按Agent核对消耗
GitHub在2026年8月7日宣布Copilot Usage Metrics API新增第三方Agent应用活动,可在企业、组织及用户的1日和28日报告中按Agent拆分。新字段包含稳定的agent_id与可变的显示名称,便于把Claude、Codex等工作流接入统一审计。管理员应先核对报告口径、分页和标识稳定性,再把数据用于预算与权限决策,避免再次误判。
Mistral × Cloudera|计划把模型、数据与学习闭环留在企业边界内
Mistral 与 Cloudera 于 9 月 10 日宣布主权企业 AI 合作。双方计划把 Mistral 模型整合进 Cloudera 混合数据平台,覆盖公有云、私有云、本地及完全隔离环境,并允许企业在受控环境中用专有数据训练定制模型。Mistral 称合作将面向 Cloudera 平台上由客户管理的 30 EB 数据,目标是让数据、模型权重、训练、推理、治理、观测和持续改进保留在客户定义的边界。公告没有披露具体型号、交付时间、价格或实测结果,企业仍需把主权主张转成可验证控制项。
AWS AgentCore MCP Apps|让同一套工具与交互组件进入多个兼容 AI 主机
AWS 于 9 月 11 日发布 AgentCore 上构建 MCP Apps 的技术示例。方案由 WAF、AgentCore Gateway、Runtime、Lambda 与 DynamoDB 组成:AI 主机先发现工具和资源,再调用业务工具,按资源 URI 读取自包含 HTML,并在沙箱 iframe 中注入结构化结果。AWS 强调 MCP Apps 是主机无关标准,同一服务器可服务支持该扩展的不同 AI 主机;上线时仍需严格校验参数、限制调用者并监控延迟与错误。


