AI快讯用量APIDeepSeek V4.1-FlashMoEKV Cache

DeepSeek V4.1-Flash|区分输入/输出激活规模并缩小 KV Cache

552B MoE 采用因输入与输出而异的激活规模,并通过新 API 路由替换旧 Flash 型号。

ENHE AI5 min0 views
DeepSeek V4.1-Flash|区分输入/输出激活规模并缩小 KV Cache

本文核心看点

DeepSeek 于 9 月 10 日发布 V4.1-Flash,这是一款具备原生视觉理解的 552B 参数 MoE 模型。新型因果编码器—解码器架构在输入阶段激活 8B 参数、输出阶段激活 16B;官方称,相比上一代,其 KV Cache 只需四分之一 HBM 与八分之一 SSD。模型已通过 deepseek-flash API 提供,旧 Flash 别名临时路由到新模型;官方计划北京时间9月14日12:00起将 V4-Pro 请求暂时转入 V4.1-Flash,团队需把预定路由切换视为生产变更。

DeepSeek 将 V4.1-Flash 描述为 552B 参数 MoE;因果编码器—解码器架构在输入时激活 8B 参数,在输出时激活 16B。
官方称,相比上一代,V4.1-Flash 的 KV Cache 需要四分之一 HBM 与八分之一 SSD,并把这与代理任务的缓存命中成本联系起来。
模型以 deepseek-flash 名称上线 API 并支持原生多模态;旧 Flash 别名临时指向它,官方计划北京时间 9 月 14 日 12:00 起让 V4-Pro 流量临时改道。

直接回答

DeepSeek 于 9 月 10 日发布 V4.1-Flash,这是一款具备原生视觉理解的 552B 参数 MoE 模型。新型因果编码器—解码器架构在输入阶段激活 8B 参数、输出阶段激活 16B;官方称,相比上一代,其 KV Cache 只需四分之一 HBM 与八分之一 SSD。模型已通过 deepseek-flash API 提供,旧 Flash 别名临时路由到新模型;官方计划北京时间9月14日12:00起将 V4-Pro 请求暂时转入 V4.1-Flash,团队需把预定路由切换视为生产变更。

事实来源

DeepSeek 将 V4.1-Flash 描述为 552B 参数 MoE;因果编码器—解码器架构在输入时激活 8B 参数,在输出时激活 16B。

官方称,相比上一代,V4.1-Flash 的 KV Cache 需要四分之一 HBM 与八分之一 SSD,并把这与代理任务的缓存命中成本联系起来。

模型以 deepseek-flash 名称上线 API 并支持原生多模态;旧 Flash 别名临时指向它,官方计划北京时间 9 月 14 日 12:00 起让 V4-Pro 流量临时改道。

DeepSeek V4.1-Flash|区分输入/输出激活规模并缩小 KV Cache 封面信息图
ENHE AI 原创合成图:主题匹配的真实工作场景背景与事实核验文案。

核心变化

  • 输入理解与输出生成采用不同的参数激活规模
  • KV Cache 的 HBM 与 SSD 占用被官方大幅下调
  • API 主模型名统一为 deepseek-flash
  • 旧 Flash 别名提供临时兼容路由;V4-Pro 调用计划于北京时间 9 月 14 日 12:00 起临时改道
DeepSeek V4.1-Flash|区分输入/输出激活规模并缩小 KV Cache 团队操作流程图
把公告转成可测试、可回滚、可审计的四步流程。

对普通 AI 用户的影响

非对称激活让团队必须分别观察首 token 前的输入处理和持续解码,而不能只用一个吞吐数字代表整条链路。缓存占用下降可能改善长上下文与代理循环的成本,但比例来自官方与特定上一代对比。更直接的上线风险是别名改道:即使应用没有改模型名,输出质量、视觉输入、延迟和账单也可能变化,因此需要固定评测集与明确回滚目标。

给团队的操作清单

  1. 盘点所有 deepseek-flash、旧 V4 Flash 与 deepseek-v4-pro 调用,记录实际解析到的模型和费率。
  2. 用真实任务分别测量输入阶段、首 token 延迟、解码速度、KV Cache 占用和端到端成本。
  3. 对文本、图像、长上下文和工具调用建立回归集,并把厂商基准与自有结果分开记录。
  4. 在路由切换窗口设置质量、延迟与费用阈值,保留显式模型配置和可执行回滚步骤。

AI 前沿资讯与趋势解读AI 软件应用与模型工具AI 技能教程与验证方法AI 账号服务与权限说明

FAQ

552B 是否表示每个 token 都会使用全部参数?

不是。官方称这是 MoE 总参数规模,输入阶段激活 8B,输出阶段激活 16B。

旧的 V4 Flash API 名称会立即失效吗?

不会立即失效。DeepSeek 表示旧别名会临时路由到 V4.1-Flash,但没有在该公告中给出终止日期。

官方是否证明所有工作负载都会更便宜、更快?

没有。页面给出架构、缓存与厂商测试表述,具体质量、速度和总成本仍需用自身任务验证。

总结

V4.1-Flash 的工程看点是把输入、输出与缓存成本拆开优化;对 API 使用方,最紧迫的工作则是识别别名改道,并用自己的评测和费用护栏验证变化。

本文由 AI 辅助撰写;发布前由 ENHE AI 自动化审计核对官方来源、双语字段、图片权利、页面安全与历史去重。

这对普通用户意味着什么?

非对称激活让团队必须分别观察首 token 前的输入处理和持续解码,而不能只用一个吞吐数字代表整条链路。缓存占用下降可能改善长上下文与代理循环的成本,但比例来自官方与特定上一代对比。更直接的上线风险是别名改道:即使应用没有改模型名,输出质量、视觉输入、延迟和账单也可能变化,因此需要固定评测集与明确回滚目标。

你可能会用到这些工具

相关教程

相关工具/教程

你可以从下面的 ENHE AI 栏目继续把资讯信号转成工具选择、账号服务判断或实操学习路径。

相关阅读

Cohere North Small Translate|50+ 语言的开放权重专用翻译模型

Cohere 于 9 月 10 日发布 North Small Translate,一款面向 50 多种语言的开放权重 MoE 翻译模型。模型总参数 218B、激活参数 25B,输入和输出上下文均为 16K;最低部署配置标为单张 B200 或两张 H100 的 W4A4 量化。Cohere 报告其 WMT26 全语言得分为 83.60,Agentic 版本为 84.36,并称相同硬件与并发下吞吐最高为 Gemma 4 31B 的 1.4 倍。模型卡还要求遵守可接受使用附录与 Cohere Labs AUP;商业生产需单独取得 commercial license。

OpenAI为前沿模型保留零数据留存:Private Safety Processing进入预览

OpenAI于2026年8月19日宣布,为符合资格的API客户继续提供零数据留存,并预览Private Safety Processing。该方案尝试在不让OpenAI人员读取底层提示词与回复的前提下,跨相关交互识别风险模式。客户内容可留在客户控制的基础设施中,未来也计划支持由客户密钥加密的OpenAI托管存储。普通API团队应先确认自身项目是否获批ZDR、哪些数据仍受法定义务或审计日志规则影响,再决定敏感工作流是否上线。

OpenAI预览GPT-5.6 Sol Ultrafast:最高14倍速度,但仍是限量API预览

OpenAI于2026年8月13日预览GPT-5.6 Sol Ultrafast,称其在Cerebras硬件上最高可达标准版本14倍、输出速度最高约每秒750个token,并首先通过API向部分客户开放。它不是ChatGPT全面上线,也未公布统一价格或普遍可用日期。开发者应先确认邀请资格与地域,再用同一长上下文、结构化输出或代理任务比较首字延迟、总耗时、质量、费用、限流和失败重试,避免只凭峰值速度更换生产模型。

GitHub用量API新增Claude与Codex智能体活动:团队可按Agent核对消耗

GitHub在2026年8月7日宣布Copilot Usage Metrics API新增第三方Agent应用活动,可在企业、组织及用户的1日和28日报告中按Agent拆分。新字段包含稳定的agent_id与可变的显示名称,便于把Claude、Codex等工作流接入统一审计。管理员应先核对报告口径、分页和标识稳定性,再把数据用于预算与权限决策,避免再次误判。

Mistral × Cloudera|计划把模型、数据与学习闭环留在企业边界内

Mistral 与 Cloudera 于 9 月 10 日宣布主权企业 AI 合作。双方计划把 Mistral 模型整合进 Cloudera 混合数据平台,覆盖公有云、私有云、本地及完全隔离环境,并允许企业在受控环境中用专有数据训练定制模型。Mistral 称合作将面向 Cloudera 平台上由客户管理的 30 EB 数据,目标是让数据、模型权重、训练、推理、治理、观测和持续改进保留在客户定义的边界。公告没有披露具体型号、交付时间、价格或实测结果,企业仍需把主权主张转成可验证控制项。

AWS AgentCore MCP Apps|让同一套工具与交互组件进入多个兼容 AI 主机

AWS 于 9 月 11 日发布 AgentCore 上构建 MCP Apps 的技术示例。方案由 WAF、AgentCore Gateway、Runtime、Lambda 与 DynamoDB 组成:AI 主机先发现工具和资源,再调用业务工具,按资源 URI 读取自包含 HTML,并在沙箱 iframe 中注入结构化结果。AWS 强调 MCP Apps 是主机无关标准,同一服务器可服务支持该扩展的不同 AI 主机;上线时仍需严格校验参数、限制调用者并监控延迟与错误。

参考来源

文章目录

最新资讯