#DeepSeek 正式发布V4.1 Flash模型,#新模型 采用全新的非对称Transformer架构,为552B参数的混合专家模型,输入、输出激活分别约8B和16B。通过大幅压缩KV Cache,新一代模型对HBM的需求降至上一代的四分之一、对SSD的需求降至八分之一,在Agent场景中可显著降低缓存成本。
#DeepSeek 正式发布V4.1 Flash模型,#新模型 采用全新的非对称Transformer架构,为552B参数的混合专家模型,输入、输出激活分别约8B和16B。通过大幅压缩KV Cache,新一代模型对HBM的需求降至上一代的四分之一、对SSD的需求降至八分之一,在Agent场景中可显著降低缓存成本。