参数量是 552B ,看起来是重新预训练的模型,benchmark 看起来很棒。
“新一代模型大幅减少了 KV Cache 缓存的大小,与上一代模型相比,对 HBM 的需求减少到 1/4 ,对 SSD 的需求减少到 1/8 。在 Agent 使用场景中,缓存命中的费用往往占比较高,对 KV Cache 的压缩大幅降低了 Agent 类任务的使用成本。”
不知道用了什么黑科技,降价也是因为成本降了。
“我们将会全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署的范围。如果您有大规模部署的需求且具备相应的资源( 2k 卡 GPU 、有存储集群),欢迎与我们联系。”
帮忙做适配🤣
公众号原文: https://mp.weixin.qq.com/s/qg0NU3NNUbp1co2PdkAPAg
模型开源链接: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
论文链接: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
“新一代模型大幅减少了 KV Cache 缓存的大小,与上一代模型相比,对 HBM 的需求减少到 1/4 ,对 SSD 的需求减少到 1/8 。在 Agent 使用场景中,缓存命中的费用往往占比较高,对 KV Cache 的压缩大幅降低了 Agent 类任务的使用成本。”
不知道用了什么黑科技,降价也是因为成本降了。
“我们将会全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署的范围。如果您有大规模部署的需求且具备相应的资源( 2k 卡 GPU 、有存储集群),欢迎与我们联系。”
帮忙做适配🤣
公众号原文: https://mp.weixin.qq.com/s/qg0NU3NNUbp1co2PdkAPAg
模型开源链接: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
论文链接: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
