**DeepSeek-V4预览...
发布者:麦子
**DeepSeek-V4预览版上线并开源,从技术普惠到超长上下文普惠**
事件:4月24日,深度求索正式上线并同步开源全新系列模型DeepSeek-V4的预览版本,DeepSeek-V4开创了一种全新的注意力机制,在Token维度进行压缩,结合DSA稀疏注意力,实现百万字超长上下文的同时,大幅降低了对计算和显存的需求。在1MToken上下文中,V4-Pro的单Token推理FLOPs仅为V3.2的27%,KV缓存仅为10%,V4-Flash分别为10%和7%。此外,模型在Agent能力、世界知识和推理性能上均实现国内与开源领域的领先。根据模型参数大小,可以分为DeepSeek-V4-Pro(总参数1.6T-激活49B)与DeepSeek-V4-Flash(总参数284B-激活13B)版本。 性能对比: 1.编程与Agent能力上,在TerminalBench2.0、EPro、BrowseComp等重要基准测试上,DeepSeek-V4-Pro与国内头部模型(Kimi-K2.6、GLM-5.1)能力接近。据评测反馈使用体验优于ClaudeSonnet4.5,交付质量接近ClaudeOpus4.6非思考模式,与ClaudeOpus4.6思考模式存在一定差距。在CodeArena上,开源模型前三分别为GLM-5.1、Kimi-K2.6和DeepSeek-V4-Pro。 2.推理能力上,在数学、STEM、竞赛型代码的测评中,DeepSeek-V4-Pro超越当前所有已公开评测的开源模型,比肩世界顶级闭源模型。世界知识同样大幅领先其他开源模型,仅稍逊于顶尖闭源模型Gemini-Pro-3.1。 3.上下文长度上,DeepSeek-V4最高支持百万上下文,相较于GLM-5.1/Kimi-K2.6的200K/256K有显著的提升。每百万Token价格方面,DeepSeek-V4-Pro/GLM-5.1/Kimi-K2.6输入价格分别为12/6-8/6.5元,输出价格分别为24/24-28/27元。 简评: DeepSeek-V4在衡量模型推理能力的基准测试中优异表现,意味着开源模型首次在推理密集型任务上具备与顶级闭源模型正面竞争的实力。模型上下文窗口拓展至1M,推动国产模型的上下文从"奢侈品"变为"可承受",在法律文档分析、金融研报处理、大型代码库理解等场景的产品化门槛大幅降低。此外,DeepSeek-V4的技术论文明确提到在华为昇腾NPU上验证了MegaMoE内核,这是国产AI芯片首次在万亿参数MoE模型的核心优化路径中被公开背书,如果V4的推理优化方案能在昇腾上跑通且效率接近海外芯片,将大幅提振国产替代信心。 产业趋势关注: 1)模型:阿里巴巴、腾讯、智谱、Minimax等 2)算力及云设施:金山云、联想集团、壁仞科技、天数智芯、中芯国际、华虹半导体等 风险提示:模型效果及迭代不及预期,模型商业化不及预期,竞争超预期等。 国盛海外:夏君/焦安东,对口销售