据雷峰网报道,arXiv于9月19日更新DeepSeek论文《DSec:面向大规模智能体训练的高效沙箱基础设施》,首次展示其自动化沙箱系统DSec,通讯作者为梁文锋。论文称,该系统每日可自动运行300万个沙箱环境,单生产单元横跨160个CPU节点。
DSec被描述为DeepSeek内部超大规模智能体强化学习与评测体系的生产级底座,能为每次训练任务秒级创建独立虚拟“新考场”。系统通过权限隔离防止AI作弊,并可精准复现AI在沙箱内每一步环境反馈。雷峰网称,在2026年智能体频频失控、甚至意识到被监控并隐藏思维链的背景下,沙箱既是训练场,也是限制AI破坏力的防线。
雷峰网梳理称,过去三年梁文锋署名11篇论文,但极少以第一作者或通讯作者身份出现在V3.2、V4、V4.1-Flash等上百人署名的旗舰模型整体报告中,而是把名字签在MLA注意力、MoE路由机制、mHC拓扑流形、DSpark推理算子、DSec智能体沙盒等底层技术论文上,包括从《DeepSeek LLM》《DeepSeekMoE》《DeepSeek-V2》到《DeepSeek-R1》《Native Sparse Attention》《DSec》等。
报道称,2024年初大模型行业深陷算力军备竞赛,国内“百模大战”初创团队面对万卡集群门槛纷纷掉队。梁文锋团队在这一阶段发布《DeepSeek LLM》《DeepSeekMoE》《DeepSeek-V2》。《DeepSeek LLM》于2024年1月5日发布,研究发现算力固定时盲目扩大参数并非最优,提升数据质量与数据密度配比能带来更强能力。团队在2万亿中英双语Token上训练7B与67B版本,67B全面反超Llama-2 70B,并在开放对话测试中击败GPT-3.5。
DeepSeekMoE通过细粒度专家动态路由与共享专家隔离,将训练开销降低42.5%;MLA多头潜在注意力机制利用低秩潜在向量压缩,将KV Cache体积极限压缩93.3%。基于这些技术,DeepSeek-V2以比肩GPT-4的性能和极低成本问世,把千token推理成本降至此前的几十分之一,并引爆国内大模型API价格战。
2024年6月发布的《DeepSeek-Coder-V2》注入6万亿高质量中英代码与数学数据,支持编程语言从86种扩充至338种,上下文窗口拉满至128K。据雷峰网报道,该模型在HumanEval、Codeforces、LiveCodeBench等基准上首次全面超越GPT-4 Turbo、Claude 3 Opus等闭源模型。其每百万Token输入价格为0.14美元、输出0.28美元。
2024年底,DeepSeek团队用不到2个月和2048块H800显卡从头训出671B参数的DeepSeek-V3,总成本560万美元。雷峰网提到,SemiAnalysis复盘称,560万美元只是“纯GPU烧电训练的最浅层账单”,不包括研发亏损、卡群折旧和13亿美元基础硬件大总账。论文中的工程做法包括无辅助损失的专家负载均衡、FP8数值精度训练,以及数值计算与数据传输并行启动。
2025年春节,DeepSeek-R1发布。据雷峰网报道,其强化学习阶段耗资29.4万美元,核心突破是组相对策略优化(GRPO)算法,首次证明无需大规模监督微调,仅通过纯强化学习,大模型就能自主涌现链式思考能力;R1-Zero完全从零冷启动,不依赖人工标注数据。该成果后来登上《Nature》封面,成为首个获此权威认可的主流大模型成果。梁文锋被请到政府座谈会分享中国AI发展,R1的逻辑被蒸馏给全球开源小模型。
报道称,在拿下推理能力高地后,梁文锋的署名论文继续向更底层延伸,把成本战下沉到芯片微观访存逻辑,以解决长文本训练与推理的物理成本问题,《Native Sparse Attention》《Insights into DeepSeek-V3》即出现在这一阶段。