大众财经网 9月24日消息,据DeepSeek及arXiv平台披露,DeepSeek联合清华大学发表了一篇关于智能体(Agent)训练基础设施的论文,署名的最后一人是DeepSeek创始人梁文锋。
该论文标题为《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,于9月19日提交至arXiv,编号2609.22978,作者超过130人,梁文锋排在最后一位,合作方为清华大学。
论文的核心,是DeepSeek完整公开了用来训练Agent的“沙盒工厂”DSec。通过这一沙盒,Agent能够创建自己所需要的环境,环境再反过来训练Agent;被训练得更强的Agent,又会创造更好的环境。由此,论文描述了一个小型的递归自我改进(RSI)闭环。
在业界看来,训练大模型与训练Agent存在本质区别。训练大模型是喂数据、算梯度,环境就是GPU集群;而训练Agent则需要在动态环境中不断试错与迭代,对基础设施的弹性与隔离能力提出了全新要求。DSec的开放,意味着DeepSeek把这套底层能力摆到了台面上。
自开源模型受到广泛关注以来,DeepSeek的一举一动都牵动行业神经。此次公开训练Agent的沙盒基础设施,延续了其“把能力开放出来”的一贯风格。对开发者和研究者而言,这类底层工具的透明化,有助于推动整个智能体训练生态的加速成熟,也降低了后来者进入这一前沿领域的门槛。
本文仅供信息参考,不构成任何投资建议。