一个令人惊艳的 AI 开源神器!


过去一年,各类 AI 大模型的发展可谓如日中天。各个科技公司竞相推出自己的大语言模型,试图在即将到来的 AI 时代占据自己的一席之地。

在大模型的研发过程中,算力消耗可谓是老生常谈的话题之一。据统计,AI 算力在 70 年内增长了 6.8 亿倍。在如此大体量的算力增长环境下,应该如何通过技术来合理降低、高效利用算力,便成为了一个亟待解决的问题。

无独有偶,近日,一个由蚂蚁集团 AI 创新研发部门 NextEvo 全面开源的 AI Infra 技术,在该问题上有了突破性进展。

该技术可帮助大模型千卡训练有效时间占比超过 95%,能实现训练时 “自动驾驶”,大大降低 AI 研发成本,推动研发效率。

蚂蚁集团的自动化分布式深度学习系统 DLRover,现已全面开源

该技术框架名为 DLRover,目标在于大规模分布式训练的智能化。目前很多企业的训练作业都是跑在混合部署的集群中,运行环境复杂多变,不管多么 “崎岖的地形”,DLRover 都可以 “轻松行驶”。

GitHub:https://github.com/intelligent-machine-learning/dlrover

2023 年大模型技术的发展,带来了工程实践的爆发,如何管理数据,提高训练和推理效率,最大化利用现有算力,成了关键一环。

完成一个千亿参数级别的大模型,如 GPT-3,用一张卡训练一次要耗时 32 年,那么训练时的算力利用尤为重要。

方法之一是把能用的算力用得更好,比如进一步压榨已购买 GPU 的性能;二是把以前利用不了的算力用起来,比如 CPU、内存等,这就需要通过异构计算平台来解决。

最新集成进 DLRover 的是 Flash Checkpoint(FCP)方案。模型训练时,一般要打 Checkpoint(检查点),以便中断时能恢复到最近状态,目前常规的做法,存在着耗时长、高频打点易降低训练可用时间、低频打点恢复时丢失过多等缺点。

新方案 FCP 应用在千卡千亿参数模型训练后,Checkpoint 导致的训练浪费时间降低约 5 倍,其中持久化时间降低约 70 倍,有效训练时间从 90% 提升至 95%。

同时集成进去的,还有三项新的优化器(Optimizer)技术。优化器作为机器学习的核心组件,用于更新神经网络参数以最小化损失函数。其中,蚂蚁的 AGD(Auto-switchable optimizer with Gradient Difference of adjacent steps)优化器,在大模型预训练任务中,相比传统的 AdamW 技术加速 1.5 倍,AGD 已在蚂蚁内部多个场景使用并取得显著效果,相关论文已被 NeurIPS '23 收录。

在大模型预训练任务中,AGD 相比 AdamW 可以加速 1.5 倍

作为自动化分布式深度学习系统,DLRover 的 “自动驾驶” 功能模块还包括:Atorch,一种 PyTorch 分布式训练扩展库,在千亿参数模型千卡级别规模下,训练的算力利用率可达 60%,帮助开发者进一步压榨硬件算力。

DLRover 以 “ML for System” 的理念来提升分布式训练的智能度,旨在通过一个系统,让开发者完全摆脱资源配置的束缚,专注于模型训练本身。在没有任何资源配置输入的情况下,DLRover 仍然可以为每个训练作业提供最佳资源配置。

除此之外,项目还有着以下特点:

  • 容错性:分布式训练在发生故障时可以继续运行;
  • Flash Checkpoint:分布式训练可以在几秒内从内存检查点恢复故障;
  • 自动扩展:分布式训练可以扩展/缩减资源,以提高稳定性、吞吐量和资源利用率。

值得一提的是,蚂蚁集团还在人工智能领域持续进行技术投入。

最近,蚂蚁集团在内部成立了 AI 创新研发部门 NextEvo,承担了蚂蚁 AI 的所有核心技术研发,包含百灵大模型的所有研发工作,涉及 AI 算法、AI 工程、NLP、AIGC 等核心技术,并在布局多模态大模型、数字人等领域的技术研发和产品创新。

同时,蚂蚁集团还在持续加速开源节奏,填补了国内相关技术空白,推动人工智能行业快速发展。

随着各个大厂新技术的推动,我相信接下来的 AI 大模型研发流程将会愈加简便与高效,「降本增效」一词将在 AI 技术领域不断刷新人们的认知。

GitHub 地址:https://github.com/intelligent-machine-learning/dlrover
转自:GithubDaliy


🏴‍☠️宝藏级🏴‍☠️ 原创公众号『数据STUDIO』内容超级硬核。公众号以Python为核心语言,垂直于数据科学领域,包括可戳👉 PythonMySQL数据分析数据可视化机器学习与数据挖掘爬虫 等,从入门到进阶!

长按👇关注- 数据STUDIO -设为星标,干货速递

相关推荐

  • Matplotlib 强势变身:6 个 Python 风格库惊艳众人
  • 关于「日志采样」的一些思考及实践
  • 100+目标检测论文代码,还有15节论文精读课!
  • 业界分享 | NVIDIA大语言模型落地实践
  • 211 大学教授、博导 SCI 期刊发论文,被质疑忘删掉 ChatGPT 提示词…
  • 分布式场景怎么Join?
  • 网易面试官:请你实现一下JS重载?可不是TS重载哦!
  • 分享15个高级前端开发小技巧
  • 从Java到json:探索 Jackson 的魔力
  • 2.3k star,一整套完整的 AI 助手系统开源了,逼格拉满、开箱即用,支持一键部署
  • 【福利】知识图谱实践资料最后2天免费赠送!
  • 张俊林:揭去神秘面纱,Sora关键技术逆向工程图解
  • 答应我,在vue中不要滥用watch好吗?
  • 目前工资最高的几家外包公司汇总!(2024最新版)
  • 畅销10W册的《码农翻身》出第二部啦
  • 万字:深度解析“外卡收单”体系
  • 腾讯文档收集表后台重构:改造一个巨石单体!
  • 告别 BeanUtil.copyProperties,这款IDEA插件才是最优的替代方案!
  • 真是太凡尔赛了!一位女硕士研究生被省烟草局提前录取了,但却高兴不起来,自己学的是计算机,华为也发了offer。。。
  • Java 22 正式发布,一文了解全部新特性