首页
AI Coding
NEW
沸点
课程
直播
活动
AI刷题
APP
插件
搜索历史
清空
创作者中心
写文章
发沸点
写笔记
写代码
草稿箱
创作灵感
查看更多
会员
登录
注册
分布式机器学习
罗西的思考
创建于2021-09-07
订阅专栏
分布式机器学习
等 28 人订阅
共117篇文章
创建于2021-09-07
订阅专栏
默认顺序
默认顺序
最早发布
最新发布
[源码解析] 深度学习流水线并行 PipeDream(5)--- 通信模块
在前文中,我们介绍了PipeDream的总体架构,Profile阶段,计算分区阶段,模型转换阶段和运行时引擎,本文我们介绍PipeDream 的通信模块。
[源码解析] 深度学习流水线并行 PipeDream(4)--- 运行时引擎
在前文中,我们介绍了PipeDream的总体架构,Profile阶段,计算分区阶段和模型转换阶段,本文我们介绍运行时执行引擎,这是一个统一基础设施层。
[源码解析] 深度学习流水线并行 PipeDream(3)--- 转换模型
在前文中,我们介绍了PipeDream的总体架构,Profile阶段和计算分区阶段。本文我们介绍模型转换阶段。
[源码解析] 深度学习流水线并行 PipeDream(2)--- 计算分区
在前文中,我们介绍了PipeDream的总体架构和Profile阶段,本文我们继续介绍计算分区阶段。
[源码解析] 深度学习流水线并行之PipeDream(1)--- Profile阶段
继 GPipe 之后,我们开一个流水线并行训练新系列,介绍微软的PipeDream。本文介绍其总体思路,架构和Profile阶段。
[源码解析] 深度学习流水线并行 GPipe(3) ----重计算
GPipe是一个由 Google Brain 团队开发的,支持超大规模模型的神经网络训练并行库,本文介绍其重计算功能,同时可以和其他实现一起印证。
[源码解析] 深度学习流水线并行GPipe (2) ----- 梯度累积
梯度累积是一种增大训练时 batch size的技术,在本地使用 micro-batch 多次进行正向和反向传播积累梯度后,再进行梯度规约和优化器更新,这是用来均摊通信成本的一种常用策略。
[源码解析] 深度学习流水线并行Gpipe(1)---流水线基本实现
GPipe是一个基于 Lingvo 开发的,支持超大规模模型的神经网络训练并行库,本文介绍其基本功能和流水线实现。
[源码解析] 机器学习参数服务器Paracel (3)------数据处理
Paracel是豆瓣开发的一个分布式计算框架,它基于参数服务器范式,用于解决机器学习的问题。本文介绍其数据加载部分。
[源码解析] PyTorch 分布式(2) --- 数据加载之DataLoader
为了更好的介绍参数服务器Paracel的数据加载,我们临时插入两篇PyTorch的数据加载,主要是从分布式的角度进行切入。本文介绍DataLoader。
[源码解析] PyTorch 分布式(1) --- 数据加载之DistributedSampler
为了更好的介绍参数服务器Paracel的数据加载,我们临时插入两篇PyTorch的数据加载,主要是从分布式的角度进行切入。本文介绍DistributedSampler。
[源码解析] 机器学习参数服务器 Paracel (2)-----SSP实现
Paracel是豆瓣开发的一个分布式计算框架,它基于参数服务器范式来解决机器学习的问题。本文介绍其SSP实现机制。
[源码解析] 机器学习参数服务器 Paracel (1)-----总体架构
Paracel 是豆瓣开发的一个分布式计算框架,它基于参数服务器范式来解决机器学习的问题,本文主要分析其架构,并且与ps-lite做分析比对。
[源码解析]机器学习参数服务器ps-lite(4) ----- 应用节点实现
本文是参数服务器的第四篇,介绍KVWorker, KVServer。本文会先介绍一些基础支撑类,然后介绍的基类 SimpleApp,最后介绍 Server / Worker。
[源码解析] 机器学习参数服务器ps-lite 之(3) ----- 代理人Customer
本文是参数服务器第三篇,介绍ps-lite的Customer模块。目前有了邮局 (PostOffice)和通信模块小推车(Van),接下来就要看看邮局的客户Customer。
[源码解析] 机器学习参数服务器ps-lite(2) ----- 通信模块Van
本文是参数服务器系列第二篇,介绍ps-lite的通信模块 Van。邮局里有了地址簿,就需要有货车来负责拉送物件,Van 就是整个Parameter Server的通信模块。
[源码解析] 机器学习参数服务器ps-lite 之(1) ----- PostOffice
参数服务器是机器学习训练一种范式,是为了解决分布式机器学习问题的一个编程框架。本文是参数服务器系列第一篇,介绍ps-lite的总体设计和基础模块 Postoffice。
[源码解析] 深度学习分布式训练框架 horovod (19) --- kubeflow MPI-operator
Horovod 是一款基于 AllReduce 的分布式训练框架。本文介绍 Horovod on K8S 功能,主要是MPI-Operator。
[源码解析] 深度学习分布式训练框架 horovod (18) --- kubeflow tf-operator
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本文借着学习 Horovod on K8S 功能,把相关概念梳理一遍,期望可以从中找出设计思路。
[源码解析] 深度学习分布式训练框架 horovod (17) --- 弹性训练之容错
Horovod 是Uber于2017年发布的一个易于使用的高性能的分布式训练框架,在业界得到了广泛应用。本文是系列第十七篇,看看horovod 的容错机制。
下一页