成为第一个分享这门课真实体验的人。
来自官方课程资料的结构化信息
课程代码
COMP5585
课程名称
Cloud Computing and Hyperscale AI Infrastructure
开课学系
comp
所属学院
Faculty of Engineering
学分
3 学分
级别
5
课程简介
课程内容:1. 概述 — 云计算范式的演变;云计算的动力与益处;云计算的定义与原则;云计算的应用;超大规模人工智能基础设施的概览。 2. 第一部分:云计算架构与服务模型 — 云计算架构及其主要组件,物理基础设施;服务模型;服务提供;主要提供商和平台(亚马逊、微软、IBM、谷歌、阿里巴巴等);AWS(EC2、S3等) 3. 第一部分:虚拟化技术 — CPU 虚拟化;内存虚拟化;I/O 虚拟化;网络虚拟化;Xen;Docker(容器);Kubernetes。 4. 第一部分:大规模分布式计算平台 — 大规模分布式计算平台的基本知识,如 Hadoop、Spark、Ray 等。 5. 第二部分:人工智能数据中心的网络堆栈与通信库 — 新兴人工智能数据中心的网络架构;通信库如 MPI 和 NCCL 等。 6. 第二部分:大规模模型训练与微调 — 大规模分布式模型训练与微调的基本知识;各种分布式训练策略;各种模型训练框架(Pytorch、Tensorflow 等)。 7. 第二部分:大规模模型推理与服务 — 大规模分布式模型推理与服务的基本知识;各种分布式推理策略;各种模型推理框架,如 VLLM 等。 8. 第二部分:模型训练、微调与推理的新兴优化技术 — 模型压缩;数据管理;策略设计等。
学习目标
1. 为学生提供云计算和超大规模人工智能基础设施理论和技术方面的广泛视角。 2. 教授学生云计算和超大规模人工智能基础设施如何支持新兴的大数据和人工智能应用,以及如何在云计算环境和超大规模人工智能基础设施中工作,并开发基于云的应用程序。 3. 为学生提供云计算的基本技术,包括(1)云计算的基本知识,(2)数据中心网络,(3)虚拟化,(4)大规模分布式计算框架。 4. 为学生提供超大规模人工智能基础设施的基本技术,包括(1)大规模人工智能模型训练、微调和推理的基本知识,(2)人工智能数据中心的网络堆栈和大规模人工智能基础设施的通信库,如 MPI、NCCL 等,(3)模型训练、微调和推理的分布式策略,(4)模型训练、微调和推理的新兴系统性能优化技术。 5. 为学生提供规划、设计和编程云计算系统和人工智能基础设施的知识和技能,以应用于实际应用。
先修要求
建议掌握计算机组织与操作系统知识。
教学模式
课程包括讲授、辅导和实验室练习。在讲授中,学生将学习驱动云计算和超大规模人工智能基础设施发展的核心概念和原则。在讲授过程中,鼓励学生积极参与小型讨论和提问。在辅导中,学生将面对企业案例研究中的实际和实用场景,并参与小组讨论。实验室练习使学生能够接触最先进的工具和开发环境,使用云计算和人工智能基础设施作为底层架构。