从零到一,系统掌握GPU加速计算与AI基础设施开发 | 点击任意卡片查看详细学习内容
指针、模板编程、RAII、智能指针、STL容器、C++11/14/17新特性
线程层次、内存模型、cudaMalloc/cudaMemcpy、向量加法、错误处理
SM架构、Warp调度、Tensor Core、显存层次、NVLink/NVSwitch
访存合并、Shared Memory优化、Bank Conflict、Stream并发、Kernel Fusion
Nsight Compute、Nsight Systems、nvprof、性能分析工作流
ATen/C10张量库、CUDACachingAllocator、CUDA Extension开发、Autograd
TensorRT模型优化、Plugin开发、ONNX Runtime、Triton Server
KV Cache、FlashAttention、PagedAttention、Continuous Batching、投机解码
INT8/FP8/FP4量化、SmoothQuant、GPTQ/AWQ/GGUF
FlashAttention实现、INT8推理引擎、简易vLLM、NCCL多卡推理
Docker GPU容器、Kubernetes调度、DCGM监控、CI/CD
手撕代码、系统设计、性能分析、面试清单