人工智能
未读
算力调度与推理集群:K8s、NPU 切分与弹性部署
裸金属到云原生的算力运营:K8s device plugin 与 NPU 接入、vNPU 动态切分、Volcano 的成组调度与队列管理、推理服务的弹性伸缩与多租户隔离,以及可观测体系。
人工智能
未读
千卡训练集群:互联网络、集合通信与故障容忍
大模型训练的瓶颈一半在通信。详解 all-reduce 环算法的带宽推导、RDMA/RoCE 参数面网络设计、TP/PP/DP 的通信占比账本、HCCL/NCCL 的关系,以及千卡集群的故障处理体系。
人工智能
未读
NPU 编程栈拆解:以昇腾 CANN 为例,对照 CUDA 生态
从 CUDA 栈的分层出发,逐层拆解 CANN:AscendCL 运行时接口、GE 图引擎、TBE 算子开发、HCCL 集合通信与 torch_npu 适配层,附 CUDA→NPU 迁移的工程清单与常见坑。
人工智能
未读
AI 算力硬件:从 CPU 的三堵墙到 NPU 的达芬奇架构
为什么 CPU 跑不动大模型?从计算墙、内存墙、功耗墙出发,拆解 GPU 的 SIMT/Tensor Core 设计,详解昇腾达芬奇架构的 3D Cube/Vector/Scalar 与存储层次,并覆盖端侧 NPU(RK3588)的取舍。

