



去年的年底,我在台湾为一家客户部署一套基于Kubernetes的微服务集群。初看起来,客户的服务器配置足够强大:Intel Xeon 处理器、256GB 内存、...

我在美国的一个AI创业团队里主导搭建GPU服务器集群,用于大模型推理与训练。按道理,配上8块NVIDIA A100,跑Transformer模型应该是轻轻松松的...



我们在部署于香港数据中心的多节点GPU服务器集群中,我们遇到了一起罕见但极具代表性的故障:由于GPU供电相位异常,导致部分节点出现间歇性的运算错误与程序崩溃。本...


