Entry Level
Verified 2d agoPosted 2 months ago
1.负责智算中心硬件基础设施运维,包含GPU服务器、算力节点、存储设备等硬件的巡检、状态监测、故障排查与修复,监控硬件温度、功耗、显存、ECC报错等核心指标,梳理故障规律并落地优化整改,完善硬件运维、设备管理及故障处置标准化流程。2.负责智算调度、容器、AI算力管理等核心平台的日常运维、监控巡检、日志分析与性能调优,保障AI训练、推理业务稳定高可用。排查任务调度异常、服务故障等问题,优化资源调度逻辑,推进平台迭代升级与性能优化,搭建完善平台运维、变更及应急保障体系。3.负责智算中心IB高速网络、RoCE网络及算力集群网络的搭建部署、日常巡检与运维监控,保障集群网络、多机多卡分布式训练通信稳定高效。监测网络带宽、时延、丢包等指标,排查网络瓶颈与通信异常,优化网络架构与调度策略,完善网络运维、分区及权限管理规范。