1.负责智算集群的日常运维、实时监控与故障处置,保障AI训练及推理业务7×24小时高可用。2.参与GPU服务器的部署上架、系统初始化与内核调优,完成部署适配。3.参与算力调度平台的日常运维与策略配置,参与高速网络的调试与性能优化。4.参与运维自动化工具与监控体系的开发建设,提升运维效率;