職位要求
**崗位職責(zé):**
1. 負(fù)責(zé)萬(wàn)卡級(jí)異構(gòu)算力集群的全局架構(gòu)設(shè)計(jì)與落地,支撐千億參數(shù)大模型訓(xùn)練、實(shí)時(shí)推理及超大規(guī)模視頻生成等前沿AI業(yè)務(wù),保障系統(tǒng)高可用、低延遲與高吞吐。
2. 深度優(yōu)化分布式訓(xùn)練框架(如Megatron-LM、DeepSpeed)與跨節(jié)點(diǎn)通信拓?fù)?,突破顯存瓶頸與帶寬限制,顯著提升算力利用率與訓(xùn)練效率。
3. 設(shè)計(jì)并實(shí)現(xiàn)基于AI負(fù)載感知的智能調(diào)度引擎,支持多租戶資源隔離、動(dòng)態(tài)彈性伸縮與能耗優(yōu)化,實(shí)現(xiàn)算力資源的精細(xì)化管理。
4. 構(gòu)建端到端可觀測(cè)體系,集成日志、指標(biāo)、鏈路追蹤與自愈機(jī)制,打造自動(dòng)化運(yùn)維能力,確保7×24小時(shí)穩(wěn)定運(yùn)行。
**任職資格:**
1. 本科及以上學(xué)歷,計(jì)算機(jī)、電子工程或相關(guān)專業(yè);
2. 5年以上高性能算力平臺(tái)建設(shè)經(jīng)驗(yàn),主導(dǎo)過(guò)千卡以上GPU集群項(xiàng)目,具備萬(wàn)卡級(jí)系統(tǒng)落地經(jīng)驗(yàn)者優(yōu)先;
3. 精通NVIDIA GPU架構(gòu)、CUDA、RDMA/RoCE網(wǎng)絡(luò)及InfiniBand組網(wǎng)技術(shù),熟悉PyTorch/TensorFlow分布式訓(xùn)練調(diào)優(yōu);
4. 具備強(qiáng)系統(tǒng)級(jí)性能分析與根因定位能力,能獨(dú)立攻克復(fù)雜算力瓶頸問(wèn)題。