岗位名称:AI 算力效能专家(训练推理优化与模型价值评估)
岗位定位:
面向公司级10万卡级算力,负责 GPU 资源、AI 任务、模型及项目的效能评价与优化。深入业务训练与推理场景,建立科学、可验证的评价标准,识别性能瓶颈与无效资源消耗,推动优化落地,并为模型选型、资源配置和预算投入提供技术及成本依据。
岗位职责:
- 建立算力与模型效能评价体系
围绕资源使用、任务执行、模型质量和业务产出,建立指标定义、采集规范、评价方法与判定标准。按业务类型、模型结构、硬件配置和运行阶段建立基线,明确阈值依据及适用边界,持续验证评价结果的准确性。
- 深入定位训练与推理性能问题
综合分析 GPU 利用率、SM Active、显存容量与带宽、MFU、吞吐、时延、功耗及 CPU、存储、网络指标,结合任务日志与性能剖析,定位数据加载、算子执行、通信同步、并行策略、资源配置和调度等瓶颈,形成可验证的根因结论。
- 深入业务模型开展有效性甄别
阅读模型及训练推理代码,分析模型结构、数据集、超参数、Loss、Checkpoint 和评测结果,识别训练不收敛、重复或冗余实验、配置不合理、评测偏差及模型复杂度与业务需求不匹配等问题。与业务算法团队共同验证模型质量和产出标准,区分合理探索与可治理的无效消耗。
- 推动优化方案落地并验证收益
围绕混合精度、分布式并行、计算与通信重叠、数据流水线、批处理、量化、缓存和模型选型等方向开展优化。在模型质量、服务时延和稳定性满足要求的前提下,验证吞吐提升、训练时间缩短、总卡时下降及单位产出成本改善。
- 开展模型及项目投入产出分析
关联资源、任务、模型版本、业务产出和费用,建立覆盖算力、存储、网络、云服务及必要人力投入的成本模型。分析达到目标模型质量的训练成本、满足服务要求的推理成本,以及新增投入带来的边际收益。联合业务与财经开展 ROI、回收周期及敏感性分析,区分实际降本、成本避免和资源复用价值,为技术路线、扩容和预算决策提供依据。
- 沉淀自动诊断与持续治理能力
将分析方法沉淀为指标字典、诊断规则、基准测试、评测工具和自动化分析能力,形成问题发现、证据核验、业务确认、优化整改及效果复查的闭环,持续提升覆盖率、诊断准确率和问题解决效率。
任职要求:
- 计算机、人工智能或相关专业背景,具备 5 年及以上 AI 基础设施、机器学习工程、训练推理优化或相关经验,有独立负责复杂技术问题诊断与优化的经历。
- 熟悉 GPU 架构和深度学习执行机制,准确理解资源占用、GPU 利用率、SM Active、显存使用、MFU 等指标的含义、计算口径及局限,能够结合任务阶段和实际产出判断效率。
- 熟练使用 Python、SQL 和 PyTorch,具备阅读、修改业务模型代码及设计验证实验的能力;熟悉 PyTorch Profiler、Nsight Systems/Compute 等性能分析工具,以及 Prometheus、Grafana、DCGM 等监控体系。
- 在分布式训练或推理性能优化中至少一个方向具备深入实践,并理解另一方向的关键约束。熟悉 NCCL、DeepSpeed、Megatron、vLLM、TensorRT 等相关技术中的一种或多种,有可复核的优化成果。
- 理解模型训练、验证、部署和迭代流程,能够评审实验设计、收敛表现、泛化能力及业务评测结果,通过对照实验、消融实验或基准测试验证判断。
- 具备成本建模与投入产出分析能力,能够将资源消耗、模型质量和业务效果关联到单位成本,清晰说明核算周期、收益归因、测算假设及不确定性。
- 具备跨团队技术沟通和推动能力,能够与算法、平台、基础设施、业务及财经团队共同制定标准,以可复查的证据推动问题解决。
优先条件:
- 有大规模 GPU 集群、算力治理平台或 AI 效能平台建设经验。
- 有自动驾驶、机器人、大模型、多模态等业务的模型训练或推理优化经验。
- 有模型成本评估、资源预算评审、FinOps 或实际降本项目经验。
- 有自动诊断系统、性能分析工具或模型评测平台建设经验。