腾讯
社会招聘腾讯云 EdgeOne-推理平台高级工程师
面议
关于这个机会
1.负责大模型推理服务的调度与性能优化,提升首 Token 延迟、Decode 延迟、吞吐、显存利用率和 GPU 利用率; 2.负责推理请求调度、动态 Batching、KV Cache 管理与调度、显存管理等等推理性能与效率的核心能力建设; 3.负责分布式推理优化,结合模型结构、硬件资源和业务流量特点,优化 TP/PP/EP 等推理策略; 4.负责推理引擎优化,围绕模型加载、算子执行、CUDA/GPU 性能、并发执行等方向持续提升推理性能和稳定性; 5.跟进并引入 LLM Serving、推理引擎、分布式推理、GPU 性能优化等前沿技术,推动推理平台持续演进。
任职要求
1.本科及以上学历,计算机、人工智能、电子、自动化、软件工程等相关专业,有大模型推理系统优化经验者优先; 2.熟练掌握 Linux 环境下 C/C++/Rust/Python/等 1 至 2 种以上语言; 3.熟悉 LLM 推理基本流程,理解模型加载、Prefill、Decode、Serving、Batching、调度、并发控制、显存管理、KV Cache、分布式推理等核心机制以及相关优化实践; 4.熟悉 TensorRT-LLM、vLLM、SGLang、Triton Inference Server、ORCA 等主流推理框架、推理引擎或调度机制; 5.具备良好的性能分析和系统优化能力,能够定位推理链路中的调度、显存、算子、通信和资源利用率瓶颈; 6.有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速响应线上问题并推动解决。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。