腾讯
校园招聘 · 青云计划-应届生微信WeLM-大语言模型推理优化
面议
关于这个机会
WeLM 模型在模型结构上的创新,诸如Hidden Decoding/NGram Embedding等,对模型推理加速部分有算法创新上的要求。特别是在RL场景中,LowBatch推理降低推理Latency也制约了团队训练迭代的速度。WeLM推理会使用诸如整个模型单MegaKernel推理,MTP算法的创新性工作来加速推理场景。
任职要求
1、有推理框架开发经验,熟悉LLM推理的基本技巧与并行方式; 2、推理场景于高性能算子开发, 熟悉Hopper显卡的微架构; 3、了解RDMA/NCCL GIN/NVSHMEM等通信算子开发; 4、沟通协作能力强,有自驱力好奇心。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。