腾讯营销 —机器学习平台技术研究
关于这个机会
课题背景: 随着大规模预估模型在广告业务中的广泛应用,模型规模、特征维度与训练数据量持续增长,呈现出类似 scaling law 的规律。 当前挑战:更大的模型与数据通常带来效果提升,但也显著推高训练成本与平台负载。在实际生产环境中,GPU/存储/网络资源受限,如何在遵循或利用广告场景下的 scaling law 前提下,实现训练平台的性能优化(吞吐、时延、资源利用率)与效果优化之间的平衡,成为广告训练基础设施演进中的关键问题。 工作内容: 1、训练性能与资源优化 参与大规模广告训练平台的性能剖析,识别 GPU/CPU、网络、存储等瓶颈环节并优化; 在给定资源约束下,设计并验证不同模型规模、批大小、并行策略(数据/模型/流水线并行等)的组合方案,提升端到端训练效率。 2、效果–成本联合优化策略 探索利用 scaling law 进行“效果–成本”联合优化的策略,如自动化选择最优模型规模、训练步数和采样策略; 将相关策略在离线训练及小流量线上实验中进行验证,评估对 AUC、CTR/CVR、收益等指标的影响。 3、工程实现与平台落地 协助将验证有效的策略沉淀至训练平台配置、调度策略或自动化推荐工具中; 配合团队完成实验系统、可视化分析工具等工程模块的开发与维护。
任职要求
1、具备扎实的机器学习 / 深度学习基础,了解推荐系统或广告预估相关概念; 2、熟练使用至少一种深度学习框架(如 PyTorch / TensorFlow),掌握 Python 编程,具备良好的代码规范与调试能力; 3、对 scaling law、大模型训练、训练效率优化等方向有兴趣,能阅读相关英文论文并进行复现或改进; 4、具备较强的数据分析能力,熟练使用常用数据处理与可视化工具(如 Pandas、SQL、Matplotlib 等); 5、对分布式训练、GPU 计算、参数服务器 / Embedding 服务等有一定了解者优先; 6、有大规模训练、推荐/广告实习或项目经历者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。