腾讯
校园招聘 · 青云计划-实习生算力统一运行时技术的研究
面议
关于这个机会
课题背景 人工智能、高性能计算等领域推动算力需求向异构化、规模化发展,GPU和异构算力等多种算力资源构建集群,运行时环境存在接口与标准不统一,应用适配成本高,并影响了资源的利用率。加之RL模式兴起,对运行时性能、稳定提出更高要求。 课题挑战 稳定性挑战:算力统一运行时作为算力集群的基础能力,需具备高稳定性与高可靠性,能够从技术上实现提前发现-诊断解决异常的能力,应对算力资源故障、算力环境异常情况,确保服务稳定执行。 扩展性挑战:算力集群规模的扩大、算力类型的增加以及上层应用需求的升级,运行时系统需具备良好的可扩展性,能够灵活扩展功能模块(如池化、热迁、可视化和混部等),适配不同场景的算力需求,且扩展过程不影响系统的正常运行 具体工作 模块的设计开发:整合核心模块搭建系统原型,设计多场景测试用例;根据测试结果优化系统,形成可落地的技术方案。 技术文档与成果总结:总结研究成果,提炼创新点,分析应用价值,形成研究报告,为后续优化与落地提供支撑。
任职要求
1、深入了解GPU或者某异构硬件架构特性,具备算力容器化组件的开发能力,以及阅读前沿论文的能力 2、熟悉NVIDIA CUDA编程,具备GPU运行时技术经验优先(如算力虚拟化、热迁移、池化技术) 3、加分项:在顶会发表过混部、调度等相关论文
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。