异构计算与Token效能架构师 - TikTok研发
关于这个机会
团队介绍:TikTok研发团队,旨在实现TikTok业务的研发工作,搭建及维护业界领先的产品。加入我们,你能接触到包括用户增长、社交、直播、电商C端、内容创造、内容消费等核心业务场景,支持产品在全球赛道上高速发展;也能接触到包括服务架构、基础技术等方向上的技术挑战,保障业务持续高质量、高效率、且安全地为用户服务;同时还能为不同业务场景提供全面的技术解决方案,优化各项产品指标及用户体验。 在这里, 有大牛带队与大家一同不断探索前沿, 突破想象空间。 在这里,你的每一行代码都将服务亿万用户。在这里,团队专业且纯粹,合作氛围平等且轻松。目前在北京,上海,杭州、广州、深圳分别开放多个岗位机会。 1、负责AI异构计算基础设施的中长期架构设计与演进,打通应用、Agent、模型、推理服务与GPU等底层算力资源,建设从Token需求到算力交付的端到端效率架构; 2、建设Token效能体系,完善Token消耗的度量、归因和分析能力,识别上下文膨胀、多轮调用放大、重复请求、低效工具调用等问题,推动Context、Cache、Agent Workflow等方向的系统性优化; 3、面向模型服务和推理链路,综合模型效果、Token消耗、吞吐、时延、容量和成本等因素,推动模型选型、动态路由、流量调度和推理效率优化,持续降低单位有效Token的资源成本; 4、推进GPU等异构算力基础设施的统一与资源池化,建设统一资源模型和适配标准,持续优化异构卡型、计算拓扑、网络、存储、跨集群资源流转、GPU共享及细粒度调度能力; 5、建设Token与算力资源协同的容量和治理体系,将业务Token需求转化为模型服务和GPU容量需求,并通过预算、配额、限速、弹性资源池和全局资源调度等机制,提高资源使用的可控性和供需匹配效率; 6、建设覆盖Token、推理服务和底层算力的统一可观测与效能体系,通过数据分析、实验评估和跨团队协作持续识别效率瓶颈,将架构能力转化为Token成本、新卡型交付、业务上量、资源流转及GPU利用率等可量化收益。
任职要求
1、具备扎实的计算机基础,熟悉数据结构、算法、操作系统、计算机网络和分布式系统; 2、熟练使用Go、C++、Python、Java、Rust等至少一种编程语言,具备良好的系统设计和工程实现能力; 3、熟悉大模型应用及推理链路,对Token、Context、KV Cache、Batching、模型并行、吞吐和时延等核心概念有较深入理解; 4、熟悉Kubernetes、Slurm等至少一种资源管理或调度系统,理解资源模型、调度、配额、弹性和故障恢复等核心机制; 5、对GPU和异构计算基础设施有较深入理解,熟悉GPU卡型、服务器拓扑、PCIe、NUMA、NVLink/NVSwitch、RDMA、网络及存储等相关技术; 6、具备较强的系统抽象和数据分析能力,能够从Token消耗、模型服务、推理效率和底层算力等多个层次分析复杂效率问题,并在质量、稳定性、工程复杂度和成本之间做出合理取舍,具备良好的沟通和推动能力,能够与业务、Agent、模型、推理平台、调度、容量、SRE、网络、存储及硬件等团队共同推进复杂项目。 加分项 1、有LLM Serving、AI Infrastructure、资源调度、集群管理或GPU利用率优化经验; 2、有Token Efficiency、模型路由、Context Optimization、Prompt/Prefix Cache、Agent Workflow Optimization或AI成本优化经验; 3、有GPU共享、虚拟化、异构卡型适配、跨集群调度、资源池化、碎片治理或容量规划经验; 4、熟悉CUDA、NCCL、RDMA、PyTorch,以及vLLM、SGLang、TensorRT-LLM等AI训练或推理技术栈; 5、有计算、网络、存储等多维资源联合优化,或软硬件协同设计经验; 6、有基础设施架构统一、平台收敛或跨团队效率治理项目经验。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。