字节跳动
社招 · 正式AIOps高级运维大模型工程师-抖音服务架构(北京/深圳)
面议
关于这个机会
1、负责运维大模型应用方向的规划与落地,探索LLM在报警治理、故障应急、运维问答、根因分析等场景的应用; 2、主导构建完善的运维领域知识库,建立从稳定性规范、历史故障复盘、技术文档到监控日志等异构数据的收集、清洗与向量化流程; 3、针对报警噪音识别、故障信息自动摘要、影响面评估等具体场景,进行模型的微调(Fine-tuning)和优化,持续提升模型效果; 4、研发并落地智能化的运维产品与工具,包括但不限于:智能问答机器人(提供精准、高效的运维知识问答服务)、报警降噪助手(利用模型自动识别和拦截噪音报警,或对报警进行智能打标与处理)、SRE Copilot(在故障应急过程中,辅助SRE自动收集故障信息、关联变更、评估影响,并生成初步的应急预案); 5、建立模型训练的统一数据规范与评测体系,构建数据生产与标注流程,为大模型在运维领域的长期发展奠定坚实基础。
任职要求
1、本科及以上学历,计算机、通信等相关专业,对AIOps领域有浓厚的兴趣; 2、熟悉Transformer、BERT、GPT等模型原理,有大模型微调、部署或应用开发的实践经验; 3、具备良好的数据处理和工程能力,能够处理海量、异构的数据。 具备以下条件者优先: 1、有将LLM应用于AIOps、智能客服、代码生成或知识库问答等领域的成功项目经验者优先; 2、熟悉向量数据库(Vector DB)及检索增强生成(RAG)技术者优先; 3、同时具备SRE或后端开发经验,深刻理解运维痛点者优先; 4、在顶级AI/ML会议或期刊上发表过论文者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。