← 发现更多职位
阿里巴巴控股集团
社会招聘

数据基础及产品-数据处理工程师-搜索引擎方向

面议
杭州 · 3年以上
技术类-数据本科社会招聘

关于这个机会

1. 建设基于 LLM/VLM 的网页解析系统,完成正文识别、语义分块、内容去噪及关键字段的结构化抽取。 2. 建设 Agent 化解析能力,根据页面类型和任务目标自主选择解析策略、调用工具、验证结果并进行错误修正。 3. 解决复杂网页、长页面、图文混排和多语言页面中的解析准确率、覆盖率、成本及稳定性问题。 4. 建设网页内容和页面形态分类体系,识别新闻、商品、论坛、问答等内容类型,以及首页、列表页、详情页、聚合页等页面形态。 5. 综合页面内容、DOM结构、URL、链接关系和视觉信息,提升分类模型对长尾页面及新类型页面的泛化能力。 6. 将分类结果应用于抓取调度、解析策略、索引构建及搜索召回排序。 7. 建设网页完整度、原创度、时效性、可信度和内容价值评估能力。 8. 识别低质内容、重复内容、SEO垃圾页、内容农场、镜像站及恶意跳转等问题。 9. 建设网页解析、分类和质量评估体系,持续提升网页数据质量及搜索效果。

任职要求

1. 计算机、人工智能、数学或相关专业,本科及以上学历。 2. 熟练掌握 Python,熟悉 Java、Go 或 C++ 中至少一种语言。 3. 具备搜索引擎、网页解析、网页分类、信息抽取或内容质量相关经验。 4. 熟悉 HTML、DOM、URL、页面链接关系及常见网页结构。 5. 熟悉文本分类、多标签分类、实体识别、语义匹配、聚类或异常检测等技术。 6. 熟悉 LLM 的 Prompt Engineering、结构化输出、Function Calling、Tool Use 和上下文管理。 7. 具备 LLM 信息抽取、VLM 页面理解、RAG 或 Agent 相关项目经验。 8. 能够设计包含任务规划、工具调用、结果验证和异常降级的 Agent 工作流。 9. 具备良好的工程化及评测能力,能够综合考虑准确率、覆盖率、延迟、成本和系统稳定性。 加分项 ● 有搜索引擎网页处理、索引数据生产或搜索质量优化经验。 ● 有基于 LLM/VLM 进行网页或文档结构化解析的生产实践。 ● 有 Agentic Parsing、Browser Agent 或 Deep Research Agent 相关经验。 ● 有模型微调、蒸馏、数据合成或小模型部署经验。 ● 熟悉 OCR、网页截图理解及多模态页面解析。 ● 熟悉 Playwright、Puppeteer、Chromium/CDP 等动态网页渲染技术。 ● 熟悉 HTTP、代理、分布式爬虫、URL调度及大规模网页采集系统。 ● 熟悉 Elasticsearch、Kafka、Redis、Spark、Flink 或向量数据库。

官方来源与核验

阿里巴巴官方招聘 · 职位编号 100035940001

最近核验:2026-09-16T10:04:11.465664+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。