1.AI 研发工具链建设 (AI for AI)
主导建设基于大模型的 AI 辅助编程系统(如企业级 Copilot、自动化代码评审、智能单元测试生成),通过 AI 技术直接提升全员开发效率。
构建智能化文档中心与知识库,利用 RAG 等技术实现研发经验的沉淀与快速检索。
2.MLOps/LLMOps 平台优化
规划并持续优化 AI 研发底座,涵盖数据标注、模型训练、实验跟踪、模型压缩到自动化部署的全生命周期工具链。
通过标准化的工程体系,减少研究(Research)与生产(Production)之间的转换成本。
3.算力资源治理与成本优化
负责大规模 GPU 算力资源的调度优化,提升显存利用率及任务并行效率。
建立 R&D 成本核算体系,通过技术手段降低模型训练与推理的单位成本。
4.研发度量与流程标准化
定义并追踪 AI 研发的关键效能指标(如:模型迭代周期、从数据到上线的时间、人均产出效能等)。
识别研发流程中的瓶颈,推动敏捷开发与 DevOps 在 AI 团队中的深度落地。
5.团队管理与技术文化
领导效能团队,通过工程文化(Engineering Excellence)驱动研发体系升级。
关注行业前沿效能工具,主导技术选型及内部推广。
6.核心目标 (Key Objectives)
交付速度: 显著缩短 AI 模型从算法原型到规模化上线(Time-to-Market)的周期。
资源ROI: 在保持产出的前提下,通过技术优化实现算力资源成本的结构性下降。
工程师体验: 消除研发中的重复性枯燥工作,提升核心算法工程师在关键算法攻关上的时间占比。
质量确定性: 通过自动化工程手段确保大模型上线后的稳定性与合规性。
教育背景: 计算机、软件工程或相关专业硕士及以上学历。
技术深度:
具备 8 年以上互联网或 AI 行业背景,至少 3 年以上效能提升、MLOps 或基础架构团队管理经验。
深入理解主流大模型(LLM)研发全链路,熟悉模型微调、推理加速及分布式训练。
精通云原生技术体系(Kubernetes, Docker)及主流 AI 框架(PyTorch, DeepSpeed 等)。
能力模型:
具备极强的架构思维,能从复杂流程中抽象出标准化工具方案。
的数据驱动能力,能通过度量体系量化技术产出。
出色的沟通协调能力,能跨越算法、工程及业务团队推动变革。