OOffercome Jobs

多模态 Agent 后训练算法工程师

60k-100k · 16 薪

北京 · 现场办公 · 高级 / 资深 · 3-8 年 · 本科及以上

某头部互联网公司(北京 · 已上市级规模)

互联网 / 平台 · 5000 人以上 · 北京

全球化内容与效率平台公司,AI 投入居行业前列。

公司名称对外脱敏展示,联系顾问可获知详细信息。

负责多模态模型的后训练与 Agent 能力建设,方向包括 RL、工具调用与长程规划。

  • 核心模型团队一手数据
  • 自研训练框架,千卡集群
  • 直接汇报给模型负责人
多模态后训练RLHFVLMAgent

职责

  • 负责多模态大模型后训练(SFT / RL)方案设计与迭代
  • 建设 Agent 评测集与训练环境
  • 与产品团队协同落地到该公司核心产品

要求

  • 硕士及以上,3 年以上算法经验
  • 熟悉 RLHF / DPO / GRPO 等后训练方法
  • 有顶会论文或大规模训练经验优先

发布于 2026-09-20