智联招聘是由北京网聘信息技术有限公司开发的招聘软件,创建于1994年。截至2025年,该软件拥有超过3.49亿职场用户,累计合作企业超过1341万家。智联招聘提供网络招聘、校园招聘、测培等服务,并应用AI技术推出“AI易面”、“模拟面试间”等产品 。其大数据报告被广泛引用,参与政府就业决策支持,并开展多项公益就业活动 。
设计并实施基于端到端强化学习的Agent模型训练框架;
开发适用于垂类领域的强化学习环境和奖励机制;
构建Agent模型的行动空间和决策机制,实现端到端优化;
设计针对特定领域任务的Agent评估框架和指标;
优化Agent的推理链路、工具使用和长期规划能力;
开发自监督和半监督学习方法,减少对标注数据的依赖;
与产品团队紧密合作,将Agent技术应用到实际场景;
跟踪并应用最新的学术和工业界Agent技术进展。
任职要求:
计算机科学、人工智能、机器学习或相关领域的硕士以上学位;
2年以上大语言模型研发经验,特别是在大模型后训练优化方面;
深厚的端到端强化学习理论基础和实践经验;
熟悉PPO、GRPO等先进强化学习算法,并能应用于LLM-Agent开发,有设计和实现Agent行为模拟环境的经验;
熟悉PyTorch等深度学习框架,熟悉大语言模型在Agent系统中的角色和优化方法;
优秀的编程技能,能够构建复杂的Agent训练架构;
良好的沟通能力和团队协作精神,在顶级会议(如NeurIPS、ICML、ACL等)发表过Agent或强化学习相关研究论文者优先。
设计并实现大型语言模型(LLM)的监督式微调(SFT)方案;
负责大模型微调和评估的全流程实现;
设计实验和分析数据,评估模型在各种任务上的表现;
与数据团队合作构建高质量的训练数据集;
与业务团队共同构建人岗匹配和聊天上的垂类模型。
职位要求:
计算机科学、机器学习或相关领域的本科以上学位,2年以上大模型开发经验;
熟练掌握监督式微调(SFT)技术,有实际项目落地经验;
熟悉RLHF、DPO等对齐方法的实现与应用,精通PyTorch或TensorFlow等深度学习框架;
熟悉主流开源大模型如LLaMA、Qwen、Mistral等的训练与应用;
良好的英文阅读和写作能力,能跟进国际前沿研究。
简历投递
邮箱主题:应聘岗位+ 姓名 + 语音之家推荐
邮箱:yang.ning@zhaopin.com.cn
地址:北京朝阳
