职位描述

1. 设计与开发评测方案: 围绕大语言模型和多模态大模型的各项能力,设计科学、公正、全面的评测(Benchmark)方案和对应的数据集。

2. 搭建评测平台: 参与或负责自动化评测系统的开发、部署和维护,提升模型迭代和评测效率。

3. 执行与分析: 对主流的开源及闭源大模型进行系统性评测,并对自研模型进行深度分析,撰写评测报告,为模型的优化方向提供数据支持。

4. 追踪前沿动态: 持续关注业界最新的大模型评测方法、基准和技术,并将其应用到实际工作中。

职位要求

1. 教育背景: 计算机科学、人工智能、机器学习、数学或相关专业的本科及以上学历。

2. 编程能力: 熟练掌握 Python、PyTorch。

3. 技术理解: 对大语言模型(LLM)有基本的认识,了解其工作原理和主要应用场景。

4. 逻辑分析: 具备优秀的数据分析能力和逻辑思维,能够从评测结果中发现问题并提出见解。

5. 加分项(非必需):

    ꔷ 有大模型使用、微调或评测相关经验者优先。

    ꔷ 有数据科学、NLP 项目或相关研究经验者优先。

    ꔷ 熟悉常用的模型评测数据集者优先。有良好英文文献阅读能力者优先。


最低学历要求:硕士

工作地:北京/杭州/上海

联系方式:guyanmei.gym@antgroup.com