大模型评测工程师
¥10k – ¥20k/月深圳 · 广州实习全职1 天前
岗位职责
制定整套评测规则,明确AI回答好坏的判定标准
负责评测体系的架构搭建与工程化实施
收集出错案例,分类复盘问题原因,输出专业评测报告
跟踪大模型评测领域的新技术,定期复盘总结开发经验
任职要求
本科及以上计算机/人工智能/数据科学相关专业,熟悉主流智能体框架(LangChain/LlamaIndex/AgentScope/CrewAI等),了解大模型观测工具的使用(LangFuse、LangSmith、AgentLoop 等)
至少1年 AI Agent领域工作经验,做过通用或垂域AI评测项目,熟悉全流程逻辑,懂数据集、评测指标搭建逻辑
良好代码习惯,常用Cursor/Codex/Trae等编程IDE工具
良好项目管理、团队协作、开发版本控制习惯,熟悉Git、Docker等工具
实习说明
仅限2027年应届生,日薪为人民币税前 200-400,视能力而定
实习需线下办公,时间保证至少3个月以上,优秀实习生将获得留用转正机会
加分项
编程经验积累于ChatGPT时代之前,重度Token发烧友
有学术类Benchmark研究经验和论文产出
AI Agent方向热门开源项目参与或个人主导项
团队的其他职位
了解这群人

Paradoox AI - 金融智能诊断服务商
重新定义金融机构评估、部署和信任 AI 的方式
11-50 人·深圳 · 广州