在 boss 上看到的,进去了解了一下就是利用 claude 对着 Agent 的对话数据进行修复、评分等,是不是不推荐干这种活?
之前站内也有人发过类似的工作,跟开发工作大相径庭
AI 模型测评工程师
岗位核心定位
主打独立判定问题、修改调试、完整跑通项目任务,不等待指令,独立完成技术任务闭环,考核通过即可上项。
薪资:正式上项后 150 元/⼀题
结算:次⽉25‑30 号结算上⽉全部产出
任务要求:每日必须完成 1 题
学历要求:本科及以上学历,计算机、软件工程、电⼦信息等理工科相关专业。
经验要求
具备 1 年及以上以下任意一类工作/实习经历:
后端开发 / DevOps / 工具链开发 / 代码类数据标注 / 技术型 QA 测试。
硬性必备条件(全部达标才可参与,缺一不可)
1 )具备主动阅读理解代码的意愿与能力;能读懂 Python / YAML / Shell ,理解执行逻辑与报错链路;
2 )熟悉 Docker:能搭容器环境、调试容器内报错,不限于拉镜像跑命令;
3 )工程基础扎实,做过真实项目,理解代码结构与依赖关系;
4 )全流程自驱,发现问题自行解决,能在模型未标出问题的情况下自行发现问题;
5 )用过 Cursor 、Windsurf 等 AI 编程工具
不适合投递
• 看到报错无从下手,不会独立排查问题
• 没有独立完成过任意一个带代码的小型实操项目