Agent 产品评测研究实习生实习
Manus AI
Singapore, SingaporeInternship24 Sept 2026
About this internship
岗位概述
从产品和用户任务出发,结合 Agent 技术机制设计评测方法。通过指标设计、实验分析和失败案例研究,判断能力变化,探索现有指标难以覆盖的评测问题,为 Harness 迭代、及模型选型提供依据。
岗位职责
参与线上与离线评测指标设计,将用户任务、交付质量和使用体验转化为可衡量、可检验的评价标准。
结合 Agent 体规划、工具调用、上下文与反馈机制设计评测任务和实验,分析系统改动前后的实际效果。
分析评测结果、失败案例和用户反馈,区分分数变化与真实能力、用户体验变化。
将产品问题转化为新的评测任务、指标或实验方法,并推动结论进入产品、工程迭代闭环。
任职要求
对 AI 产品与用户体验具备较强的敏感度,关注 Agent 在真实场景中的任务完成效果与用户价值,而非仅关注评测分数。
具备实验设计与数据分析能力,能够独立分析评测结果和失败案例。
有 LLM / Agent Benchmark、模型评测或相关科研经历。
加分项
有头部科技企业、高校或科研机构相关实验室的实习、科研或项目经历,且实际参与过大模型、AI Agent、人机交互或产品评测相关工作。
有评测数据集构建、评价标准设计、人类评价与自动化评价对比,或真实用户任务分析经验。