Manus AI logo

    Agent 产品评测研究实习生实习

    Manus AI

    Singapore, SingaporeInternship24 Sept 2026

    About this internship

    岗位概述 从产品和用户任务出发,结合 Agent 技术机制设计评测方法。通过指标设计、实验分析和失败案例研究,判断能力变化,探索现有指标难以覆盖的评测问题,为 Harness 迭代、及模型选型提供依据。 岗位职责 参与线上与离线评测指标设计,将用户任务、交付质量和使用体验转化为可衡量、可检验的评价标准。 结合 Agent 体规划、工具调用、上下文与反馈机制设计评测任务和实验,分析系统改动前后的实际效果。 分析评测结果、失败案例和用户反馈,区分分数变化与真实能力、用户体验变化。 将产品问题转化为新的评测任务、指标或实验方法,并推动结论进入产品、工程迭代闭环。 任职要求 对 AI 产品与用户体验具备较强的敏感度,关注 Agent 在真实场景中的任务完成效果与用户价值,而非仅关注评测分数。 具备实验设计与数据分析能力,能够独立分析评测结果和失败案例。 有 LLM / Agent Benchmark、模型评测或相关科研经历。 加分项 有头部科技企业、高校或科研机构相关实验室的实习、科研或项目经历,且实际参与过大模型、AI Agent、人机交互或产品评测相关工作。 有评测数据集构建、评价标准设计、人类评价与自动化评价对比,或真实用户任务分析经验。