本科生/硕士生 Agent 入组考核题

考核方向:AutoResearch / AutoSTAT 

考核目的:本题不要求搭建一个功能完备的产品,而是考察申请人能否独立完成一个可运行、可复现、能够解释其设计取舍的 Agent 原型。最终效果只是评价的一部分,更重要的是你是否真正理解系统如何规划、调用工具、记录状态、处理失败并判断任务何时结束。

一、任务说明

请从下列两个题目中任选一个,完成一个最小可运行系统。系统应接收自然语言任务,自动完成多步规划与工具调用,并输出完整结果和执行记录。

题目 A:Mini AutoResearch

搭建一个能够自动迭代机器学习实验的 Agent。你可以自行选择一个规模较小、能够在普通电脑上完成的任务,例如分类、回归或简单的神经网络训练。

系统至少需要完成:

  1. 读取自然语言研究目标、现有代码或配置,以及可使用的数据。
  2. 检查当前实验状态,提出下一步可执行的修改方案。
  3. 自动修改代码或配置,调用 Python / Shell 运行实验。
  4. 读取日志和指标,判断修改是否有效,并决定继续、回退或停止。
  5. 至少完成 3 轮真实实验迭代,最终生成包含实验过程、最佳结果和局限性的报告。

示例目标:在限定时间或实验次数内,提高验证集指标,同时控制模型复杂度。不得把三轮实验结果预先写死在程序中。

题目 B:Mini AutoSTAT

搭建一个能够自动完成基础统计分析的 Agent。你可以自行选择一份公开 CSV 数据,并设计一个明确的统计问题。

系统至少需要完成:

  1. 读取自然语言分析问题和数据文件,检查变量类型、缺失值与异常情况。
  2. 提出分析计划,说明拟采用的方法及其适用条件。
  3. 自动生成并执行 Python 或 R 分析代码,保存关键结果和图表。
  4. 检查模型假设、运行错误或结果异常;必要时修改方案并重新执行。
  5. 输出结构化报告,至少包括数据说明、方法、结果、不确定性、限制和不应得出的结论。

系统不要求覆盖所有统计方法,但必须能够说明为什么选择当前方法,以及在哪些情况下该方法可能不可靠。

二、统一功能要求

  1. 任务规划:将用户目标拆分为多个可执行步骤,而不是一次性生成最终答案。
  2. 真实工具调用:至少调用文件读写与 Python / Shell 执行工具。只在对话中模拟“已经运行”不算完成。
  3. 状态记录:保存每一步输入、决策、工具调用、输出、错误和后续动作,使完整过程可追溯。
  4. 结果检查:需要有独立的检查、反思或验证环节,不能默认工具执行成功或模型结论正确。
  5. 终止机制:明确最大步骤数、预算、成功条件和失败退出条件,避免 Agent 无限循环。
  6. 异常处理:至少展示一种真实失败及恢复过程,例如代码报错、结果为空、指标下降或数据不满足假设。
  7. 可配置性:模型名称、API、运行预算、数据路径和主要参数应通过配置文件或命令行设置。
  8. 可复现性:在 README 中提供从环境安装到运行示例的完整命令,原则上应能通过一条主命令启动。

三、提交材料

材料具体要求
完整代码提交 Git 仓库或压缩包,包含源代码、配置、依赖文件和必要的示例数据。不要提交密钥。
README说明环境、安装、启动命令、目录结构、输入输出格式和已知限制。
技术报告不超过 6 页。说明系统架构、核心流程、关键设计、实验或测试结果、失败案例和改进方向。
运行记录至少提供一次完整运行日志,能够看到 Agent 每一步的决策、工具调用和结果。

四、允许与禁止事项

允许

禁止