本科生/硕士生 Agent 入组考核题
考核方向:AutoResearch / AutoSTAT
考核目的:本题不要求搭建一个功能完备的产品,而是考察申请人能否独立完成一个可运行、可复现、能够解释其设计取舍的 Agent 原型。最终效果只是评价的一部分,更重要的是你是否真正理解系统如何规划、调用工具、记录状态、处理失败并判断任务何时结束。
一、任务说明
请从下列两个题目中任选一个,完成一个最小可运行系统。系统应接收自然语言任务,自动完成多步规划与工具调用,并输出完整结果和执行记录。
题目 A:Mini AutoResearch
搭建一个能够自动迭代机器学习实验的 Agent。你可以自行选择一个规模较小、能够在普通电脑上完成的任务,例如分类、回归或简单的神经网络训练。
系统至少需要完成:
- 读取自然语言研究目标、现有代码或配置,以及可使用的数据。
- 检查当前实验状态,提出下一步可执行的修改方案。
- 自动修改代码或配置,调用 Python / Shell 运行实验。
- 读取日志和指标,判断修改是否有效,并决定继续、回退或停止。
- 至少完成 3 轮真实实验迭代,最终生成包含实验过程、最佳结果和局限性的报告。
示例目标:在限定时间或实验次数内,提高验证集指标,同时控制模型复杂度。不得把三轮实验结果预先写死在程序中。
题目 B:Mini AutoSTAT
搭建一个能够自动完成基础统计分析的 Agent。你可以自行选择一份公开 CSV 数据,并设计一个明确的统计问题。
系统至少需要完成:
- 读取自然语言分析问题和数据文件,检查变量类型、缺失值与异常情况。
- 提出分析计划,说明拟采用的方法及其适用条件。
- 自动生成并执行 Python 或 R 分析代码,保存关键结果和图表。
- 检查模型假设、运行错误或结果异常;必要时修改方案并重新执行。
- 输出结构化报告,至少包括数据说明、方法、结果、不确定性、限制和不应得出的结论。
系统不要求覆盖所有统计方法,但必须能够说明为什么选择当前方法,以及在哪些情况下该方法可能不可靠。
二、统一功能要求
- 任务规划:将用户目标拆分为多个可执行步骤,而不是一次性生成最终答案。
- 真实工具调用:至少调用文件读写与 Python / Shell 执行工具。只在对话中模拟“已经运行”不算完成。
- 状态记录:保存每一步输入、决策、工具调用、输出、错误和后续动作,使完整过程可追溯。
- 结果检查:需要有独立的检查、反思或验证环节,不能默认工具执行成功或模型结论正确。
- 终止机制:明确最大步骤数、预算、成功条件和失败退出条件,避免 Agent 无限循环。
- 异常处理:至少展示一种真实失败及恢复过程,例如代码报错、结果为空、指标下降或数据不满足假设。
- 可配置性:模型名称、API、运行预算、数据路径和主要参数应通过配置文件或命令行设置。
- 可复现性:在 README 中提供从环境安装到运行示例的完整命令,原则上应能通过一条主命令启动。
三、提交材料
| 材料 | 具体要求 |
| 完整代码 | 提交 Git 仓库或压缩包,包含源代码、配置、依赖文件和必要的示例数据。不要提交密钥。 |
| README | 说明环境、安装、启动命令、目录结构、输入输出格式和已知限制。 |
| 技术报告 | 不超过 6 页。说明系统架构、核心流程、关键设计、实验或测试结果、失败案例和改进方向。 |
| 运行记录 | 至少提供一次完整运行日志,能够看到 Agent 每一步的决策、工具调用和结果。 |
四、允许与禁止事项
允许
- 使用任意大模型 API、本地模型或 Agent 框架。
- 参考 AutoResearch、AutoSTAT 或其他开源项目的公开设计。
- 使用生成式 AI 辅助编码、调试和写作,但必须明确说明使用范围。
禁止
- 直接复制完整开源项目,仅修改项目名称、界面或少量提示词后提交。
- 伪造运行日志、实验结果或工具调用过程。
- 提交自己无法解释的主要代码,或隐瞒他人和生成式 AI 的实质性贡献。
- 在代码或提交材料中包含 API Key、个人数据或无权使用的数据。