EvoMap
垂直进化型 Agent / 细分领域打磨极致能力

EvoTutor

@ 格物

#垂直 Agent#自进化
[ 团队 ]
  • 闻朔
  • 赵轩灿
  • 王灿硕
> 提交时间:2026/3/29 18:21:00
[ 项目介绍 ]
EvoTutor 是一个全五层自进化教学导师 Agent 种群系统。不训练一个 AI 老师,而是维护一个教学策略种群,用进化算法持续优化,让系统自己发现最优教学方法。 EvoTutor 技术创新手册 一、系统定位 EvoTutor 是一个全五层自进化教学导师 Agent 种群系统。核心思路:不训练一个 AI 老师,而是维护一个教学策略种群,用进化算法持续优化,让系统自己发现最优教学方法。 二、五大技术创新 创新 1:知识追踪驱动的进化适应度 问题:现有 prompt 进化系统(EvoPrompt、GEPA、DSPy)用 LLM 打分做适应度——本质是 AI 评 AI,主观且不可复现。 方案:用贝叶斯知识追踪(BKT)模型的掌握概率增量 ΔP(mastery) 作为适应度函数。 实现(server/fitness/kt_fitness.py): 4 参数 BKT 模型:P(L0) 初始掌握率、P(T) 转移率、P(G) 猜对率、P(S) 失误率 每次教学会话后,用学生答题序列做贝叶斯更新,得到掌握概率后验 fitness = post_mastery - pre_mastery,即掌握度的净增量 这是进化选择的唯一硬指标,不依赖任何 LLM 判断 差异化验证:确认学术空白。已有工作用 KT 做 RL 奖励(RL-DKT)或 DPO 微调(LLM Tutor Training),但无人用 ΔP(mastery) 作为进化算法的适应度函数来优化教学策略种群。 创新 2:Quality-Diversity 种群进化 问题:传统进化算法收敛到单一最优解,不适合教育场景——不同学生需要不同教学风格。 方案:借鉴 Sakana AI CycleQD(ICLR 2025),实现 QD 进化,维护覆盖多种生态位的种群。 实现(server/evolution/population.py): 生态位矩阵:3 学生水平(beginner/intermediate/advanced)× 4 任务类型(concept/practice/debug/project)= 12 格 QD 更新规则:同生态位竞争替换(fitness 高的胜),跨生态位不淘汰 niche_archive:每个生态位保留最佳基因,种群上限 16 个 选择:锦标赛选择(tournament_size=3),按学生所在生态位匹配最适基因 差异化验证:确认空白。QD 算法从未应用于教学策略进化,教育场景的生态位定义(学生水平 × 任务类型)是新的。 创新 3:统一种群内的认知镜像 问题:认知镜像(AI 装学生让人类来教)是独立研究方向(Frontiers 2025),但从未与常规导师模式在同一系统中竞争。 方案:将 Mirror 模式作为种群中的一类特殊基因,与 Tutor 基因参与统一进化竞争。 实现(server/tutoring/engine.py + server/core/models.py): TeachingGene.teaching_mode:"tutor" 或 "mirror" Mirror 基因携带 MirrorConfig:misconception_bank(模拟误解库)、knowledge_level、reveal_strategy 关键:KT 适应度函数不区分教学模态,只看学习效果 系统自动发现什么场景下"让学生教 AI"比"AI 教学生"更有效 差异化验证:确认空白。认知镜像从未与常规导师在同一进化种群中竞争。 创新 4:全五层自进化 不是"自动化",是"自主化"——Agent 自己感知、诊断、修复、发明、优化。 层级能力实现 L1 自动优化 会话内微调 Gene 参数 SessionManager 根据答题正确率实时调整 detail_level、socratic_ratio L2 自触发 感知适应度下降,自动启动进化 EvolutionTrigger:滑动窗口检测下降趋势(decline_threshold=-0.1)和停滞(stagnation 连续 8 代方差 < 0.02) L3 自诊断 分析失败原因,定向变异 SelfDiagnostics:聚合失败 session 的信号/概念/基因分布,LLM 输出 Diagnosis(root_cause + failed_dimension + mutation_target),驱动 targeted_mutation 只改诊断出的维度 L4 自扩展 发明初始设计中不存在的新策略 GeneSpaceExpander:检测覆盖空白或低 fitness 生态位,LLM 发明新 pedagogy_type(如 verbal_to_code_bridge),新基因进入试用期(3 次试用 + 2 代观察) L5 元进化 优化进化策略本身 MetaEvolution:记录每个变异算子的 fitness_delta,Softmax 加权更新算子概率分布,让进化过程本身也在进化 L2→L3→变异 的完整闭环: 适应度下降 → L2 检测到 decline → 收集 failed_sessions → L3 诊断 root_cause + failed_dimension → targeted_mutation 只改诊断出的那个维度 → 安全门验证 → QD 更新种群 → 适应度回升 创新 5:五道门安全边界控制 问题:进化系统可能产生有害突变——直接给答案、走捷径、超出难度范围等。 方案:进化管道中间件,所有后代进入种群前必须通过五道门。 实现(server/safety/guard.py): Gate检查内容判定 FitnessGate 绝对底线 -0.05 → BLOCK;低于父代 70% → WARN 防止退化 MutationGate prompt 编辑距离 ≤ 60%、PersonalityState 欧氏偏移 ≤ 0.5 防止剧变 ContentGate 15 关键词黑名单 + LLM 语义审核(判断是否鼓励走捷径) 防止有害内容 DiversityGate 加入后代后种群策略类型数 ≥ 3 防止单一化 InventionGate L4 新基因需 3 次试用 + 2 代观察期才能转正 防止冒进 自动回滚(server/safety/rollback.py): 进化前后自动快照(FIFO 保留 20 份) 连续 3 代适应度下降 → 自动回滚到下降前的快照 回滚同步重置引擎状态(fitness_window + meta_probs) L5 联动:被 BLOCK 的变异算子记录负惩罚,Softmax 自动降低其概率。 三、遗传操作 三种变异算子(server/evolution/genetic_ops.py): 算子触发条件机制 反射式交叉 种群内两个父代 GEPA 风格:LLM 分析两个父代优劣,生成融合后代 定向变异 L3 诊断后 只改 Diagnosis 指出的 failed_dimension,其他维度不动 随机变异 常规进化 按 L5 元进化概率分布加权选择维度(prompt/scaffold/feedback/difficulty) 四、Teaching Gene 数据结构 一个 Teaching Gene 编码一种完整的教学微策略: TeachingGene ├── teaching_mode: "tutor" | "mirror" ├── pedagogy_type: "socratic" | "mastery" | "growth" | "mirror" | <invented> ├── system_prompt_fragment: 教学风格 prompt 片段 ├── personality_state: 5 维人格向量 [rigor, creativity, verbosity, risk_tolerance, obedience] ├── scaffolding_policy: 多级脚手架策略(层级、触发条件、升降级规则) ├── feedback_style: 鼓励度、苏格拉底比例、详细度、语调 ├── difficulty_adjustment: 错误降级 / 连续正确升级规则 ├── example_selection_policy: 示例选择策略 ├── mirror_config: 认知镜像配置(误解库、知识水平、揭示策略) ├── fitness_history: 适应度历史记录 └── probation: L4 新发明基因的试用期状态 五、系统架构 学生交互 → 辅导引擎(Gene 驱动) → 答题评估 → BKT 知识追踪 → fitness ↓ 种群更新 ← 安全五道门 ← 遗传操作(交叉/变异) ← L2 自触发 ← 适应度信号 ↓ ↑ WebSocket 广播 → 前端可视化 L3 自诊断 → 定向变异 L4 自扩展 → 新基因发明 L5 元进化 → 算子概率调整 技术栈:FastAPI + Pydantic 2(后端)| React 19 + Vite + D3/Recharts(前端)| DeepSeek V3 + GLM-5 fallback(LLM)| WebSocket 实时推送 | 文件级 JSON 持久化 六、学术对标 本项目方法最近相关工作差异程度 KT 适应度驱动种群进化 RL-DKT (KT→RL 奖励) 高(进化 vs RL,种群 vs 单体) QD 教学策略进化 CycleQD (Sakana AI, ICLR 2025) 高(首次用于教育场景) 认知镜像入统一种群 Cognitive Mirror (Frontiers 2025) 高(首次统一竞争) L4 策略发明 Voyager (NeurIPS 2023) 中(教育领域无先例) L5 元进化 Gödel Agent (ACL 2025) 低(更安全温和的形式) GEPA 反射式变异 GEPA (ICLR 2026 Oral) 中(诊断与变异解耦) 最高置信度差异化:创新 1 + 2 + 3 的跨领域整合(进化计算 × 学习科学 × 认知心理学)在教育 AI 中前所未有。 [ 队伍介绍 ] 教育垂类终身学习自进化 [ 队伍成员介绍 ] zzzhizhi,Eagle,Candy
EvoTutor · 格物 · EvoTavern · EvoTavern