The Pearl / 智能体自进化
PaperSwarm
@ 日日新
#学术评审#多智能体#自进化#蜂群协作#可追溯
[ 团队 ]
- 乔瑞雪
- 有些急性子
> 提交时间:2026/6/21 03:47:30
[ 项目介绍 ]
PaperSwarm 是一个面向中文学术论文的多智能体评审系统。它不是让一个大模型假装多个专家串行表演,而是先解析论文类型,再按需组建独立评审角色:基础角色包括主编、方法论专家、领域专家、魔鬼代言人;医学 RCT 会额外加入统计审稿人和伦理审稿人,计算机实验论文会额外加入复现审稿人。每个角色在独立上下文中评审,最后汇聚到冲突检测、裁决建议、P0/P1/P2 修改计划与经验沉淀。
项目要解决的问题是:传统 AI 论文评审通常只有单一视角,容易给出“逻辑不清晰”“建议补充实验”这类泛泛建议,却很难暴露真正导致拒稿的关键缺陷。真实学术评审往往需要多个专家视角:统计专家能看出置信区间与 p 值是否自洽,伦理专家能检查试验注册、伦理批件和利益冲突,复现专家能判断实验对比是否在同一环境下成立。PaperSwarm 把这些专家视角组织成一个可运行、可追踪、可复用的评审蜂群。
当前 Demo 已缓存医学、计算机、教育学多个真实 run,演示不依赖现场实时调用 LLM。以医学 RCT 案例为例,系统自动识别其为涉人体临床试验,并按需加入统计审稿人与伦理审稿人。统计审稿人与魔鬼代言人在独立上下文中共同发现主终点置信区间与 p 值不自洽;伦理审稿人则发现试验注册号、伦理批件号、利益冲突声明缺失等临床研究关键风险。这个案例说明 PaperSwarm 的核心价值:致命问题往往只有对应专家才看得见。
技术实现上,PaperSwarm 基于 Flowtrace 描述 13-step DAG:structure 解析论文并输出 reviewer_set;多个 review_* 节点并行产出独立评审报告;conflict 汇聚多角色意见并识别共识与分歧;advice 生成优先级修改计划;revise 进入 Worker/Verifier 修订验收;archive 与 publish 负责经验沉淀和资产封装。所有中间产物都落盘为 Markdown 或 JSON,评委可以逐步打开验证,而不是只看到一个最终回答。
PaperSwarm 的创新点有三点:第一,按论文类型自动组队,医学、CS、教育学不使用同一套固定角色,而是根据论文方法和风险选择真正需要的专家;第二,真多角色独立评审,每个角色独立上下文产出判断,再由 conflict 节点汇聚,避免单模型在同一上下文里自我和谐;第三,评审经验可沉淀,一次评审不是一次性文本输出,而是可以被归档、召回、封装和复用的结构化经验资产。
目标用户是高校教师、研究生、科研人员和学术写作服务机构。中文学术写作有独特规范和痛点,通用写作工具通常只能做润色或查错,难以模拟一个多专家审稿委员会。PaperSwarm 更适合投稿前自检、导师指导前预评审、学术写作课程和研究团队内部质量门。
当前系统已完成 13-step DAG 验证,医学、计算机、教育学多个案例已缓存,Flowtrace 可视化、评审报告、冲突报告、修改计划与经验沉淀证据均已落盘。真人在环裁决与完整事件采集已预留接口,是下一阶段产品化重点。
一句话总结:PaperSwarm 不是聊天机器人,而是按论文类型自动组队的学术评审蜂群,让独立专家角色找出单一审稿人看不见的关键缺陷,并把这次评审经验沉淀给下一篇论文。
[ 项目图集 ]