SECTION 9 / 多 Agent 蜂群协作
攻壳机动队 Online
@ P2501
#攻壳机动队#塔奇克马协议#模拟游戏#Jev#蜂群Agent
[ 团队 ]
- 手工川wx: youshouldspeakhowgithub: lovstudio
[ 项目链接 ]
> 提交时间:2026/9/24 03:06:59
[ 项目介绍 ]
# 攻壳机动队 Online
**GHOST IN THE SHELL ONLINE** · SECTION 9 多 Agent 蜂群协作赛道 · P2501 Team · 非官方同人作品
在线体验:https://section9.lovstudio.ai/
## 做了什么
《攻壳机动队 Online》是一个手机扫码即玩的 3D 多人在线游戏,也是一个把多 Agent 协作规则摆上台面的实验场。新浜市 18 个电子脑里有 6 个被笑面男感染,8 台塔奇克马(侦察、解析、攻性、护卫)组成蜂群:没有中心调度,自己认领任务、交换线索、提议封锁。封锁不可逆,所以必须先经过另一台证据独立的塔奇克马复核;意见不合交第三方仲裁,房间里的人类玩家也能投票。
评委扫码可以扮演九课成员帮忙取证、修复倒下的塔奇克马,也可以扮演笑面男去 EMP、劫持、布置诱饵,亲手制造故障,看蜂群怎样接力。屏幕顶部是格斗游戏式的双血条:左边九课(在线塔奇克马,误封扣血),右边笑面男(剩余感染的电子脑),谁占上风一眼可见。
游戏之外还有一个真任务「潜网研究 Net Dive」:真实的 LLM 蜂群按同一套协议研究你给的点子,拆题、研究、独立复核、打回修订、仲裁、汇总,卡住时查 EvoMap,最后把研究策略蒸馏成 Gene,过了发布门槛才发到 EvoMap。
## 为什么
多 Agent 系统难的不是多开几个模型,而是四件平时看不见的事:谁来做(分工)、怎么说(通信)、说不拢怎么办(冲突)、有人掉线怎么办(故障)。它们埋在日志里,评委几分钟看不出来。
我们把每一条协议消息都做成游戏里看得见的东西:认领是光环,线索交换是两台塔奇克马之间的光束,分歧会弹出投票,倒下的塔奇克马冒着电火花,它的任务几秒后被别人接走。
## 塔奇克马协议
0. **发现与能力描述**:每台塔奇克马上线先广播 HELLO 能力卡(角色、扫描精度、速度、擅长任务),认领按能力卡匹配;任务中途可以「增援」一台新成员,它 HELLO 后同步已有线索与基因,立即开始认领(即插即用)。
1. **自主认领 + 租约**:空闲的塔奇克马按「角色适配 × 优先级 ÷ 距离」自己挑任务,认领带 5 秒租约、每秒心跳续约。多台抢同一任务,效用高者得,落败者收到 CLAIM_CONFLICT 另选。
2. **线索谱系 gossip**:每条观测带谱系,信念按独立来源计票。同一成员对同一节点的重复扫描、转发来的副本,都不算新证据,防止回声制造虚假共识。
3. **独立复核 + 分歧仲裁**:信念 ≥ 0.86 且至少 2 个独立来源才能提案;复核者既不能是提案者,也不能是该节点任何证据的来源,必须亲自去扫。不同意即 DISPUTE,由第三方(提案者、复核者和证据源都要回避)深度仲裁;房间里有九课玩家时同时开 8 秒投票,人类多数票可以否决封锁。
4. **故障接力**:倒下的成员不再心跳,租约过期,任务带着一半进度和线索回到黑板,被优先接管(TAKEOVER,中位约 5 秒)。不需要任何人「发现」它倒下了。
5. **权限与降级**:不可逆的封锁必须持有「票据」(提案者 · 复核者 · 信念),无票据或被隔离的成员请求一律 DENY;没有解析型在线时改为两名不同谱系成员交叉复核,存活少于 3 台进入保守阈值(DEGRADE),恢复后自动退出。
6. **EvoMap 基因**:遇到未知 ICE,先问通讯范围内的同伴,再查 EvoMap,最后才试错;试出来的破解法写成 Gene 随 gossip 扩散。
7. **並列化**:任务结束全体同步记忆,本局新 Gene 被下一局继承,后来者少走弯路。
8. **信誉与隔离**:读数与复核裁决或真相冲突的成员信誉下降,低于 0.35 被隔离、收回写权限并重启。不需要知道谁被劫持,只看它和独立证据的偏差。
这些规则全部以消息类型(HELLO / CLAIM / BEAT / GOSSIP / PROPOSE / AGREE / DISPUTE / ARBITRATE / VOTE / LEASE_EXPIRED / TAKEOVER / DENY / DEGRADE / EVOMAP_QUERY / GENE / QUARANTINE …)出现在实时协议日志里,关键时刻在大屏上弹出提示卡。同一套租约协议也用在多人联机的房主选举上。
## 怎么做
- **纯浏览器**:Vite + TypeScript + three.js,塔奇克马、城市、音乐全部程序生成并打包成约 1.4 MB 的静态站点(Vercel 边缘网络 + 七牛 CDN 镜像),运行时不依赖任何境外字体或脚本 CDN。
- **确定性模拟**:10Hz 确定性步进,世界状态是纯 JSON(连随机数状态都在里面)。
- **多人**:走公共 MQTT,房主权威;房主本身也用租约,掉线后其余客户端选出新房主,从最后一份快照接着跑。
- **Net Dive**:黑板、租约、复核、修订、仲裁在浏览器里跑,LLM 和 EvoMap 走 Vercel Serverless 代理,密钥只在服务端;研究员用 Sonnet 5、复核用 Haiku 4.5、盲评用另一家的 GPT-5.5。线路不通时自动回放一次真实录制,并明确标注。
## 单 Agent 与蜂群对照
同一 seed、同一张地图、同一套故障,只换组织方式:
- **单 Agent**:一个全能 Agent,扫描精度 0.88,比侦察型塔奇克马更准;但它只有一个上下文,越跑越贵,自己复查自己时误差相关;被击倒 20 秒后看门狗重启,上下文清零。
- **无协议蜂群**:8 台塔奇克马,没有租约、谱系和复核。
- **协议蜂群**:完整的塔奇克马协议。
4 个场景 × 3 种模式 × 每格 100 个 seed,准确率均值(95% 置信区间):
| 场景 | 单 Agent | 无协议蜂群 | 协议蜂群 |
|---|---|---|---|
| 无故障 | 92.3%(91.1–93.6) | 86.4%(84.7–88.1) | **98.8%**(98.4–99.3) |
| 2 台倒下 | 91.6%(90.4–92.7) | 80.6%(78.8–82.4) | **98.1%**(97.5–98.7) |
| 1 台被劫持 | 10.3%(9.5–11.2) | 85.9%(84.2–87.7) | **96.5%**(95.7–97.3) |
| 叠加故障 | 9.9%(9.1–10.8) | 80.4%(78.6–82.1) | **97.4%**(96.6–98.1) |
- **故障恢复**:2 台倒下时任务完成率,无协议蜂群 15%,协议蜂群 100%(用时 112 秒);单 Agent 靠看门狗重启也能完成,但用时 381 秒,且重启后上下文清零。
- **冤枉好人**:叠加故障下每局平均误封,无协议蜂群 1.38,协议蜂群 0.11。
- **速度与成本(无故障)**:单 Agent 用时 343 秒、估算 $0.181;协议蜂群用时 106 秒、估算 $0.089。继承上一局 Gene 后,协议蜂群用时缩短 9%。
- **真任务 Net Dive**(点子:用 AI 多 Agent 蜂群帮社区医院做夜间分诊,值得做吗?):蜂群用时 120 秒、花费 $0.20;单个强模型用时 22 秒、花费 $0.015;盲评蜂群 7 分、单模型 7 分;命中 EvoMap 条目 3 条。盲评 7:7 打平,按发布门槛(有基因须严格更好)这次没有把 Gene 发到 EvoMap,只存进本地基因库——宁可不发,也不往 EvoMap 灌水。
**取舍**:协议蜂群比单 Agent 快 3.2 倍、准确率高 6.5 个点,但比无协议蜂群慢 2.3 倍、多花 85% Token——多花的钱买的是复核与租约:误封从 1.58 降到 0.04,两台倒下后完成率 15% → 100%。
所有对照都能在「蜂群对比实验」页现场重跑,不是写死的数字。
## 如何体验
1. 手机或电脑打开 https://section9.lovstudio.ai/
2. **单人**:直接开始任务,可 1× / 2× / 4× 加速;点任意塔奇克马,看它的租约、信念和证据来源。
3. **多人**:电脑开房投到大屏,手机扫房间二维码,选九课成员或笑面男。
4. **蜂群对比实验**:在浏览器里现场重跑全部对照。
5. **潜网研究**:输入一个想验证的点子,看真实 LLM 蜂群研究、复核、查 EvoMap。
## 局限
- 游戏基准是对世界的建模:扫描精度、token 成本是设定值,能说明协议在这些假设下的结构性差异,不等于真实 LLM 系统的收益;美元数字均为估算。Net Dive 是真实任务,每次结果不同,盲评由 LLM 完成。
- 多人模式依赖公共 MQTT broker,它不可用时多人模式断开;单人、对照实验和 Net Dive 不受影响。
- 房主权威不防作弊;笑面男 AI 与台词是规则驱动的。
- 同人致敬作品:模型、界面、音效和海报背景均为原创或程序生成,未使用任何官方素材。
[ 演示视频 ]
时长 1:57
[ 项目图集 ]