把 Agent 的进化,变成可观察的实验
Genesis v2 让 Agent 学习不再是黑箱 —— 每一代完成任务、接受反馈、获得能量,再带着更有效的策略进入下一轮。
把学习拆成可观察的阶段 —— 每一代的选择、反馈与能量分配,都留下可回看的痕迹。
Genesis v2 是一个 Agent 演化实验平台:每一代完成任务、接受语言模型反馈、获得能量,再把更有效的策略带进下一轮。
它关注的不是一次回答对不对,而是反馈、选择和记录如何让策略逐步变化。仪表盘把这条实验过程变成可观察的轨迹。

03 / SIGNAL — EVOLUTION LOOP
每一代 Agent 都会留下选择、反馈和能量分配;系统从这些痕迹里筛出下一次跃迁。
OBSERVE → JUDGE → REWARD → EVOLVE
不是答案变强, 而是策略在进化。
核心能力
每一项能力都对应产品流程里的一个明确环节,不是功能堆砌。
4 阶段能力进化
把学习、推理、规划和自主决策拆成可观察的阶段,记录每一代 Agent 如何经过这些步骤 —— 进化不是黑箱,每一步都能回看与对比。
LLM Judge 中文评分
用语言模型给出中文反馈与改进方向,让每次评估都能回到下一轮实验。
能量奖励机制
把表现转化为能量分配,让不同策略在后续实验中获得不同的延续机会。
Elite Survivors
保留值得继续观察的策略与轨迹,为后续实验和数据整理留下可回看的样本。
演进时间线
从立项到当下,每个节点对应一次真实的交付与决策。
2024.Q3
Genesis v1
Python 基础 Agent 循环 + 简单规则评分。验证『多代进化 + LLM Judge』可行性。
2024.Q4
LLM Judge 接入
语言模型作为裁判,输出中文评分与改进建议;提示词、评分结果和下一轮策略都会留下可回看的实验记录。
2025.Q1
Genesis v2 仪表盘
用 Plotly 展示代际能力曲线与 Survivor 池,把实验过程、选择结果和策略变化放到同一个观察界面。
2025.Q2+
Survivor 公开数据集
整理 Elite Survivor 的策略、评分与进化轨迹,为后续研究和复现实验保留结构化样本。
技术栈
支撑这个项目跑起来的每一层选型。
数据剖面
这些数字记录项目的真实投入与边界 —— 不是营销话术,是可追溯的工程事实。
0 个
观察阶段
学习 / 推理 / 规划 / 自主决策,每代可回看
0 个
实验核心环节
反馈 / 选择 / 能量分配
0 条
可视化演化轨迹
仪表盘展示代际能力曲线
0 个
持续实验的研究平台
Survivor 数据集整理中
数据剖面
这些数字记录项目的真实投入与边界。
0 个
观察阶段
学习 / 推理 / 规划 / 自主决策,每代可回看
0 个
实验核心环节
反馈 / 选择 / 能量分配
0 条
可视化演化轨迹
仪表盘展示代际能力曲线
0 个
持续实验的研究平台
Survivor 数据集整理中