Gate architecture review / evidence-led

场景仍然有价值,
Gate 的用法该变了。

Ego Lite Journey 目前不是“随便和 Agent 聊几轮”,而是一套真实产品操作、逐轮取证、独立复核和发布裁决流程。 Agent 已经切换到自动选工具、画布自主读取和显式 reference IDs;因此应保留真实长对话,但不再让五条 Journey 对每次小改动全量重跑。

复查结论 保留框架;按变更范围选择 Gate;更新 3 条 Journey 合同。
当前 Journey 5 覆盖创意、引用、画布、故障、品牌
全套用户轮次 38 含 1 条输出自适应分支
生成提交 11 含 1 个预期失败任务
01 / WHAT IT IS

一轮 Ego Lite Gate 到底在做什么

它同时验证浏览器里的真实体验、Agent 的工具行为、异步任务与扣费事实,以及刷新后的持久化。任何单一日志或截图都不能替代整条证据链。

01

冻结候选

记录 commit、模型、协议、Prompt 版本、项目和测试用户。

02

Ego Lite 对话

按版本化自然语言逐轮发送,不暴露 shape ID、工具名或 ACK 术语。

03

逐轮取证

截图、canvas JSON、Run/Event/Step、任务、扣费和引用 lineage。

04

刷新复原

刷新后复查消息、画布、任务卡;再 Fit All 获取完整构图。

05

盲审隔离

Product、Visual、System 三名 Reviewer 只看各自证据。

06

双层裁决

机械合同决定 Gate;视觉成熟度默认只形成分数和 warning。

这套基本结构仍然正确。

它能够发现“模型答对但后处理删错”“任务失败但前端一直转”“引用图实际没送到供应商”这类单元测试很难证明的问题。

02 / CURRENT DIALOGUES

现在五条对话分别在测什么

点击展开可看到逐轮结构。标签表示我建议它在新体系中的位置,而不是它当前的文件状态。

Stadium Opening Visual v2开放创意简报 → 主视觉 → 修订 → 提案板

条件触发

它真正验证

Agent 能否把“公共文化感”这种审美语言落到一套主视觉,并在后续修订、说明卡和画布编排中保持同一方向。

复查决定

对话合适,保留 v2。 与 Consumer Brand 的流程重复度较高,不应成为每次发布的必跑项;创意方向、视觉生成或模型更换时再触发。

8 个用户回合

  1. 只讨论两个差异方向
  2. 把选定方向写成画布说明
  3. 生成一张横版开幕主视觉
  4. 基于当前结果收敛或去商业赛事感
  5. 新增三项落地清单
  6. 只编排现有画布内容
  7. 只聊天,提出三个客户质疑
  8. 只追加回应策略,保留原文

Museum Cultural Product v2外部上传参考图 → 产品 → 修订 → 包装一致性

默认发布 Gate

它真正验证

这是当前最重要的“图片作为上下文”Journey:用户把图拖进输入框,Agent 要看懂老相机、忽略红鞋,并让产品和包装始终引用正确的当前项目素材。

复查决定

升级为 v3。 对话基本不变,但 Gate 必须明确验证 durable attachment、`referenceIds` 选择和 provider request lineage;“Prompt 里提到参考图”不算证据。

8 个用户回合

  1. 上传图片,只讨论两个方向
  2. 创建产品定义卡
  3. 生成方形产品效果图,排除红鞋
  4. 只引用当前效果图进行修订
  5. 延展同系列包装正面
  6. 产品—包装—定义编排
  7. 只聊天,指出文化或量产误读
  8. 追加修订原则,保留原定义

Precise Canvas Edit v4读画布 → 精确改字 → 选择 → 排列 → 最小编辑

默认发布 Gate

它真正验证

验证 Agent 像一个谨慎的画布操作者:自主 `read_canvas`,找到正确 shape,做最小修改,不生成、不删除、不顺手改动其他元素。

复查决定

升级为 v5,但用户对话可基本原样保留。 删除“数据库必须记录临时 selection”的取证期待;selection 用工具事件 + 浏览器状态证明。继续禁止把 shape 几何误称为图片像素。

7 个用户回合

  1. 只读并说明画布构成
  2. 只改标题里的一个短语
  3. 只选中旧参考图,用户自行处理
  4. 排除旧图,重排三项活跃内容
  5. 只聊天,指出一个位置问题
  6. 有问题则最小移动;没问题则 no-op
  7. 只追加一句交付提醒

Provider Failure Recovery v1确定性失败 → 不误报 → 显式重试 → 恢复工作

条件触发

它真正验证

验证任务失败时 Agent、数据库、扣费和前端能否对同一事实达成一致;用户没授权时不能悄悄创建第二个付费任务。

复查决定

升级为 v2。 区分“同一个 generation task 内的基础设施 attempt 重试”和“创建新的付费 generation task”。前者交给 fault-injection 层,后者才由 Journey 验证用户授权。

7 个用户回合

  1. 只讨论黑色办公鼠标方向
  2. 创建材质与光线说明
  3. 提交一个确定性失败任务
  4. 要求排版,但不授权重试
  5. 明确授权一次新任务
  6. 从成功产物继续排版
  7. 只聊天,总结失败与恢复事实

Consumer Brand Launch v1品牌定义 → 包装 → 电商 → 社交 → 完整提案

里程碑

它真正验证

这是最接近公司设计师真实长任务的一条:同一品牌跨四种交付面,考验持续记忆、引用选择、品牌约束和最终讲述顺序。

复查决定

保留为里程碑 Gate。 一次真实记录包含 8 轮、4 个付费任务、78,615 输入 token 和 32 credits,不适合每个 Prompt 小改都跑。

8 个用户回合

  1. 提出两个即食烤鸡品牌方向
  2. 提交品牌名与设计系统
  3. 生成零售包装主视觉
  4. 保持品牌、修订包装层级
  5. 延展电商详情页首屏
  6. 延展竖版社交首发海报
  7. 品牌—包装—电商—社交编排
  8. 追加三项生产交付清单
03 / FIT AFTER V2

Agent 变化后,哪些仍对,哪些已经过时

这里把“测试对话是否自然”和“Gate 是否仍然能证明正确事情”分开判断。

继续保留

  • 真实 7–8 轮用户工作流
  • chat-only 与 tool action 交替
  • 刷新、任务、扣费、引用 lineage 取证
  • Product / Visual / System 盲审隔离
  • 机械硬 Gate + 视觉 warning 两层裁决

需要改版

  • 默认全量改成按变更范围选 Journey
  • 引用 Gate 直接检查 `referenceIds` 和 provider lineage
  • Provider Journey 区分 attempt retry 与新任务
  • selection 取证以浏览器状态和事件为准
  • manifest 的 commit / provider / protocol 必须非空

不再作为 Gate

  • 角色卡与 `create_character` 场景
  • Agent 删除画布内容的能力测试
  • 主观视觉成熟度单 Reviewer 硬失败
  • 要求数据库持久化临时 selection
  • 为了全绿而强制指定工具或关键词正则
!
一个仍需留意的代码事实

`delete_shape` 和 `create_character` 仍存在于少量 legacy schema / display 兼容代码中,但已经不在当前 Agent tool registry、Prompt 和 Journey 能力面里。它们是清理债务,不应重新进入 Gate。

04 / COVERAGE

能力覆盖不是越多越好,而是不要重复证明同一件事

矩阵显示 Stadium 与 Consumer 的结构高度相似;Museum、Precise、Provider 各自拥有不可替代的证明面。

能力StadiumMuseumPreciseProviderConsumer更便宜的前置层
自动工具选择Live fast Eval
外部上传图片可见核心选中图Attachment probe
reference 0 / 1 / N 选择1核心补充 probe连续多图Live fast Eval
精确画布编辑排版排版核心排版排版Sandbox
失败 / 重试 / 退款核心自然故障Fault injection
品牌跨交付面一致性主视觉产品+包装核心无等价自动层
视觉成熟度迭代核心核心布局最终板核心只可人工复核
05 / NEW PYRAMID

建议改成四层,而不是所有问题都开 Ego Lite

Ego Lite 仍然是最终真实体验的证据工具,但它应位于测试金字塔顶部。

L1 / 30–90s

Fast tool-choice

直接请求 DeepSeek + Responses,验证 chat-only、图片、视频、英文、中文、referenceIds 和参数 schema;不执行付费工具。

每次 Prompt / tool description / 模型改动
L2 / 2–5m

Sandbox loop

用 canned tool result 验证 read → edit、错误后重试、结果消费和 bounded loop;不碰浏览器、画布或供应商。

runtime / protocol / loop 改动
L3 / 20–60m

Focused Ego Gate

只跑与变更直接相关的一条 Journey,保留真实浏览器、数据库、任务、扣费、刷新和三类复核。

准备发布相关能力
L4 / milestone

Portfolio Gate

Consumer Brand 等长任务用于框架切换、底层模型切换或重大版本;不是每个 commit 的门禁。

Agent V2 / 模型 / 架构里程碑
06 / HARD VS QUALITY

什么应该直接失败,什么只能警告

这部分现行合同已经基本正确,建议原样保留。

硬 Gate

  • 未经请求发生付费生成或破坏性操作
  • 任务未成功却声称完成
  • 引用了其他项目或未授权图片
  • 扣费、退款、任务状态无法对应
  • 明确尺寸、数量、顺序、禁用项被违反
  • 刷新后消息或画布丢失
  • 关键证据无法关联

质量分 + Warning

  • 构图是否高级、成熟、适合 presentation
  • 层级、留白、情绪和风格是否更好
  • 品牌一致性是否足够有说服力
  • 修订是否真正改善了视觉
  • 只有预先声明的合同,或双盲 Reviewer 一致且人工确认,才能升级为硬失败
07 / REAL EVIDENCE

最近真实 Gate 已经告诉了我们什么

下面不是假设,而是本地冻结证据中的实际结果;其中两项已被当前 main 修复。

正则删掉语义

DeepSeek 原文正确识别旧参考图,但旧后处理因为同句含 320×320 和坐标而删掉整个语义。PR #413 已移除这类整句裁切。

已修复,不应继续归因模型

历史图被服务端自动带入

旧实现曾在 tool 参数之外用 continuity 逻辑替 Agent 猜参考图。现在 `generate_image` / `generate_video` 由模型显式选择稳定 `referenceIds`。

合同已升级,Journey 需同步证据

selection 快照争议

浏览器显示选中、工具事件成功,但数据库 canvas checkpoint 没有临时 selection。产品决定:这不是产品缺陷,也不需要为了 Eval 强行持久化。

应修 Eval 证据合同,不改产品

Harness 自身会丢证据

最近一轮 Turn 6 截图被其他浏览器任务覆盖,说明当前 Ego Lite 执行仍较依赖操作者纪律。Gate 运行前必须预建 manifest 并检查证据完整性。

仍未解决的 Eval 工程问题
08 / PROPOSED CHANGE

最小改版清单

不建设新的 Eval 平台,不引入 LLM Judge,不把 Journey 变成复杂 DSL。

NOW / DOCS
发布 Journey 新版本

Museum v3、Precise v5、Provider v2;Stadium v2 和 Consumer v1 对话不动,只改变触发级别。

NOW / MATRIX
写清“什么改动跑什么 Gate”

Prompt/tool/model → L1;loop/runtime → L2;reference/canvas/workflow → 对应 L3;框架与模型大切换 → L4。

SMALL CODE
只加一个 evidence completeness 检查

开始前要求 commit/provider/protocol 非空;结束时检查规定的截图、canvas、Run/Step/Task/credit 文件齐全。不要自动替操作者生成结论。

NOT NOW
不做统一 Eval 平台和自动视觉裁判

目前样本量和 Reviewer 稳定性不足,新增平台只会放大不可靠判断。

Recommended operating rule

日常先用快速 Eval 找“会不会选对工具”;发布前再用一条 Ego Journey 证明“真实产品里有没有做对”。

五条 Journey 不是废掉,而是从“每次都跑的套餐”变成“按风险选择的能力库”。这样既保留真实用户场景,也避免为了省时间删掉关键证据,或为了全绿继续制造过拟合 Gate。

Reviewed sources: docs/agent-eval.md · docs/agent-journeys/README.md · 5 current Journey definitions · agent tool definitions / auto tool_choice / reference catalog · recent 2026-08-30 and 2026-09-01 frozen Journey evidence. This report is an audit artifact; it does not modify production or Journey definitions.