继续保留
- 真实 7–8 轮用户工作流
- chat-only 与 tool action 交替
- 刷新、任务、扣费、引用 lineage 取证
- Product / Visual / System 盲审隔离
- 机械硬 Gate + 视觉 warning 两层裁决
Gate architecture review / evidence-led
Ego Lite Journey 目前不是“随便和 Agent 聊几轮”,而是一套真实产品操作、逐轮取证、独立复核和发布裁决流程。 Agent 已经切换到自动选工具、画布自主读取和显式 reference IDs;因此应保留真实长对话,但不再让五条 Journey 对每次小改动全量重跑。
它同时验证浏览器里的真实体验、Agent 的工具行为、异步任务与扣费事实,以及刷新后的持久化。任何单一日志或截图都不能替代整条证据链。
记录 commit、模型、协议、Prompt 版本、项目和测试用户。
按版本化自然语言逐轮发送,不暴露 shape ID、工具名或 ACK 术语。
截图、canvas JSON、Run/Event/Step、任务、扣费和引用 lineage。
刷新后复查消息、画布、任务卡;再 Fit All 获取完整构图。
Product、Visual、System 三名 Reviewer 只看各自证据。
机械合同决定 Gate;视觉成熟度默认只形成分数和 warning。
它能够发现“模型答对但后处理删错”“任务失败但前端一直转”“引用图实际没送到供应商”这类单元测试很难证明的问题。
点击展开可看到逐轮结构。标签表示我建议它在新体系中的位置,而不是它当前的文件状态。
Agent 能否把“公共文化感”这种审美语言落到一套主视觉,并在后续修订、说明卡和画布编排中保持同一方向。
对话合适,保留 v2。 与 Consumer Brand 的流程重复度较高,不应成为每次发布的必跑项;创意方向、视觉生成或模型更换时再触发。
这是当前最重要的“图片作为上下文”Journey:用户把图拖进输入框,Agent 要看懂老相机、忽略红鞋,并让产品和包装始终引用正确的当前项目素材。
升级为 v3。 对话基本不变,但 Gate 必须明确验证 durable attachment、`referenceIds` 选择和 provider request lineage;“Prompt 里提到参考图”不算证据。
验证 Agent 像一个谨慎的画布操作者:自主 `read_canvas`,找到正确 shape,做最小修改,不生成、不删除、不顺手改动其他元素。
升级为 v5,但用户对话可基本原样保留。 删除“数据库必须记录临时 selection”的取证期待;selection 用工具事件 + 浏览器状态证明。继续禁止把 shape 几何误称为图片像素。
验证任务失败时 Agent、数据库、扣费和前端能否对同一事实达成一致;用户没授权时不能悄悄创建第二个付费任务。
升级为 v2。 区分“同一个 generation task 内的基础设施 attempt 重试”和“创建新的付费 generation task”。前者交给 fault-injection 层,后者才由 Journey 验证用户授权。
这是最接近公司设计师真实长任务的一条:同一品牌跨四种交付面,考验持续记忆、引用选择、品牌约束和最终讲述顺序。
保留为里程碑 Gate。 一次真实记录包含 8 轮、4 个付费任务、78,615 输入 token 和 32 credits,不适合每个 Prompt 小改都跑。
这里把“测试对话是否自然”和“Gate 是否仍然能证明正确事情”分开判断。
`delete_shape` 和 `create_character` 仍存在于少量 legacy schema / display 兼容代码中,但已经不在当前 Agent tool registry、Prompt 和 Journey 能力面里。它们是清理债务,不应重新进入 Gate。
矩阵显示 Stadium 与 Consumer 的结构高度相似;Museum、Precise、Provider 各自拥有不可替代的证明面。
| 能力 | Stadium | Museum | Precise | Provider | Consumer | 更便宜的前置层 |
|---|---|---|---|---|---|---|
| 自动工具选择 | ✓ | ✓ | ✓ | ✓ | ✓ | Live fast Eval |
| 外部上传图片可见 | — | 核心 | 选中图 | — | — | Attachment probe |
| reference 0 / 1 / N 选择 | 1 | 核心 | 补充 probe | — | 连续多图 | Live fast Eval |
| 精确画布编辑 | 排版 | 排版 | 核心 | 排版 | 排版 | Sandbox |
| 失败 / 重试 / 退款 | — | — | — | 核心 | 自然故障 | Fault injection |
| 品牌跨交付面一致性 | 主视觉 | 产品+包装 | — | — | 核心 | 无等价自动层 |
| 视觉成熟度迭代 | 核心 | 核心 | 布局 | 最终板 | 核心 | 只可人工复核 |
Ego Lite 仍然是最终真实体验的证据工具,但它应位于测试金字塔顶部。
直接请求 DeepSeek + Responses,验证 chat-only、图片、视频、英文、中文、referenceIds 和参数 schema;不执行付费工具。
每次 Prompt / tool description / 模型改动用 canned tool result 验证 read → edit、错误后重试、结果消费和 bounded loop;不碰浏览器、画布或供应商。
runtime / protocol / loop 改动只跑与变更直接相关的一条 Journey,保留真实浏览器、数据库、任务、扣费、刷新和三类复核。
准备发布相关能力Consumer Brand 等长任务用于框架切换、底层模型切换或重大版本;不是每个 commit 的门禁。
Agent V2 / 模型 / 架构里程碑这部分现行合同已经基本正确,建议原样保留。
下面不是假设,而是本地冻结证据中的实际结果;其中两项已被当前 main 修复。
DeepSeek 原文正确识别旧参考图,但旧后处理因为同句含 320×320 和坐标而删掉整个语义。PR #413 已移除这类整句裁切。
旧实现曾在 tool 参数之外用 continuity 逻辑替 Agent 猜参考图。现在 `generate_image` / `generate_video` 由模型显式选择稳定 `referenceIds`。
浏览器显示选中、工具事件成功,但数据库 canvas checkpoint 没有临时 selection。产品决定:这不是产品缺陷,也不需要为了 Eval 强行持久化。
最近一轮 Turn 6 截图被其他浏览器任务覆盖,说明当前 Ego Lite 执行仍较依赖操作者纪律。Gate 运行前必须预建 manifest 并检查证据完整性。
不建设新的 Eval 平台,不引入 LLM Judge,不把 Journey 变成复杂 DSL。
Museum v3、Precise v5、Provider v2;Stadium v2 和 Consumer v1 对话不动,只改变触发级别。
Prompt/tool/model → L1;loop/runtime → L2;reference/canvas/workflow → 对应 L3;框架与模型大切换 → L4。
开始前要求 commit/provider/protocol 非空;结束时检查规定的截图、canvas、Run/Step/Task/credit 文件齐全。不要自动替操作者生成结论。
目前样本量和 Reviewer 稳定性不足,新增平台只会放大不可靠判断。
Recommended operating rule
五条 Journey 不是废掉,而是从“每次都跑的套餐”变成“按风险选择的能力库”。这样既保留真实用户场景,也避免为了省时间删掉关键证据,或为了全绿继续制造过拟合 Gate。