Skip to content

第二个任务(Minecraft 网页复刻)上的两组复验——锚定(工具面)与提示词注入,含思维链指纹分布观察与同形态复测 #3

Description

@lscatfish

背景

贵仓库《DeepSeek V4 Pro/Flash 轨迹触发机制实验》(docs/v4.1/DEEPSEEK_V4_TRIGGER_MECHANISM_EXPERIMENTS_20260814.md)的"已证明 / 未证明"部分提出:n=2 的同题复现不足以证明跨任务普适,建议用结构不同的新仓库检验跨题泛化。按此建议,我在另一个任务(从零复刻网页版 Minecraft,Web 前端图形密集,与 Project2 的嵌入式维护工程结构不同)上完成 12 个会话复验(11 个配置各异 + 1 个 UP 的同形态复测),并于 2026-08-16 对全部生成结果逐一实机回测(评级与代码层分析分离,实测记录独立成文)。

结论

先说清实验与分数的来路(详细定义见"实验设置"节):12 个会话在同一任务(从零复刻网页版 Minecraft)上运行,其中 11 个会话配置各异,另有 1 个是"UP 配置的同形态复测",记为 UP2——UP2 与 UP 使用逐字节相同的预设(upstream 形态:首轮只给 [bash, str_replace_editor] 两个工具,晋升后仍为低注入小工具面),只是另开一个会话重跑一次。全部会话于 2026-08-16 由用户逐一实机游玩回测,按细则打分制(14 项功能项 2/1/0 档,N/A 剔除折算,模式未说明默认创造)评出百分制分数(如 UP=85.7、UP2=42.9,含义即"该会话产物的实机可玩性评分")。

基于上述实测与回测,本实验的结论均为描述性观察(在各自初始条件下指纹分布的呈现),不归因因果、不评价其他实验:

  1. 思维链指纹分布可复现、且与初始条件共现:不同首轮/晋升工具面与注入内容下,会话指纹(we/I 家族短语、let_me、potential 等)呈现不同的分布特征——we 型(UP/UP2/B2/B3/T2/BB)、I 型(B1/T1/T3/B+T/PA)、中间带(RL);同形态两次运行指纹一致(UP/UP2:let_me 均 2、we 家族 3.32/4.31、potential 1.46/1.41)。
  2. 轨迹 ≠ 质量:轨迹最纯的会话(BB:let_me=6、we 家族 566)实机不可玩(20.8 分);轨迹最散的 B1(let_me=128)86.8 分好档;UP2 同形态复测把反例推到极限——与 UP 同预设、同轨迹、同指纹,实机评分 85.7 vs 42.9(UP2 贴图一坨 + 区块渲染约一半失败)。语言轨迹/行为方式的改变不传导到工程质量("两轴独立"是本实验最强归纳)。
  3. 锚定与质量有正向共现倾向,不能证明充分提升:好档 3/4 在锚定组(B1/UP/B3),但 BB(同锚定)20.8 分、UP2(与 UP 同形态)42.9 分等反例排除充分性。
  4. 提示词注入是"行为开关",不是"质量开关":锚点消息注入生效(T2 we 型全程)、写进系统提示不生效(T3)、B 契约(禁 let me)抗性大于 A 契约(we 引导)——但风格最成功的 T2 实机贴图 bug 照旧。

以上结论的具体证据见"核心发现"节;全部数字口径见"评分表"与"轨迹指标"节。

局限

本实验为单次观测,结论仅作方向性参考,不作为统计结论:

  • 每配置 n=1(UP 配置例外为 n=2):11 个配置每个只跑了一轮,无法排除偶然因素;UP(upstream 形态)额外跑了第二次(UP2,同形态复测)——轨迹/指纹完全复现而质量未复现,恰好提供了"偶然性作用于质量而非轨迹"的一次观测。若要确认任何发现,需要同一配置更多轮重复(建议 n≥3)检验偶然性;
  • 非随机分配、评级为主观序数(已按细则打分制替代,见"评分表"节)、Full access 开启时机未完全控制、部分会话存在中断/路径事故等混杂;
  • 任务为许愿式生成(指令层无工程脚手架、环境层有用户预装 MCP/Skill 脚手架),不代表其他任务。

实验设置:两组研究 + 完整工况表

12 个会话构成两组研究(缩写对照:UP = upstream 形态预设会话;UP2 = 同预设另开会话重跑一次,即 UP 的同形态复测;B1–B3/BB/RL = 其他锚定配置;T1/T2/T3/B+T/PA = 注入配置):

  • 研究一 · 锚定(工具面控制):7 个会话(B1/UP/UP2/B2/B3/BB/RL)——首轮只给 2 个工具,之后恢复全量,全程无风格注入;
  • 研究二 · 提示词注入(说话风格要求):5 个会话(T1/T2/T3/B+T/PA)——注入"只用 we / 禁 let me"等风格契约或流程规划提示词。契约定义:A 契约 = "只用 we/let's/our,禁用 I/let me/my,每段分析用 'We need' 开头"(we 型正向引导,这一注入格外有效, 我暂时还没有发现此注入失效的情况);B 契约 = "不要用 'let me' 开头,改用 'I'll' 或 'I'"(禁 let me 型)。 注入方式:anchor 消息(首轮 0 工具锚点轮,作为用户消息注入)或 system prompt(写入系统提示 -200 section);B+T 额外附"模板"(交付流程模板)。
会话 研究 首轮 注入内容 第二轮 评分(细则打分制)
B1 锚定 2 工具 [pwsh, read] + 输出 cap 1024 61 全开 86.8
UP 锚定 2 工具 [bash, str_replace_editor](Git Bash) 晋升低注入 5–6 工具(bash/str_replace_editor/dev_tool_search/skill_load/skill_search/read_image,request/header 实测;非 61 全开) 85.7
UP2 锚定 同 UP([bash, str_replace_editor],Git Bash)——UP 的同形态复测 晋升低注入 5 工具(同 UP) 42.9(差档;贴图一坨 + 区块渲染约一半一半)
B2 锚定 2 工具 [pwsh, read] 61 全开 71.1
B3 锚定 2 工具 [pwsh, read](首轮纯思考 5.5 分钟被中止) 61 全开 80.0
BB 锚定 2 工具 [bash, read](Git Bash,双路径事故) 61 全开 20.8
RL 锚定 2 工具 [bash, str_replace_editor] + 一句 persona(与官方 minimal 逐字节一致) step 2 自动晋升 63 全开 + skill 注入 71.1
T1 注入 0 工具锚点轮 B 契约(anchor 消息):"不要用 let me 开头,改用 I'll 或 I" 61 全开 + skill-catalog 80.6
T2 注入 0 工具锚点轮 A 契约(anchor 消息):"只用 we/let's/our,禁用 I/let me/my,每段用 We need 开头" 61 全开 55.0
T3 注入 61 直接全开 A 契约写进系统提示(-200 section,非消息注入) 35.0
B+T 注入 0 工具锚点轮 B 契约(anchor 消息)+ 模板 61 全开(45 次→中断 4h→212 次) 68.4
PA 注入 61 直接全开 用户消息自带流程规划提示词(勘察/交付物/功能/思考节奏/选型/验证/收尾框架) 60.5

核心发现

以下全部为描述性观察:在各自的初始条件(首轮工具面、晋升后工具面、注入内容)下,12 个会话的思维链指纹(we/I 家族短语、let_me、potential、块长等)呈现了可复现的分布特征。本实验不归因因果——n=1(UP 配置 n=2)样本无法分离各因素贡献,任何"因为 A 所以 B"的表述都不是本实验能证明的。

研究一:锚定(工具面)

  1. 指纹分布与首轮/晋升工具面共现(描述性):首轮窄工具面的会话(锚定组)let_me 密度 0.02–0.65、we 家族 0.49–4.31;首轮即全开的会话(T3/PA)及 0 工具锚点轮会话(T1/B+T)let_me 0.80–1.33——在这些条件下指纹分布呈现上述特征。UP/UP2(upstream 形态,晋升后仍低注入 5–6 工具,request/header 实测)两次运行指纹均最纯(let_me=2、we 家族 3.32/4.31)——同形态两次一致。完整短语指纹见下节表 1。

  2. 晋升后工具面的两个观测(描述性,不归因因果)

    • RL(首轮 minimal 接口 [bash, str_replace_editor] 逐字节一致,晋升后 63 工具全开):指纹落中间带(we 1.74 / let me 0.26 / I 0.41,介于 anchored 带与 standard 带之间;块长 p50=430 vs standard 437)——该初始条件下指纹分布呈现此特征
    • UP/UP2(晋升后低注入小工具面):指纹全程 anchored 带(we 3.32/4.31、let_me 0.02,两次运行一致)——该初始条件下指纹分布呈现此特征
    • 两个观测并列展示"晋升结果不同 → 指纹带不同"的共现,但 n=1/2 无法证明因果,也不评价其他实验。

表 1:短语指纹(密度 = 次/1k tokens,分母为交付末尾单 Context,provider usage 权威值;括号内为次数)

短语 B1 UP UP2 B2 B3 T1 T2 T3 B+T PA BB RL
we(裸) 0.26 (50) 0.48 (44) 0.92 (107) 0.24 (41) 0.65 (72) 0.20 (32) 0.57 (86) 0.17 (27) 0.12 (24) 0.10 (24) 0.84 (138) 0.36 (50)
let's 0.10 (20) 1.17 (107) 1.33 (154) 0.33 (55) 1.00 (112) 0.06 (10) 1.02 (153) 0.03 (5) 0.04 (7) 0.02 (5) 1.17 (192) 0.72 (100)
we can 0.04 (7) 0.93 (85) 1.09 (127) 0.12 (20) 0.55 (61) 0.04 (7) 0.50 (75) 0.03 (5) 0.04 (7) 0.01 (2) 0.71 (117) 0.35 (49)
we'll 0.03 (5) 0.47 (43) 0.49 (57) 0.10 (16) 0.20 (22) 0.06 (10) 0.26 (39) 0.03 (4) 0.01 (1) 0.00 (0) 0.23 (37) 0.13 (18)
we need 0.01 (2) 0.07 (6) 0.16 (19) 0.02 (4) 0.06 (7) 0.01 (1) 0.16 (24) 0.02 (3) 0.01 (1) 0.00 (0) 0.07 (12) 0.00 (0)
we should 0.00 (0) 0.14 (13) 0.08 (9) 0.00 (0) 0.03 (3) 0.00 (0) 0.06 (9) 0.01 (2) 0.00 (0) 0.00 (1) 0.11 (18) 0.02 (3)
our 0.05 (10) 0.08 (7) 0.23 (27) 0.05 (8) 0.13 (15) 0.04 (6) 0.37 (56) 0.22 (34) 0.05 (9) 0.02 (5) 0.30 (50) 0.14 (20)
we 家族合计 0.49 (96) 3.32 (305) 4.31 (500) 0.86 (145) 2.63 (293) 0.45 (71) 2.96 (443) 0.54 (85) 0.25 (49) 0.16 (41) 3.44 (566) 1.74 (241)
let me 0.65 (128) 0.02 (2) 0.02 (2) 0.46 (77) 0.33 (37) 0.85 (135) 0.10 (15) 1.00 (156) 1.33 (261) 0.80 (203) 0.04 (6) 0.26 (36)
I(裸) 0.36 (70) 0.02 (2) 0.09 (10) 0.17 (28) 0.13 (15) 0.27 (42) 0.10 (15) 0.61 (95) 0.69 (136) 0.63 (158) 0.09 (15) 0.07 (10)
I'll 0.24 (47) 0.01 (1) 0.00 (0) 0.08 (14) 0.09 (10) 0.40 (63) 0.03 (5) 0.26 (41) 0.34 (67) 0.30 (77) 0.01 (1) 0.06 (8)
I 家族合计 1.29 (253) 0.05 (5) 0.10 (12) 0.77 (130) 0.57 (63) 1.61 (254) 0.24 (36) 1.91 (298) 2.44 (480) 1.77 (448) 0.15 (25) 0.41 (57)

表 1 要点(描述性)

  • we 型(we 家族 0.86–4.31):UP/UP2/B2/B3/T2/BB;I 型(I 家族 1.29–2.44):B1/T1/T3/B+T/PA;RL 中间带(we 1.74 / I 0.41 / let me 0.26);
  • 同形态两次一致:UP/UP2 的 let_me 均 2、we 家族 3.32/4.31——upstream 形态的指纹分布可复现;
  • 两极都有好结果:I 型之王 B1(86.8 好档)与 we 型之王 UP(85.7 好档)同为最好——代词家族本身与质量无单调关系(见第 3 条)。
  1. 轨迹 ≠ 质量(经全量实机回测确认):轨迹最纯的会话(BB:let_me=6、we 家族 566)实机不可玩(大规模区块渲染问题,打分 20.8);轨迹最散的会话(B1:let_me=128)打分 86.8(好档)。UP2 同形态复测把这一反例推到极限(见第 4a 条):同预设、同轨迹、同指纹,质量 85.7 vs 42.9。

  2. 锚定与质量:有正向共现倾向,不能证明充分提升

    • 倾向:细则打分制下(见"评分表"),好档(≥80)3/4 在锚定组(B1 86.8/UP 85.7/B3 80.0 vs 非锚定组 T1 80.6——T1 因模式默认创造升入好档后"全部在锚定组"不再成立),差档(<60)锚定/非锚定各半(T2 55.0/T3 35.0 vs BB 20.8/UP2 42.9);
    • 反例:BB 同锚定却 20.8 分;UP2 与 UP 同形态同轨迹却 42.9 vs 85.7;B2/B3 同预设(修复版 anchored)71.1 vs 80.0;锚定组 7 会话用了 6 种预设形态,无"同预设 ± 锚定"配对对照,无法分离锚定与预设形态的贡献
    • 结论:只能引证倾向,不能证明锚定提升质量

4a. 同形态复测(UP vs UP2):UP2 与 UP 预设逐字节一致(首轮 [bash, str_replace_editor] + 晋升低注入 5 工具 + 无 skill-catalog),提供了"同一预设 × 同一任务"的独立重复:

  • 形态指纹可复现:letMe 均 2(0.02)、potential 1.46/1.41(且用法一致——句首预判枚举)、we 家族 3.32/4.31、I 家族 0.05/0.10、hmm 0.08/0.06(最低档)、maybe/fine 最高档探索/验收型、情态合计 4.66/5.09、句首族一致——两次运行全部一致或同档
  • 质量不可复现:同形态同轨迹下 85.7 vs 42.9(UP2 贴图一坨/区块渲染约一半一半)——"形态指纹可复现 ≠ 质量可复现";
  • 含义:"预设→轨迹"是可靠映射(表达层内可复现),质量的决定因素在两次运行之间不可控(工程层验证/实现细节)——单次质量评级不能外推为该形态的稳定能力。

研究二:提示词注入(风格契约)

契约 A/B 定义与注入方式见"实验设置"节(全文统一,此处不重复)。

  1. 注入生效矩阵(描述性观察)

    • 同样 A 契约(we 引导):锚点消息注入生效(T2:let_me 15 / we 242),写进系统提示不生效(T3:let_me 156)——锚点消息 > system prompt;
    • 同样锚点消息:A 契约(we 正向引导)生效,B 契约(禁 let me)不生效(T1:let_me 135)——模型对"禁 let me"抗性本质,对"用 we"顺应天然;
    • 注入契约未跨中断保持:B+T 生效一阵(45 次)→ 中断 4 小时 → 恢复后 212 次(全部会话 Context <300k,属小任务规模,非长会话衰减)。
  2. 提示词是"行为开关",不是"质量开关"("即使 let me 消失也存在问题"):T2 是注入研究里风格最成功的样本(let_me=15、we=242,全程 we 型),但实机贴图 bug 照旧(atlas mipmap 混色);PA 提示词被 1:1 执行(26 个单元测试红→绿、test=349 全会话最高)但黑屏漏网(验证绕开真实启动路径);B1 无任何注入打分 86.8(好档)。语言轨迹/行为方式的改变不传导到工程质量。UP2 从另一方向佐证:无注入、轨迹与 UP 完全一致,质量同样不可控。

共用观察

  1. 两轴独立是本实验最强归纳:表达层变量(工具面/注入/风格)可被可靠改变(轨迹、语言、行为),工程层质量(由首块规划深度、验证粒度/对象/角度决定)不被这些改变影响——12 样本一致,且经全量实机回测确认;UP2 同形态复测(表达层 100% 复现、工程层质量未复现)是最干净的一次对照。

  2. potential 跨任务同向(Pro 专属):本实验 potential 词频最高会话(UP:134 次,1.46/1k,句首 126 次专属;UP2 同形态复测 164 次 1.41 同档)评级一好一差;贵仓库侧句首 potential 只出现在 96–99 分的 minimal/anchored 样本——potential 是 upstream 形态的可靠指纹(两次复现),不是质量指纹(UP2 同密度 42.9 分)。边界:B1 最好却 potential 极低(11 次 0.06);BB 最差却 potential 第二高(21 次);B2 写过 "Potential issues to watch" 但词后无排查动作——词必须驱动行动

全量实机回测附记(2026-08-16,12 会话逐一运行)

  • 评级与综合报告 12/12 一致,无出入(评级已升级为细则打分制,见下节"评分表");
  • 新事实:矿石系统缺失普遍(有矿石仅 B1/B+T,无矿石 5 会话;UP2 因渲染故障无法判断);生存模式仅 T2 有(B1/B2/B3 只有创造模式;UP2 有生存/创造切换但切换无区别);水"可被左键破坏"是普遍交互问题(5 会话可破坏 / 4 会话挖不掉:B2/UP/T1/UP2),水的视觉渲染与游泳机制大体正常(8 会话确认可游泳,含 UP2);UP2 是全会话唯一确认"水可被方块填掉"+进水蓝色特效的会话(只差流动)——修正了此前"水渲染普遍有问题"的表述;
  • 分析→实测闭环:RL 方向键 bug(前进与世界系绑定)与思维链"方向解算只在 yaw=0 退化点自洽"预测吻合;BB 轨迹最纯 vs 实机最不可玩、UP2 与 UP 同轨迹 vs 质量天差地别,再次印证轨迹≠质量。

评分表(细则打分制,替代主观评级)

每项按 2/1/0 档打分(N/A = 未实测,剔除后按已测项折算百分制)。依据为用户 2026-08-16 逐会话实机记录原文(docs/session-analysis/user-playtest-records-20260816.md),非模型代码分析。模式项口径(2026-08-16 确认):模式未说明的会话一律默认"创造模式"(1 档 2.5 分),不再记 N/A。

项(权重) UP UP2 B1 B3 B2 RL PA T1 B+T T2 T3 BB
可玩性 (15) 15 0 15 15 15 15 7.5 15 15 7.5 0 0
渲染·区块/面/可见性 (15) 15 7.5 15 15 7.5 15 7.5 15 7.5 N/A 0 0
贴图 (15) 15 0 15 15 15 15 15 0 7.5 0 N/A 0
操控·碰撞/方向/飞行 (10) 10 10 10 0 0 0 5 10 10 10 10 10
水左键 (5) 5 5 2.5 2.5 5 2.5 2.5 5 2.5 N/A N/A N/A
游泳 (5) 5 5 5 5 5 5 N/A 5 5 N/A N/A N/A
玻璃 (5) 2.5 N/A 0 5 5 2.5 5 5 0 N/A N/A N/A
洞穴 (5) 5 N/A 5 5 5 0 0 5 5 N/A 5 N/A
矿物 (5) 0 N/A 5 0 0 0 0 N/A 2.5 N/A N/A N/A
昼夜 (5) 0 N/A N/A 5 2.5 N/A 2.5 5 N/A 5 N/A N/A
模式 (5) 2.5 2.5 2.5 2.5 2.5 2.5 2.5 2.5 2.5 5 2.5 2.5
树 (5) 5 N/A 2.5 5 N/A 5 5 5 2.5 N/A N/A N/A
地形/群系 (5) 5 N/A 5 5 5 5 5 N/A 5 N/A N/A N/A
光影 (5) 5 N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A N/A
折算分(百分制) 85.7 42.9 86.8 80.0 71.1 71.1 60.5 80.6 68.4 55.0 35.0 20.8

评分与主观评级的关键差异(暴露原评级与实测事实的不一致):

  • T1(80.6,原"不好"):除贴图外全部正常(手感好、树好、玻璃好、水挖不掉、有昼夜)——贴图一项拉低,但远非"不可玩";模式默认创造后升入好档
  • T2(55.0,原"最好但贴图错"):有生存模式 + 贴图全错 + 中途掉出世界(恶性 bug,可玩性仅 1 档)+ 有昼夜变化;渲染不可测定(掉出世界未测到)——掉出世界后"最好"已不成立;
  • B2(71.1,原"不好"):碰撞半格 + 草方块缺失两处硬伤,但水/玻璃/贴图/洞穴/昼夜其余正常——与 RL 同分(71.1),与"B2 不好 / RL 较好"的主观排序相反;
  • T3/BB(35.0/20.8,原"不行/最差"):不可玩实至名归;操控记 10(未报操控问题)+ 模式默认创造 2.5——均不改变"差档"结论;
  • UP2(42.9,UP 的形态复测):与 UP 预设逐字节一致、轨迹同族(letMe 同为 2),但贴图"一坨"(方块全错)+ 区块渲染约一半一半(1 档 7.5)→ 可玩 0,仅水系统全满(左键挖不掉+可被方块填掉+进水特效+游泳)+ 操控 10 + 模式 2.5;光影维持 N/A(渲染坏看不到不给分)——同形态两次运行质量天差地别,排除预设差异后"轨迹 ≠ 质量"仍成立

12 会话轨迹指标(与贵仓库 trajectory_stats 同口径)

与贵仓库 evaluator/trajectory_evidence/derived/trajectory_stats.csv 相同指标(we / let_me / lets / i 为次数,与贵仓库口径一致;密度 = 次/1k tokens,分母为交付末尾单 Context,provider usage 权威值,不累积);p50 = reasoning 块长中位数(字符);块数/工具调用/ p50 均为本次从原始日志统一重算(交付轮次限定,与 0.3 口径一致)。

会话 打分 配置(预设形态) we let_me lets i let_me 密度 we 家族密度 potential test p50 reasoning 块数 工具调用
UP 85.7 anchored-standard-upstream 44 2 107 2 0.02 3.32 134 72 665 63 68
UP2 42.9 anchored-standard-upstream(同形态复测) 107 2 154 10 0.02 4.31 164 89 550 86 85
B1 86.8 anchored-standard-old 50 128 20 70 0.65 0.49 11 130 605 116 144
B3 80.0 anchored-standard 72 37 112 15 0.33 2.63 14 77 341 85 97
B2 71.1 anchored-standard 41 77 55 28 0.46 0.86 12 58 565 59 87
RL 71.1 anchored-standard-open 50 36 100 10 0.26 1.74 20 63 430 89 139
T1 80.6 zero-anchored-standard-b 32 135 10 42 0.85 0.45 14 73 874 64 114
B+T 68.4 zero-anchored-standard-b+模板 24 261 7 136 1.33 0.25 2 109 1581 97 138
PA 60.5 standard 24 203 5 158 0.80 0.16 3 349 1183 76 140
T2 55.0 zero-anchored-standard 86 15 153 15 0.10 2.96 10 99 1608 73 110
T3 35.0 standard-we-contract 27 156 5 95 1.00 0.54 7 75 461 45 88
BB 20.8 anchored-standard-gitbash 138 6 192 15 0.04 3.44 21 106 651 136 156

读表要点

  • 锚定系 vs 非锚定系分带成立:锚定系(UP/UP2/B1/B2/B3/RL/BB)let_me 密度 0.02–0.65(除 B1 128 次),we 家族 0.49–4.31;非锚定系(T1/T3/B+T/PA)let_me 0.80–1.33、I 家族 1.29–2.44——与贵仓库 let_me 分带方向一致;
  • UP vs UP2 同形态轨迹几乎重合(letMe 均 2、we 家族 3.32/4.31、potential 1.46/1.41、块 63/86、p50 665/550、调用 68/85、Context 92k/116k)——预设逐字节一致下的天然复测,轨迹没有复制质量(85.7 vs 42.9);
  • 轨迹与打分无单调关系:let_me 最少的 BB(6 次)20.8 分,let_me 最多的 B+T(261 次)68.4 分,let_me 第二高的 B1(128 次)86.8 分——同一指标两端均有高分/低分;
  • p50 对照:RL 430(晋升后回归 standard 437 档)、BB 651(低分带)、UP 665(好档最长块)、T1 874(好档但 p50 更长)——高分会话 p50 并不一致偏短,块长与质量无单调关系;
  • 与贵仓库 trajectory_stats 的直接可比项:we / let_me / lets / i 四列口径一致;p50/块数/工具调用已从原始日志重算补齐(口径:交付轮次限定,tool/call 事件计数)。

数据位置(可复现)

  • 仓库:https://github.com/lscatfish/mdt
  • 会话日志、实测记录:docs/session-analysis/;综合报告:根目录 COMPREHENSIVE-REPORT-20260815.md;UP2 会话:baseline-upstream2/;预设:agent-presets-repro/

声明

  • 本实验所有 Project2 相关成绩与结论均引自贵仓库既有报告(《轨迹风格与 PTC 对照分析》《轨迹触发机制实验》及 trajectory_evidence 聚合数据),非本实验原创。
  • 本实验为 n=1 每配置、非随机分配、评级为主观序数、Full access 时机未完全控制——仅供参考,不保证可复现,结论可能有错误,仅对本次许愿式生成(指令层无工程脚手架、环境层有 MCP/Skill 脚手架)任务有效。
  • 实验数据源自 DeepSeek Harness 会话日志;相关预设源自 xiaobright/dsh-anchored-standard(MIT)与 DeepSeek Harness(MIT)。

后续工作

本实验的“许愿式”生成本身同工程开发有很大不同,之后我将尝试使用我在实际工程中的使用不同的agent预设。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions