tt · diff
git:20260814.44e61cf to git:20260814.5023d8c
6 added, 16 removed. Audit A to A.
---
name: tt
description: >
- Ворота КАЧЕСТВА сразу после сборки — «докажи, что то, что мы ТОЛЬКО ЧТО собрали, реально работает»,
- пока контекст ещё горячий. Триггеры: "/tt", "/test", "протестируй", "докажи что работает",
- "проверь качество", "оттестируй", "test what we built", "prove it works". (`/tt` = `/test` — одно и
- то же, как `/1`+`/!` и `/rr`+`/retro`.) Делает 6 шагов: (a) ОБЛАСТЬ — что именно изменили в этой
- задаче (файлы/скиллы/скрипты/рутины/заметки); (b) ПРОГНАТЬ вживую на РЕАЛЬНЫХ данных, не в теории;
- (c) ПОЛОМАТЬ нарочно (пустой ввод, нет зависимости, грабли путей C:/E:, graceful degrade) + ВТОРОЕ
- МНЕНИЕ внешнего ломателя на каждый изменённый ИСПОЛНЯЕМЫЙ артефакт: Codex — дефолт (secondop.py t3
- --ritual tt), Grok — вторая рельса (⭐26.07 хаб: локальный CLI headless — secondop.py t3 --engine grok; браузер grok.com = фолбэк через grok-prompt → log-ext); скип
- только явный через log-skip → тогда вердикт максимум ⚠️, не ✅);
- (d) СЛОЙ ВИДИМОСТИ — видно ли вообще, что сработало (счётчики/логи — именно это ловит «тихий» успех);
- (e) КОРЕНЬ сбоя → починить → перепрогнать; (f) ВЕРДИКТ ✅/⚠️/❌ С ДОКАЗАТЕЛЬСТВОМ. Только ✅ = «готово».
- Тест ≠ ретро и идёт ДО него: BUILD → /tt (на каждую задачу, горячий контекст) → … → конец сессии → /retro
- (ретро лишь АУДИТит строку «протестировано? ✅/❌», саму проверку не делает — поздно/холодно).
- Тонкий оркестратор (skill-design-three-layer), markdown-only, без сервера/БД (AK-47).
- Канон: память [[test-after-build-skill]], [[verify-existing-before-proposing]], [[fix-root-cause-not-symptoms]],
- [[long-task-healthcheck]], [[deterministic-script-gotchas]]; родня [[crash-recovery-command]] (/1), [[retro]].
+ QUALITY GATE right after building — "prove that what we JUST built actually works" while the
+ context is still hot. Trigger on "/tt", "/test", "prove it works", "test what we built". Six
+ steps: (a) scope — what exactly changed; (b) live run on real data; (c) break it on purpose;
+ (d) visibility layer — a counter/log proves it ran; (e) root-cause any failure and re-run; (f)
+ verdict ✅/⚠️/❌ with evidence. Only ✅ earns the word "done". Supports an external multi-vendor
+ review panel as step 2.5.
license: MIT
---
# /tt — ворота качества сразу после сборки
> 🧒 **При докладе Антону:** заверши простым «Простыми словами» на его языке (его standing-правило [[eli5-always]]). Только в сообщении ЕМУ — не внутри артефактов.
Это **не ретро**. Ретро = упаковка всей сессии в конце. `/tt` = узкая проверка **одной вещи, которую мы только что собрали**, пока контекст горячий. Боль Антона (2026-06-25): «собрали, сказали „готово", пошли дальше — а оно сделано на 2/3». `/tt` ловит это ДО «готово».
**Когда:** сразу после сборки/правки **скилла · скрипта · рутины · хука · vault-пайплайна · заметки-механики** — всего, что должно ЧТО-ТО делать. Не для разговорных ответов и не для тривиальных правок текста.
**Граница vs соседи:** `/1` = жива ли СИСТЕМА после крэша; `/verify` (встроенный) = работает ли ПРИЛОЖЕНИЕ в браузере; `/tt` = работает ли **именно то, что мы только что собрали**.
---
## Шаг 0 — RECALL области (что вообще изменили)
Не по памяти — по фактам. Перечисли, что эта задача реально создала/тронула:
- свежие/изменённые файлы: `~/.claude/skills`, `~/.claude` (память/CLAUDE.md/хуки/scheduled-tasks), `$IMPORTS_ROOT`, волт-заметки;
- быстрый якорь: `python "$IMPORTS_ROOT/retro_inventory.py" 1` (тот же инвентарь, что у /retro) ИЛИ просто перечисли то, что правил в ЭТОЙ сессии.
- Возьми только то, что относится к ТЕКУЩЕЙ задаче (чужие fleet-правки игнор — это не наше, см. [[session-machine-tagging]]).
- **RECALL знаний по теме** (гейт, грабли 2026-07-04: чинили OAI-путь не глянув память — чуть не продублировали параллельную сессию): перед прогоном/фиксом подними, что УЖЕ известно — grep `memory\` + `/ask` (RAG) + греп волта по теме изменённого. Параллельная сессия могла уже сделать/задокументировать это ([[capture-rules-into-bible]] → RECALL-before-activity).
## Шаг 1 — ПРОГНАТЬ вживую (на реальных данных, не в теории)
Запусти собранное **по-настоящему** на настоящих данных Антона и покажи фактический вывод:
- скилл → выполни его процедуру руками здесь же;
- скрипт → запусти его (read-only/dry-run если есть побочки);
- рутина/хук → дёрни вручную или проверь, что он реально срабатывает (а не «должен бы»);
- заметка-правило → проверь, что ссылки/слаги резолвятся, frontmatter валиден.
«Теоретически работает» ≠ доказано. Нужен живой вывод.
## Шаг 2 — ПОЛОМАТЬ нарочно (negative + edge)
Попробуй сломать — реальные грабли этого дома:
- пустой / кривой ввод, отсутствует зависимость или ключ;
- грабли путей **C:/E:** ([[deterministic-script-gotchas]]) — ищет ли на правильном диске;
- машинно-специфичный хардкод: `grep -n "C:\\\\Users\\\\[^_]" <файл>` — путь с ЧУЖИМ юзером/машиной в общем движке обязан идти через `_paths.py`/machine.env (грабли 2026-07-04: хаб вшил `%USERPROFILE%`, на ноуте путь мёртв → тихий fallback);
- v2.1 / 403 / устаревший конфиг — берётся ли факт из ЖИВОГО источника, не со стале-копии ([[recall-first-on-incident-and-live-source-truth]]);
- деградирует ли мягко (понятная ошибка), а не падает молча/тихо «делает вид».
## Шаг 2.5 — ВТОРОЕ МНЕНИЕ: внешний ломатель (Codex — дефолт · Grok — 2-я рельса · Gemini — 3-я)
Своя проверка слепа к своим же слепым зонам — второй вендор ловит то, что мы не видим ([[test-after-build-skill]] + Decision Memo Phase 1.5). Поэтому ломает не только сессия, но и внешние глаза. Их ТРИ пары (anton 21.07; ⭐26.07 Grok переехал в CLI; ⭐27.07 добавлен Gemini): **Codex** (headless CLI, дефолт), **Grok** (⭐26.07 на хабе локальная CLI-рельса на подписке, headless — `secondop.py t3 --engine grok`; браузер grok.com = ФОЛБЭК, см. [[grok-second-reviewer-rail]]) и **Gemini** (headless без браузера, `gemini_review.py break`, см. [[gemini-third-reviewer-rail]]).
**Когда зову (узко, чтобы ритуал не раздуло):** в области Шага 0 есть изменённый **исполняемый** артефакт (скрипт · скилл · хук · рутина · пайплайн). Только заметки/тексты/frontmatter → пропускаю **осознанно**, логирую и пишу это в вердикт.
**Рельса 1 — Codex (дефолт, зову всегда первым):**
```
python "%USERPROFILE%\.claude\scripts\cc-review\secondop.py" t3 --ritual tt --task <id-задачи> --context "<что собрали + что уже проверили в шагах 1-2>"
```
Пир без Codex-логина → тот же вызов через `_shared\secondop_client.py` (брокер ответит по шине).
**Рельса 2 — Grok-ломатель (зову когда):** (а) Codex недоступен/quota-blocked — Grok спасает вердикт от ⚠️; (б) артефакт рискованный/safety-critical или Codex дал спорный COUNTER — гетеро-пара, зову ОБОИХ; (в) Антон сказал «спроси грока».
**Механика-дефолт (⭐26.07, хаб): локальный CLI headless** — `python ...\secondop.py t3 --engine grok --ritual tt --task <id> --context "..."` (лог и зеркало в чат 04 автоматические, ручной log-ext НЕ нужен). CLI мёртв/разлогинен (`grok doctor`) → **фолбэк-браузер** (Chrome-MCP, человеческий темп, как /dr-fanout; строго локальный браузер [[browser-work-on-peers-not-hub]]):
1. `python ...\secondop.py grok-prompt --task <id> --context "<что собрали + что проверили>"` → paste-ready промпт;
2. вставить в НОВЫЙ чат grok.com (обычная модель, Expert не трогать), дождаться ответа;
3. первая строка ответа = вердикт `ACCEPT`/`COUNTER`/`BLOCK`;
4. залогировать: `python ...\secondop.py log-ext --reviewer grok --task <id> --ritual tt --verdict "<1-я строка>" --note "<ссылка grok.com/c/… ПЕРВОЙ + суть находок>"`. Ссылка на чат в `--note` **обязательна и идёт первой** (note режется до 200 симв. — длинная преамбула съест ссылку, Grok COUNTER 21.07) — это доказательство, что вердикт реально от Grok, а не вписан рукой (Codex VERIFY 21.07); плюс ответ Grok целиком цитируется в вердикте /tt. Не распознан формат → вердикт НЕ засчитан (переспросить в формате или log-skip).
**Рельса 3 — Gemini-ломатель (⭐27.07, скилл `/gemini`; зову когда):** (а) Codex И Grok недоступны/выжгли квоту — Gemini спасает вердикт от ⚠️; (б) safety-critical артефакт или спорный COUNTER — зову третьим голосом; (в) Антон сказал «спроси джемини».
```
python "%USERPROFILE%\.claude\scripts\cc-review\gemini_review.py" break --task <id> --context "<что собрали + что проверили>"
```
Headless, без браузера (REST-рельса ~7-10 с; `--engine cli` = `@google/gemini-cli`). Вердикт первой строкой `ACCEPT`/`COUNTER`/`BLOCK` и **сам** пишется в `usage.jsonl` (`log-ext --reviewer gemini`) — ручной log-ext НЕ нужен. Рельса не ответила → скрипт сам пишет `log-skip` и выходит с кодом 3 (вердикт /tt тогда максимум ⚠️ PARTIAL). Ключ = бесплатный тир Google AI Studio (`secrets\gemini.env`), биллинга нет → превышение = 429, не счёт; ⚠️ OAuth-вход CLI для физлиц Google отключил — чинить бесполезно, живёт только API-ключ.
**Как читать ответ (всех трёх рельс):** `COUNTER`/`BLOCK`/сценарии поломки = **находка** → это Шаг 4 (корень → починить → перепрогнать), не «мнение к сведению». `ACCEPT` = согласие, находки нет. Достаточно ОДНОГО полученного внешнего вердикта; вторая пара глаз — по правилам рельсы 2.
**Скип — только явный, никогда молчаливый** (COUNTER Codex 17.07): обе рельсы недоступны / нет исполняемых артефактов →
```
python ... secondop.py log-skip --ritual tt --task <id> --reason "<квота|ошибка|нет исполняемых артефактов>"
```
и вердикт Шага 5 **не может быть ✅** по этой причине: максимум **⚠️ PARTIAL «второе мнение не получено»**. Пропущенный звонок ≠ зелёный тест. Исключение: артефакт неисполняемый — тогда скип нейтрален, ✅ возможен.
**Наблюдаемость:** каждый вызов/скип пишется в `bridge-state/usage.jsonl` (attempted · ok · skipped · finding); суточный дайджест — `secondop.py digest --post` → чат 03. Ноль вызовов за сутки = сигнал «ритуал не работает», а не тишина.
## Шаг 3 — СЛОЙ ВИДИМОСТИ (видно ли, что сработало?)
Самый частый тихий баг — не в ядре, а в том, что **результат не видно** ([[verify-existing-before-proposing]]):
- **Готовый гейт первым:** если у проверяемого есть СВОЙ детерминированный гейт/тест (`memory_guard.py`, `/arch`, `sync_check`, `_test_*.py`) — запусти ЕГО и бери ЕГО вердикт; не пере-выводи логику самодельным awk/grep — дубль гейта со временем разъезжается с оригиналом и даёт ложные/расходящиеся тревоги (грабли 2026-06-27/07-04: raw-awk и `memory_guard.py` мерили длину строк по-разному).
- есть ли счётчик/лог/строка-доказательство, что оно отработало?
- «LastResult=N без логов» = неотладимо → это ❌ по видимости, даже если ядро вроде ок. (Так поймали пустой TurnState и ложный RED синка.)
## Шаг 4 — КОРЕНЬ → починить → перепрогнать
Любой провал шагов 1-3 → копай в КОРЕНЬ ([[fix-root-cause-not-symptoms]]), не лепи заплатку на симптом, почини КЛАСС → вернись на Шаг 1 и перепрогони, пока чисто. Safety-critical (локи/синк/auth/scheduler/идемпотентность) → «прочитай прежде чем чинить» + мини-тест ([[verify-existing-before-proposing]]).
## Шаг 4.5 — РАЗРЫВ СЕССИИ: считаем сигналы (ТЕНЬ с 2026-07-28, Антон «+»)
Нашёл баг на шагах 1-3 и он не чинится с ходу — прежде чем зарываться, посчитай 4 сигнала и **залогируй**:
```
python ~/.claude/scripts/split_rule.py log --what "<что чиним>" --attempts <провалившихся попыток> \
--files <файлов в корне> --repro-min <минут на воспроизведение> --context-pct <% контекста> \
[--shared] --decision stay|split --minutes <итого> --note "<комментарий>"
```
Правило (пока ТЕНЬ, решение всё равно твоё): выносить в отдельную сессию, если сработал ЛЮБОЙ сигнал —
**A** ≥2 провалившихся попытки · **B** корень >2 файлов или задета смежная система (шина/канон/планировщик/auth) ·
**C** воспроизведение >10 мин · **D** контекст съеден ≥70%.
Выносишь — сид-промпт обязателен (что делали · чего достигли · что уже отвергнуто и почему · критерий приёмки ·
не-цели), задача в `10-Tasks`, артефакт помечается ⚠️, а не ✅. Тень без записей = правило НЕ проверено;
сводка `split_rule.py summary --days 14`, критерии флипа в `00-System/Split-Rule-Shadow.md`.
## Шаг 5 — ВЕРДИКТ с доказательством
Короткая таблица: **что проверено · как (живой вывод) · ✅/⚠️/❌**. Затем одна итоговая строка:
- ✅ **PASS** — прогнал, ломал, видно — работает. ТОЛЬКО это = «готово».
- ⚠️ **PARTIAL** — работает, но есть жёлтый флаг (назови его + что осталось).
- ❌ **FAIL** — не работает / не видно → корень + что чиню.
Доказательство (вывод/счётчик/скрин) обязательно — без него «✅» не считается.
**📋 Журнал задач (декрет Антона 2026-07-04):** вердикт ✅ = момент закрытия в реестре задач ([[task-journal-done-undone-linking]]): если проверенная вещь числится в реестре — отметь `done` с ЭТИМ доказательством + линк, что она разблокировала; ❌/⚠️ = задача остаётся open (хвост «дочинить X» — в реестр сразу). С машины без движка — `bus_send.py` TASK/DONE. Одна строка в докладе: «📋 журнал: #id → done (доказательство: …)».
---
## Связка с /retro (аудит, не дубль)
`/tt` тестирует на каждой задаче (горячо). `/retro` в конце сессии лишь **АУДИТит** строку «протестировано? ✅/❌» по каждому артефакту и, если ❌ — флагает и предлагает прогнать `/tt` сейчас. Ретро само проверку НЕ делает (поздно/холодно). Не дублируем: каждый уровень ссылается вниз (AK-47).
## Границы / не-дубль
- markdown-only тонкий оркестратор; НЕ сервер/БД/вебхук (если правда нужен > markdown — флаг ⚠️ УСЛОЖНЕНИЕ, решает Антон).
- read-only/dry-run где есть побочки; запись в волт — бэкап-первым ([[vault-backup-rule]]).
- Если сессия ничего не собрала — скажи прямо «тестировать нечего», без церемонии.