Единый доклад: история → как устроено пространство → измерения и их корни → факты и графики с привязкой к мировой практике
Данные на 2026-06-21 · владелец фактов — AssetManager · доклад — ResearchAI
Доклад читается последовательно: крупные вехи по кварталам → почему пространство описывается именно такими векторами → детальная сводка измерений с указанием корней (мировых практик) → фактические цифры на графиках, каждый сопоставлен с опубликованной мировой бест-практикой → итоговая архитектура. Документ самодостаточный: можно сохранить в PDF кнопкой «Печать / Сохранить в PDF» вверху.
Крупными мазками, без деталей: что происходило на каждой ключевой вехе.
Векторы выбраны не «по красоте», а как ответ на конкретные боли, которые реально стоили токенов или вели к ошибкам. Каждый вектор существует, потому что без явной политики по нему система деградировала.
| Вектор | Измерение | Боль (почему появился) | Ответ-политика |
|---|---|---|---|
| V1 | Источник правды | Прогноз и факт смешивались; деньги/токены считались в разных местах по-разному. | Жёсткий владелец каждого канона: факты — только AssetManager, прогнозы — ResearchAI, инфра — CTO. |
| V2 | Глубина контекста | Startup выигран (−93%), но intra-chat L:R ~20:1 (цель ≤12:1); 44,6% paid cost в mega-событиях ≥5M; quality cliff 60–75% без meter; разведка в родительском чате раздувает replay. | JSON-first + no_hint; session envelope dual-axis; Wave F landfill (Task explore → summary ≤2K); Wave G parallel fan-out ≤5; NEW chat / task boundary / slice_mode packs. |
| V3 | Автономия | Непонятно, что модель может делать сама, а где обязателен человек. | Явная шкала 0–4 и политика по классам задач; повышение уровня — только после прохождения гейтов. |
| V4 | Паттерн рассуждения | Дорогие действия выполнялись до согласования плана; длинные MD читались целиком. | Plan→execute; семантический поиск (Butler RAG) до открытия длинных документов. |
| V5 | Риск | Одинаковое обращение с правкой черновика и с прод-данными. | Цена ошибки задаёт строгость: снапшот/стейджинг и обязательный human-gate на высоком риске. |
| V6 | Закрытие цикла | Решения жили только в чате; narrative MD грузился на старте, хотя оператор его не читает; «почему так» терялось через две недели. | document_outcomes jsonl-first (decisions.jsonl → Butler RAG); narrative read plane запрещает MD на старте; pytest + guardrails + acceptance; факт в AssetManager. |
Вертикаль — три слоя «от запроса к доверию». Зависимость строгая: L3 опирается на L2, L2 эффективна только при осмысленном L1.
| Слой | Название | Определение | Корни (мировая практика) | У нас |
|---|---|---|---|---|
| L1 | Оркестрация | Класс задачи → набор ролей → глубина контекста → уровень автономии. | Контекст-инжиниринг как «бюджет внимания» (Anthropic): искать наименьший набор высокосигнальных токенов. | match_intent, startup_packs + no_hint; MCP session_bootstrap; session envelope; resolve_subagent_orchestration (Wave G); task-driven landfill (Wave F); fleet 8 roles uniform. |
| L2 | Память и знания | Рабочая (чат) · эпизодическая (логи) · семантическая (реестры) · процедурная (скрипты/CI). | Структурированная память и компакция вместо линейного потока (Anthropic, практики 2026). | session_kpi.jsonl, Butler RAG, реестры. |
| L3 | Доказуемость | Ссылки на источник правды, даты, владельцы, post-метрики; воспроизводимость. | «Provable human oversight» (NIST AI RMF, EU AI Act ст.14): доказуемость, а не декларация. | decisions.jsonl, AN-009, Axis A v2 scores, narrative_read_plane contract, git. |
Горизонталь — шесть независимых осей политики. Каждая задача — точка; роль задаёт ограничения по осям. Колонка «оси A–J» — куда вектор проецируется в измеримом scorecard.
| Вектор | Вопрос | У нас | Проекция на оси |
|---|---|---|---|
| V1 | Что считается каноном? | AssetManager — деньги/токены; CTO — инфра | E, I, J |
| V2 | Сколько тянуть контекста? | no_hint ~3–10K; narrow ~6K; envelope 🟠60% 🟡75% 🔴90%; landfill explore + fan-out ≤5 | A, J |
| V3 | Что модель может без человека? | политика 0–3; mutating-pilot LIVE | D |
| V4 | Как устроен проход? | Plan→execute; Butler до MD | B, E |
| V5 | Какова цена ошибки? | снапшот vs прод; human-gate | D, I |
| V6 | Чем закрывается цикл? | decisions.jsonl-first, pytest, acceptance, subagent_* KPI | C, G |
Оси A–J — это измеримая проекция слоёв и векторов в проценты от мировой практики mid-2026. Колонка «корни» — внешний ориентир, с которым сравнивалась каждая ось.
| Ось | Название | Балл | Корни (ориентир) |
|---|---|---|---|
| A | Контекст-инжиниринг | 96 | Anthropic Agent Skills; attention budget; no_hint + Smart Loader |
| B | Маршрутизация интентов | 87 | Truto / NVIDIA llm-router; intent-routing практики |
| C | Наблюдаемость | 94 | LangSmith / Langfuse / Honeycomb |
| D | HITL и тиринг автономии | 93 | NIST AI RMF; COMPEL L0–L4; CSA Agentic Tiers |
| E | Память решений | 95 | OpenAI memory; машинно-адресуемое провенанс-решение |
| F | Дисциплина оркестрации | 88 | LangGraph / AutoGen (мы сознательно «anti-more-agents»); Wave G — формальный bounded-оркестратор в коде (subagent_orchestration.v1.json) |
| G | Регрессии и eval | 93 | DSPy / LangSmith LLM-judge; golden-set |
| H | Здоровье документации | 91 | редко формализовано вне крупных орг. |
| I | Governance / контракты | 98 | NIST AI RMF; ISO/IEC 42001 «в коде» |
| J | Machine-first SoT | 94 | leading edge: большинство пишет AGENTS.md «на надежду» |
Две шкалы не смешивать: report 007 — оси A–J в % vs frontier (композит 93,7%, поправка 2026-06-22); ROLE_AI_MATURITY Axis A v2 — 0–3 per role (live в role_maturity_axis_a_v2_scores_latest.json). Ось F подтянулась 83 → 88: bounded parallel (Wave G) формализован в коде (subagent_orchestration.v1.json, max 5 workers, parent-агрегатор) вместо жёсткого anti-more-agents; landfill H025 — typed explore, не swarm.
Каждый график сопоставлен с опубликованной мировой бест-практикой (пунктирная линия / зелёная полоса = ориентир).
Что доказывает: Прирост сосредоточен в окне 18–30 мая (+9,6 п.п.); Jun'26 +0,1 п.п. после Axis A v2 canonical (ось A 96). До 18 мая — back-cast, после — измеренные passes + amendments.
Мировая практика: Шкала — не бенчмарк модели, а % от публичных практик mid-2026 (Anthropic Skills, Cursor rules, NIST AI RMF). Потолок ~93–95% зафиксирован в report 007.
Источник: report 007 (9 passes + amendments incl. 2026-06-20); пункты до 18 мая — back-cast.
Что доказывает: Пик W20 (84,6K) — до дисциплины пакетов. W21–W22 — переходный провал Smart Loader; W23–W25 медиана ~5,5K (−93% к пику). Post-boundary avg drop −81,7% (AN-009 2026-06-21). no_hint fallback: ~3–10K vs 18–23K _default.
Мировая практика: Мировая практика контекст-инжиниринга: контекст — конечный «бюджет внимания», деградация («context rot») начинается уже на 40–60% окна; цель — наименьший набор высокосигнальных токенов и частая компакция (Anthropic; практики 2026). Наша дисциплина старта — конкретная реализация этого принципа.
Источник: AssetManager session_kpi.jsonl, медиана startup_tokens по ISO-неделе, W11…W25; AN-009 sidecar 2026-06-21.
Что доказывает: V2 в действии: без пакета CTO ~37,7K; narrow ~6K. no_hint fallback (сессии без task-hint) — ~3–10K, только ai_navigation.json; устраняет корневую причину «тихого» _default (~18–23K).
Мировая практика: Это ровно принцип контекст-инжиниринга Anthropic: грузить наименьший набор высокосигнальных токенов под текущий шаг, а не «всё про роль». Реестры и навигация — сырьё по триггеру, а не дефолтный контекст.
Источник: AN-009 smart_loader_pack_effect (CTO: full bundle n=1161, narrow n=77) + insight I2 (intents_registry ×15).
Что доказывает: Перерасчёт на свежей базе (22.06) и с июнем. Плотность коммитов на 100M токенов достигла пика в марте (32,2) и затем вышла на плато ≈20 — механический выход на токен упёрся в потолок рано. Монотонно растёт только плотность долгоиграющих решений (decisions/100M): 0,4 → 13,8, ≈×34 к январю.
Мировая практика: Почему мы НЕ меряем продуктивность числом коммитов или строк. Когда значимую часть кода пишет ИИ, привычные счётчики раздуваются и перестают отражать пользу: число коммитов, строк и частота деплоев растут, но часть этого — «черновой» код, который вскоре переписывают (DORA, 2026). Прямой опрос «стало ли быстрее?» тоже ненадёжен: в исследовании METR разработчики ощущали ускорение, а по факту тратили больше времени. Вывод индустрии: измерять не объём, а устойчивый результат. Поэтому в заголовок мы вынесли плотность долгоиграющих решений (decisions на 100M токенов) — артефактов, которые остаются полезными неделями, а не сиюминутный объём коммитов.
Источник: git log --numstat + 8× decisions.jsonl / usage_history.db usage_events_raw (перерасчёт 22.06.2026). * июнь — неполный месяц (до 22.06); метрика нормирована на токены.
Что доказывает: Baseline: loading 6K→636K за 8 ходов (Σ L:R 12,9:1). Ship 19–22.06: startup 2K, +35K/ход, фаза 5 ходов (145K loading, reasoning ~33K). Wave F/G (21.06): landfill explore изолирует loading; fan-out ≤5 — следующий рычаг; KPI baseline mandatory_explore n=2 median loading 246K vs other 38K (7d, telemetry только что live).
Мировая практика: Prompt caching не отменяет рост контекста; industry pattern 2026 — task boundary, sub-agents for exploration (isolated context), bounded parallel fan-out 3–5 workers (Anthropic context engineering; Cursor Task API).
Baseline: token_budget_counterfactual.v1.json + AN-009. Ship: AN-017 focus 20.06. Wave F/G KPI: subagent_landfill_kpi_latest.json + subagent_orchestration_kpi_latest.json (2026-06-21).
Движение по автономизации (вектор V3) сопоставлено с опубликованными мировыми шкалами. Наш «L5 mutating-tier» = уровень 3 по нашей шкале ≈ COMPEL L3 (supervised executor) ≈ CSA/NIST Tier 3 (broad autonomy within boundary, continuous monitoring, hard constraints).
| V3 | У нас | Мировая шкала | Статус |
|---|---|---|---|
| 0 | Только текст / план | L0 manual-with-AI | Default для неопределённых задач |
| 1 | Read-only диагностика | L1 assisted | Butler RAG, health-check |
| 2 | Именованные скрипты | L2 bounded executor | AM-011 upload CSV, match_intent |
| 3 | Mutating по процедуре | L3 supervised executor / CSA Tier 3 | pilot exit=0, LIVE 2026-05-30 |
| 4 | Reserved | L4 autonomous executor | Только с явным human-gate |
Мировая практика: Мировая практика governance 2026: «adaptive governance» — агент стартует на низком уровне и повышается только после стабильной измеримой работы (CSA/NIST Agentic Profile). Это в точности наш механизм: флаг mutating_pilot_enabled по классам задач + 6 гейтов перед повышением.
Источники: COMPEL Autonomy Spectrum; CSA NIST Agentic Profile; NIST AI RMF 2.0 draft (2026-04-08); EU AI Act ст.14.
Сводная привязка: что мы делаем ↔ что считается мировой бест-практикой ↔ источник. Это и есть «доказуемость» из запроса: каждая цифра/решение опирается на внешний ориентир.
| Что делаем | Мировая бест-практика | Источник |
|---|---|---|
| Smart Loader + no_hint: старт ~5,5K (W23–W25), no_hint ~3–10K | Контекст ≤ 40–60% окна; наименьший набор высокосигнальных токенов; компакция | Anthropic — Effective context engineering for AI agents (2026) |
| Session envelope dual-axis + Wave F/G subagent levers | Quality cliff 60–75%; isolate exploration in sub-agents; bounded parallel 3–5 workers per request | Anthropic context engineering 2026; Cursor Task/subagent docs; H025/H026 |
| Axis A v2 (0–3) + report 007 composite (93,2%) | Многомерный scorecard + операционные KPI, не самооценка | METR; SPACE; report 007 amendment 2026-06-20 |
| cache_read 95–97% через стабильный префикс | Prompt caching: −90% стоимости, −79% латентности на 100K кэше | Anthropic prompt caching |
| V3 0–3 + флаг пилота по классам | Шкала автономии L0–L4 / Tier 1–4; adaptive governance (повышение после измеримой стабильности) | COMPEL Autonomy Spectrum; CSA NIST Agentic Profile |
| decisions/100M токенов как заголовочная метрика | commits/LOC/DF искажаются под ИИ; durability- и complexity-взвешенные метрики | DORA 2026; METR 2025–2026 |
| Композит 10 осей + операционные KPI, а не самооценка | Самооценка ненадёжна; нужен многомерный набор (SPACE / DX Core 4) | METR; SPACE; DX Core 4 |
| guardrails + decisions.jsonl + аудит | Доказуемый человеческий надзор (provable oversight) | NIST AI RMF; EU AI Act ст.14; ISO/IEC 42001 |
Из чего собран контур, который держит всё описанное выше: код и деплой, исполнение на Hub, мост агент↔Hub через MCP, русскоязычная маршрутизация интентов, векторная память и поиск по ней.
Поток: фраза оператора → (pymorphy3 + synonym_map → intent → procedure) → скрипт на Hub → факт/артефакт → запись в decisions.jsonl → эмбеддинг в Qdrant → Butler RAG отдаёт это в следующий контекст. Код и результаты — через Git/Gitea с автодеплоем.
Источники: report 007 (routing/, autonomy daemon, Qdrant/embedding), butler target architecture; CT-116/118/119.
Зачем этот раздел. Здесь честно перечислено, чего цифры выше НЕ доказывают и где их легко переоценить. Это не «отписка», а инструкция по чтению: прежде чем сослаться на любой график, проверьте, нет ли по нему оговорки ниже — тогда вывод останется корректным.
| Рычаг | Ось | Статус |
|---|---|---|
| Wave F — subagent content landfill H025 (Task explore, summary ≤2K) | A, F | shipped DEC-012–014; 30d calibration; gate L2→L3 2026-07-21; pilot Kanban #141 |
| Wave G — parallel subagent orchestration H026 (max 5 workers) | F, B | shipped DEC-015; resolve_subagent_orchestration from natural query; fanout KPI baseline n=1 |
| Narrative read plane + document_outcomes jsonl-first | E, J | shipped DEC-019-012–015; Butler-before-MD; run_document_outcomes_ship deterministic tail |
| Session envelope runtime (hooks + dual-axis + CLI statusLine) | A, C | shipped DEC-014–016; fleet-uniform; IDE=Step0 bar, CLI=statusLine |
| no_hint pack + fleet keywords (shipped 2026-06-20) | A, B | DEC-002; post-boundary startup drop −81,7% |
| Axis A v2 canonical + CTO score 3 | A, C | DEC-001; CTO 92% narrow / 7d, score 3 green |
| DevOps / Architect / CEO narrow adoption | A, B | keywords расширены; 28d narrow 0% → ждём KPI |
| D4 startup-cut apply (L4) | A, B | Armed; streak 1/7 |
| Phase 2 docs RAG | E, A | Gate-check 2026-06-06 |
| Dreaming / Outcomes (авто-калибровка) | E, G | Anthropic mid-2026; у нас пока вручную |
| Второй judge-провайдер + cross-judge | G, I | абстракция готова |
Все числа воспроизводимы из источников ниже без ручных правок. Факты — слой AssetManager; этот доклад их только читает. Обновлено 2026-06-21 (Wave F/G + AN-009 refresh).
AssetManager/Analytics/009_token_context_engineering_analysis_latest.jsonResearchAI/reports/context_discipline_timeline_props_latest.jsonResearchAI/role_maturity_axis_a_v2_scores_latest.jsonResearchAI/metrics/subagent_landfill_kpi_latest.jsonResearchAI/metrics/subagent_orchestration_kpi_latest.jsonЗрелость: ResearchAI/reports/007_2026-05-18_ai_first_maturity_vs_frontier.json · теория: ResearchAI/HUMAN_AI_MULTILAYER_ROLE_SPACE.md
python3 ResearchAI/Scripts/refresh_article_metrics_from_an009.pypython3 ResearchAI/Scripts/report_subagent_landfill_kpi.pypython3 ResearchAI/Scripts/report_subagent_orchestration_kpi.pypython3 ResearchAI/Scripts/build_collaboration_report_html.py --root . --strict