Эволюция взаимодействия с ИИ: от умного редактора к измеримой многомерной системе

Единый доклад: история → как устроено пространство → измерения и их корни → факты и графики с привязкой к мировой практике

Данные на 2026-06-21 · владелец фактов — AssetManager · доклад — ResearchAI

10% → 93,2%
Композит зрелости (report 007, amendment 2026-06-20): ось A +1 п.п. после Axis A v2 canonical
84 656 → ~5,5K
Медиана стартовых токенов (пик W20 → W23–W25; no_hint ~3–10K на новых сессиях)
0,4 → 11,9
Долгоиграющих решений на 100M токенов (январь → полный май, ×30)
CTO Axis A v2 → 3
Операционная ось A (0–3): CTO score 3 green, narrow 92% / 7d; ResearchAI 91,9% / 7d (AN-009 sidecar 2026-06-21)
Wave F+G
Intra-chat V2: subagent landfill H025 (Task explore, summary ≤2K tok) + parallel orchestration H026 (max 5 workers); калибровка 30d → gate 2026-07-21

Доклад читается последовательно: крупные вехи по кварталам → почему пространство описывается именно такими векторами → детальная сводка измерений с указанием корней (мировых практик) → фактические цифры на графиках, каждый сопоставлен с опубликованной мировой бест-практикой → итоговая архитектура. Документ самодостаточный: можно сохранить в PDF кнопкой «Печать / Сохранить в PDF» вверху.

1. Исторические вехи (поквартально)

Крупными мазками, без деталей: что происходило на каждой ключевой вехе.

Q4 2025Умный редактор
октябрь – декабрь 2025 · композит ~10–22%
  • Старт в Cursor: рефакторинг, документация, скрипты; контекст собирается вручную каждый чат
  • Первые usage-события в billing — начало измеримого периода токенов
  • Gitea на Proxmox (CT-116): git перестаёт «подвешивать» ноутбук — предпосылка AI-first workflow
Q1 2026Маршрутизация и первое измерение
январь – март 2026 · композит ~28–52%
  • ai_navigation.json v1.0 — появляется слой L1 (что читать под задачу)
  • AN-001: оптимизация документации даёт −98% токенов на CTO-доках
  • Step 0 (session_metrics): первый объективный KPI — стартовые токены на сессию
Q2 2026Измеримая дисциплина и автономизация
апрель – июнь 2026 · композит 73% → 93,2%
  • decisions.jsonl + report 007 (композит 93,2%); narrative read plane + document_outcomes jsonl-first (Wave A+B, DEC-019-012–015) — оператор не читает narrative MD на старте
  • 2026-06-20: no_hint pack (~3–10K), Axis A v2 canonical, session envelope dual-axis (hooks + live .mdc + CLI statusLine, DEC-014–016); startup −81,7% post-boundary
  • 2026-06-21 Wave F/G: subagent content landfill H025 (изолировать loading в Task explore) + parallel orchestration H026 (fan-out ≤5, resolve из запроса); 30d калибровка открыта, gate L2→L3 2026-07-21

2. Как строилось пространство: почему именно эти векторы

Векторы выбраны не «по красоте», а как ответ на конкретные боли, которые реально стоили токенов или вели к ошибкам. Каждый вектор существует, потому что без явной политики по нему система деградировала.

ВекторИзмерениеБоль (почему появился)Ответ-политика
V1Источник правдыПрогноз и факт смешивались; деньги/токены считались в разных местах по-разному.Жёсткий владелец каждого канона: факты — только AssetManager, прогнозы — ResearchAI, инфра — CTO.
V2Глубина контекстаStartup выигран (−93%), но intra-chat L:R ~20:1 (цель ≤12:1); 44,6% paid cost в mega-событиях ≥5M; quality cliff 60–75% без meter; разведка в родительском чате раздувает replay.JSON-first + no_hint; session envelope dual-axis; Wave F landfill (Task explore → summary ≤2K); Wave G parallel fan-out ≤5; NEW chat / task boundary / slice_mode packs.
V3АвтономияНепонятно, что модель может делать сама, а где обязателен человек.Явная шкала 0–4 и политика по классам задач; повышение уровня — только после прохождения гейтов.
V4Паттерн рассужденияДорогие действия выполнялись до согласования плана; длинные MD читались целиком.Plan→execute; семантический поиск (Butler RAG) до открытия длинных документов.
V5РискОдинаковое обращение с правкой черновика и с прод-данными.Цена ошибки задаёт строгость: снапшот/стейджинг и обязательный human-gate на высоком риске.
V6Закрытие циклаРешения жили только в чате; narrative MD грузился на старте, хотя оператор его не читает; «почему так» терялось через две недели.document_outcomes jsonl-first (decisions.jsonl → Butler RAG); narrative read plane запрещает MD на старте; pytest + guardrails + acceptance; факт в AssetManager.

3. Сводка измерений с детализацией (откуда корни)

3.1. Слои L1–L3 (вертикаль)

Вертикаль — три слоя «от запроса к доверию». Зависимость строгая: L3 опирается на L2, L2 эффективна только при осмысленном L1.

СлойНазваниеОпределениеКорни (мировая практика)У нас
L1ОркестрацияКласс задачи → набор ролей → глубина контекста → уровень автономии.Контекст-инжиниринг как «бюджет внимания» (Anthropic): искать наименьший набор высокосигнальных токенов.match_intent, startup_packs + no_hint; MCP session_bootstrap; session envelope; resolve_subagent_orchestration (Wave G); task-driven landfill (Wave F); fleet 8 roles uniform.
L2Память и знанияРабочая (чат) · эпизодическая (логи) · семантическая (реестры) · процедурная (скрипты/CI).Структурированная память и компакция вместо линейного потока (Anthropic, практики 2026).session_kpi.jsonl, Butler RAG, реестры.
L3ДоказуемостьСсылки на источник правды, даты, владельцы, post-метрики; воспроизводимость.«Provable human oversight» (NIST AI RMF, EU AI Act ст.14): доказуемость, а не декларация.decisions.jsonl, AN-009, Axis A v2 scores, narrative_read_plane contract, git.

3.2. Векторы V1–V6 (горизонталь)

Горизонталь — шесть независимых осей политики. Каждая задача — точка; роль задаёт ограничения по осям. Колонка «оси A–J» — куда вектор проецируется в измеримом scorecard.

ВекторВопросУ насПроекция на оси
V1Что считается каноном?AssetManager — деньги/токены; CTO — инфраE, I, J
V2Сколько тянуть контекста?no_hint ~3–10K; narrow ~6K; envelope 🟠60% 🟡75% 🔴90%; landfill explore + fan-out ≤5A, J
V3Что модель может без человека?политика 0–3; mutating-pilot LIVED
V4Как устроен проход?Plan→execute; Butler до MDB, E
V5Какова цена ошибки?снапшот vs прод; human-gateD, I
V6Чем закрывается цикл?decisions.jsonl-first, pytest, acceptance, subagent_* KPIC, G

3.3. Оси зрелости A–J (измеримая проекция)

Оси A–J — это измеримая проекция слоёв и векторов в проценты от мировой практики mid-2026. Колонка «корни» — внешний ориентир, с которым сравнивалась каждая ось.

ОсьНазваниеБаллКорни (ориентир)
AКонтекст-инжиниринг96Anthropic Agent Skills; attention budget; no_hint + Smart Loader
BМаршрутизация интентов87Truto / NVIDIA llm-router; intent-routing практики
CНаблюдаемость94LangSmith / Langfuse / Honeycomb
DHITL и тиринг автономии93NIST AI RMF; COMPEL L0–L4; CSA Agentic Tiers
EПамять решений95OpenAI memory; машинно-адресуемое провенанс-решение
FДисциплина оркестрации88LangGraph / AutoGen (мы сознательно «anti-more-agents»); Wave G — формальный bounded-оркестратор в коде (subagent_orchestration.v1.json)
GРегрессии и eval93DSPy / LangSmith LLM-judge; golden-set
HЗдоровье документации91редко формализовано вне крупных орг.
IGovernance / контракты98NIST AI RMF; ISO/IEC 42001 «в коде»
JMachine-first SoT94leading edge: большинство пишет AGENTS.md «на надежду»

Две шкалы не смешивать: report 007 — оси A–J в % vs frontier (композит 93,7%, поправка 2026-06-22); ROLE_AI_MATURITY Axis A v2 — 0–3 per role (live в role_maturity_axis_a_v2_scores_latest.json). Ось F подтянулась 83 → 88: bounded parallel (Wave G) формализован в коде (subagent_orchestration.v1.json, max 5 workers, parent-агрегатор) вместо жёсткого anti-more-agents; landfill H025 — typed explore, не swarm.

4. Фактические цифры и графики

Каждый график сопоставлен с опубликованной мировой бест-практикой (пунктирная линия / зелёная полоса = ориентир).

Композит зрелости во времени (одна шкала, 0–100%)
Композит (оценка + измерение)Композит (только измеренные passes, report 007)Мировой frontier = 100%Реалистичный потолок без апгрейда модели (~93–95%)
0255075100Q4'25Q1'26Apr'26May 4–17May 18May 22May 30Jun'26ВремяКомпозит, % от mid-2026 frontier

Что доказывает: Прирост сосредоточен в окне 18–30 мая (+9,6 п.п.); Jun'26 +0,1 п.п. после Axis A v2 canonical (ось A 96). До 18 мая — back-cast, после — измеренные passes + amendments.

Мировая практика: Шкала — не бенчмарк модели, а % от публичных практик mid-2026 (Anthropic Skills, Cursor rules, NIST AI RMF). Потолок ~93–95% зафиксирован в report 007.

Источник: report 007 (9 passes + amendments incl. 2026-06-20); пункты до 18 мая — back-cast.

Стартовые токены сессии по неделям (прокси дисциплины контекста)
Медиана токенов / сессия (все роли)Типовая полная подгрузка контекста роли (индустрия ≈ 60K+)
022500450006750090000W11W14W17W18W19W20W21W22W23W24W25Неделя (ISO)Медиана токенов на старте сессии

Что доказывает: Пик W20 (84,6K) — до дисциплины пакетов. W21–W22 — переходный провал Smart Loader; W23–W25 медиана ~5,5K (−93% к пику). Post-boundary avg drop −81,7% (AN-009 2026-06-21). no_hint fallback: ~3–10K vs 18–23K _default.

Мировая практика: Мировая практика контекст-инжиниринга: контекст — конечный «бюджет внимания», деградация («context rot») начинается уже на 40–60% окна; цель — наименьший набор высокосигнальных токенов и частая компакция (Anthropic; практики 2026). Наша дисциплина старта — конкретная реализация этого принципа.

Источник: AssetManager session_kpi.jsonl, медиана startup_tokens по ISO-неделе, W11…W25; AN-009 sidecar 2026-06-21.

Пример реализации вектора V2: анатомия CTO-бандла по типу пакета
Типовая полная подгрузка контекста роли (индустрия ≈ 60K+)
016,25032,50048,75065,00037,721Полный бандл (без пакета)22,769default-пакет5,752snapshot-пакет6,046narrow-пакет9,650no_hint pack (2026-06-20)Средний старт, токенов

Что доказывает: V2 в действии: без пакета CTO ~37,7K; narrow ~6K. no_hint fallback (сессии без task-hint) — ~3–10K, только ai_navigation.json; устраняет корневую причину «тихого» _default (~18–23K).

Мировая практика: Это ровно принцип контекст-инжиниринга Anthropic: грузить наименьший набор высокосигнальных токенов под текущий шаг, а не «всё про роль». Реестры и навигация — сырьё по триггеру, а не дефолтный контекст.

Источник: AN-009 smart_loader_pack_effect (CTO: full bundle n=1161, narrow n=77) + insight I2 (intents_registry ×15).

Плотность результата на 100M токенов (помесячно)
Commits / 100M токенов (механический выход)Decisions / 100M токенов (долгоиграющие артефакты, 8 ролей)
08.817.526.235JanFebMarAprMayJun*МесяцАртефактов на 100M токенов

Что доказывает: Перерасчёт на свежей базе (22.06) и с июнем. Плотность коммитов на 100M токенов достигла пика в марте (32,2) и затем вышла на плато ≈20 — механический выход на токен упёрся в потолок рано. Монотонно растёт только плотность долгоиграющих решений (decisions/100M): 0,4 → 13,8, ≈×34 к январю.

Мировая практика: Почему мы НЕ меряем продуктивность числом коммитов или строк. Когда значимую часть кода пишет ИИ, привычные счётчики раздуваются и перестают отражать пользу: число коммитов, строк и частота деплоев растут, но часть этого — «черновой» код, который вскоре переписывают (DORA, 2026). Прямой опрос «стало ли быстрее?» тоже ненадёжен: в исследовании METR разработчики ощущали ускорение, а по факту тратили больше времени. Вывод индустрии: измерять не объём, а устойчивый результат. Поэтому в заголовок мы вынесли плотность долгоиграющих решений (decisions на 100M токенов) — артефактов, которые остаются полезными неделями, а не сиюминутный объём коммитов.

Источник: git log --numstat + 8× decisions.jsonl / usage_history.db usage_events_raw (перерасчёт 22.06.2026). * июнь — неполный месяц (до 22.06); метрика нормирована на токены.

Loading vs reasoning внутри сессии: baseline vs ship 19–22.06
Baseline loading (до 19.06)Baseline reasoning (≈ flat 25K)Ship loading (19–22.06, фаза до ~5 ходов)Ship reasoning (не режем thinking)Baseline reasoning/event AN-009 (24K)
0175350525700ход 1ход 2ход 3ход 4ход 5ход 6ход 7ход 8Ход диалога (operator message → agent reply)Токены на ход, тыс. (K)

Что доказывает: Baseline: loading 6K→636K за 8 ходов (Σ L:R 12,9:1). Ship 19–22.06: startup 2K, +35K/ход, фаза 5 ходов (145K loading, reasoning ~33K). Wave F/G (21.06): landfill explore изолирует loading; fan-out ≤5 — следующий рычаг; KPI baseline mandatory_explore n=2 median loading 246K vs other 38K (7d, telemetry только что live).

Мировая практика: Prompt caching не отменяет рост контекста; industry pattern 2026 — task boundary, sub-agents for exploration (isolated context), bounded parallel fan-out 3–5 workers (Anthropic context engineering; Cursor Task API).

Baseline: token_budget_counterfactual.v1.json + AN-009. Ship: AN-017 focus 20.06. Wave F/G KPI: subagent_landfill_kpi_latest.json + subagent_orchestration_kpi_latest.json (2026-06-21).

5. Движение по автономизации (V3) vs мировые шкалы

Движение по автономизации (вектор V3) сопоставлено с опубликованными мировыми шкалами. Наш «L5 mutating-tier» = уровень 3 по нашей шкале ≈ COMPEL L3 (supervised executor) ≈ CSA/NIST Tier 3 (broad autonomy within boundary, continuous monitoring, hard constraints).

V3У насМировая шкалаСтатус
0Только текст / планL0 manual-with-AIDefault для неопределённых задач
1Read-only диагностикаL1 assistedButler RAG, health-check
2Именованные скриптыL2 bounded executorAM-011 upload CSV, match_intent
3Mutating по процедуреL3 supervised executor / CSA Tier 3pilot exit=0, LIVE 2026-05-30
4ReservedL4 autonomous executorТолько с явным human-gate

Мировая практика: Мировая практика governance 2026: «adaptive governance» — агент стартует на низком уровне и повышается только после стабильной измеримой работы (CSA/NIST Agentic Profile). Это в точности наш механизм: флаг mutating_pilot_enabled по классам задач + 6 гейтов перед повышением.

Источники: COMPEL Autonomy Spectrum; CSA NIST Agentic Profile; NIST AI RMF 2.0 draft (2026-04-08); EU AI Act ст.14.

6. Доказуемость: мы ↔ мировая практика ↔ источник

Сводная привязка: что мы делаем ↔ что считается мировой бест-практикой ↔ источник. Это и есть «доказуемость» из запроса: каждая цифра/решение опирается на внешний ориентир.

Что делаемМировая бест-практикаИсточник
Smart Loader + no_hint: старт ~5,5K (W23–W25), no_hint ~3–10KКонтекст ≤ 40–60% окна; наименьший набор высокосигнальных токенов; компакцияAnthropic — Effective context engineering for AI agents (2026)
Session envelope dual-axis + Wave F/G subagent leversQuality cliff 60–75%; isolate exploration in sub-agents; bounded parallel 3–5 workers per requestAnthropic context engineering 2026; Cursor Task/subagent docs; H025/H026
Axis A v2 (0–3) + report 007 composite (93,2%)Многомерный scorecard + операционные KPI, не самооценкаMETR; SPACE; report 007 amendment 2026-06-20
cache_read 95–97% через стабильный префиксPrompt caching: −90% стоимости, −79% латентности на 100K кэшеAnthropic prompt caching
V3 0–3 + флаг пилота по классамШкала автономии L0–L4 / Tier 1–4; adaptive governance (повышение после измеримой стабильности)COMPEL Autonomy Spectrum; CSA NIST Agentic Profile
decisions/100M токенов как заголовочная метрикаcommits/LOC/DF искажаются под ИИ; durability- и complexity-взвешенные метрикиDORA 2026; METR 2025–2026
Композит 10 осей + операционные KPI, а не самооценкаСамооценка ненадёжна; нужен многомерный набор (SPACE / DX Core 4)METR; SPACE; DX Core 4
guardrails + decisions.jsonl + аудитДоказуемый человеческий надзор (provable oversight)NIST AI RMF; EU AI Act ст.14; ISO/IEC 42001

7. Итоговая архитектура контура

Из чего собран контур, который держит всё описанное выше: код и деплой, исполнение на Hub, мост агент↔Hub через MCP, русскоязычная маршрутизация интентов, векторная память и поиск по ней.

Git / Gitea
CT-116 (Proxmox), post-receive
Источник правды кода; push → автодеплой (валидации, guardrails, выкатка).
Automation Hub
CT-118, webhook + cron (SCH-*)
Исполнение процедур, оркестратор, Telegram, watcher; «скучный стабильный» слой.
MCP-мост
user-automation-hub + session_bootstrap
Канал агент↔Hub: session_bootstrap (Wave 1, 8 ролей), kanboard, intent_resolve, vector_search, resolve_subagent_orchestration (Wave G).
Русский лексический движок
pymorphy3 + synonym_map
Слой 1.5 маршрутизации интентов: нормализация словоформ, синонимы → intent.
Векторная БД
Qdrant :6333 + embedding :7071 (MiniLM 384-d; BGE-M3 условно)
Хранилище эмбеддингов решений и знаний; AI Services CT-119.
Векторный поиск
Butler RAG (decisions + knowledge)
Семантический поиск по опыту до открытия длинных MD (Rule 10).

Поток: фраза оператора → (pymorphy3 + synonym_map → intent → procedure) → скрипт на Hub → факт/артефакт → запись в decisions.jsonl → эмбеддинг в Qdrant → Butler RAG отдаёт это в следующий контекст. Код и результаты — через Git/Gitea с автодеплоем.

Источники: report 007 (routing/, autonomy daemon, Qdrant/embedding), butler target architecture; CT-116/118/119.

8. Ограничения и дорожная карта

Зачем этот раздел. Здесь честно перечислено, чего цифры выше НЕ доказывают и где их легко переоценить. Это не «отписка», а инструкция по чтению: прежде чем сослаться на любой график, проверьте, нет ли по нему оговорки ниже — тогда вывод останется корректным.

Честные оговорки (что цифры не доказывают)

Куда дальше

РычагОсьСтатус
Wave F — subagent content landfill H025 (Task explore, summary ≤2K)A, Fshipped DEC-012–014; 30d calibration; gate L2→L3 2026-07-21; pilot Kanban #141
Wave G — parallel subagent orchestration H026 (max 5 workers)F, Bshipped DEC-015; resolve_subagent_orchestration from natural query; fanout KPI baseline n=1
Narrative read plane + document_outcomes jsonl-firstE, Jshipped DEC-019-012–015; Butler-before-MD; run_document_outcomes_ship deterministic tail
Session envelope runtime (hooks + dual-axis + CLI statusLine)A, Cshipped DEC-014–016; fleet-uniform; IDE=Step0 bar, CLI=statusLine
no_hint pack + fleet keywords (shipped 2026-06-20)A, BDEC-002; post-boundary startup drop −81,7%
Axis A v2 canonical + CTO score 3A, CDEC-001; CTO 92% narrow / 7d, score 3 green
DevOps / Architect / CEO narrow adoptionA, Bkeywords расширены; 28d narrow 0% → ждём KPI
D4 startup-cut apply (L4)A, BArmed; streak 1/7
Phase 2 docs RAGE, AGate-check 2026-06-06
Dreaming / Outcomes (авто-калибровка)E, GAnthropic mid-2026; у нас пока вручную
Второй judge-провайдер + cross-judgeG, Iабстракция готова

Приложение. Источники и воспроизведение

Все числа воспроизводимы из источников ниже без ручных правок. Факты — слой AssetManager; этот доклад их только читает. Обновлено 2026-06-21 (Wave F/G + AN-009 refresh).

Факты (слой AssetManager)

Зрелость: ResearchAI/reports/007_2026-05-18_ai_first_maturity_vs_frontier.json · теория: ResearchAI/HUMAN_AI_MULTILAYER_ROLE_SPACE.md

Воспроизвести цифры

Ссылки (мировая практика)

  1. Anthropic — Effective context engineering for AI agents (2026)
  2. Context Engineering: Practical Guide for AI Agents (Sourcegraph, 2026)
  3. COMPEL — Autonomy Spectrum and Agent Taxonomy
  4. Cloud Security Alliance — NIST AI RMF Agentic Profile v1
  5. NIST AI Risk Management Framework
  6. Strata — A 2026 Guide to Human-in-the-Loop (EU AI Act Art.14)
  7. METR — Measuring the Impact of Early-2025 AI on Developer Productivity
  8. DORA Metrics Explained: Complete Guide 2026
  9. DX — How to measure developer productivity (Core 4 / AI Measurement)