measure-methodologylisted
Install: claude install-skill VibeEngineering-LLC/agent-ops-doctrine
# measure-methodology — как не обмануться собственным измерением
Скилл вырос из двух независимых документов, написанных в один день (2026-08-23) двумя
контурами, не видевшими друг друга: методика производительности прошивок (ESP32,
`perf-methodology.md`: «вся история багов должна стать методикой») и база ловушек бенчмарка
локальных моделей (Codeaudit, 11 дефектов стенда до первой публикации). Убрав предмет, оба
документа говорят одно и то же. Это ядро — то общее; предмет живёт в профилях.
## Главный закон: стенд поверяется раньше объекта
**Измерительный инструмент — такой же объект испытаний, как и измеряемое, и проверяется
теми же процедурами.** Пока не показано, что стенд выдаёт максимум на заведомо верном входе
и меньше максимума — на заведомо неверном, его числа не значат ничего. «Скрипт отработал и
напечатал таблицу» — наличие ВЫХОДА, а не РЕЗУЛЬТАТА (#SA-3 глобальной доктрины).
Цена урока фактом: в бенчмарке LLM из 11 найденных дефектов **7 были в стенде, не в моделях**,
и пять из них делали балл не связанным с работой модели (случайный эталон; ноль за верный
ответ в другом регистре; полный балл за 1/200 работы; режим API обрывал ответ у всех).
Рейтинг моделей, выданный до поверки стенда, был бы правдоподобен и целиком ложен.
## Три исхода любого измерения — различать явно, не смешивать
| Исход | Признак | Что делать |
|---|---|---|
| **Свойство объекта** | разные объекты дают РАЗНЫЕ результаты; сырой ответ/лог согласуется с баллом | публиковать |
| **Сбой среды**