Пост из Telegram-канала «Digital-Задроты в B2B»

Как я заставляю нейронки проверять свои косяки

У меня есть правило: чем красивее выглядит длинный AI-отчёт, тем сильнее его надо проверять.

Потому что нейронка может собрать аккуратный документ, разложить всё по разделам, сделать выводы, написать уверенным тоном. А потом выясняется, что часть фактов потерялась, цитата не бьётся с источником, цифра взялась непонятно откуда, а вывод получился сильнее, чем позволяют данные.

Особенно это проявляется в реальной работе над проектами.
Когда агенту нужно разобрать несколько файлов, транскриптов, ссылок, заметок, собрать фактуру и превратить всё это в документ, который потом реально идёт в работу.

Для таких задач я сделал себе отдельный skill: quality-check.

Его задача простая: заставить нейронку не просто сказать «готово», а пройтись по результату как ревизор.

Он проверяет:

  • — где остались пробелы и неподтверждённые места;
  • — совпадает ли результат с исходной задачей;
  • — какие цифры, цитаты и ответственные нужно сверить;
  • — где вывод слишком уверенный для имеющихся данных;
  • — можно ли использовать документ as-is или его нужно дорабатывать.

Один из показательных случаев был с документом для выступления.

Внешне всё выглядело нормально: тезисы собраны, логика есть, структура аккуратная. Но quality-check поставил оценку 0.59 и подсветил несколько проблемных зон.

Во-первых, в документе была цитата, которую нейронка немного переписала. Вроде мелочь, но если цитата используется как доказательство, она должна быть либо дословной, либо честно обозначенной как адаптация.

Во-вторых, часть цифр была без первоисточника. Не обязательно неправильные, но непонятно, откуда они появились. А значит, их нельзя спокойно тащить дальше без проверки.

И самое полезное: skill не сказал «ну в целом норм». Он расписал конкретные проблемные зоны, которые можно легко проверить.

Вот за это я его и люблю.

Он подсвечивает конкретные зоны риска: здесь нет источника, здесь цитата изменилась, здесь вывод звучит увереннее, чем позволяют данные. Я могу быстро открыть нужное место, проверить и сразу понять, бьётся оно или нет.

Ещё он иногда неплохо ловит смещение в подтверждение.

Например, когда в документе собраны только позитивные факты, а негативные сигналы или ограничения вообще не искались. Для AI это типичная история: красиво собрать то, что подтверждает текущую логику, и не заметить, что выборка однобокая.

Лайфхак для улучшения анализа — запускать такую проверку другой моделью.

Например, основной документ собирается в Claude Code с Opus, а проверку я прогоняю через Codex с GPT с доступом к тем же локальным файлам. Разные модели заметно лучше подсвечивают косяки друг друга, чем когда одна и та же модель сама себя проверяет в том же контексте.

Важно: это не волшебная кнопка «найти все ошибки».

Skill не гарантирует, что поймает каждую кривую гипотезу или слишком широкое обобщение. Такие вещи и люди не всегда быстро ловят. Особенно если документ большой, источников много, а фактура размазана по разным местам.

По моим ощущениям, он хорошо ловит самые яркие и опасные косяки: цифры без источника, неподтверждённые цитаты, потерянные ограничения, уехавший фокус, слишком уверенные формулировки.

А если документ прям большой, проверку лучше дробить на части. Иначе сама проверяющая модель тоже начинает терять детали.

Выложил публичную версию здесь:
https://github.com/MainFrame100/quality-check-skill

Там есть сам .skill, README на русском и английском и описание логики работы. Можно брать и адаптировать под себя, только сохраняйте ссылку на источник.

Можете скормить эту ссылку своей нейронке. Она поймет как его установить и подскажет по использованию

Оригинал

Пост опубликован в Telegram-канале 12 мая 2026. Комментарии и реакции — там.

Обсудить в Telegram