пятница, 4 сентября 2026 г.

"Кто бы мог подумать, что это окажется так сложно?"

В 2014 году в Канадском журнале программной оценки была опубликована статья с интригующим названием: «К определению понятия оценки в канадском контексте: кто бы мог подумать, что это окажется так сложно?». Дело в том, что Канадское общество оценки (Canadian Evaluation Society) предприняло тогда попытку сформулировать определение понятия «оценка», с которым бы согласились все члены общества. Итог оказался неутешительным: «Как показали обзор литературы, анализ социальных медиа и дискуссии в профессиональном сообществе, единого определения оценки на сегодняшний день не существует… Более того, есть основания полагать, что выработать такое определение в канадском оценочном сообществе было бы крайне сложно. Среди возможных последствий обсуждался риск того, что единое определение может сузить или упростить существующую практику оценки, учитывая многообразие контекстов и целей, в которых она применяется в Канаде». Короче, не договорились. И это в одной из старейших профессиональных ассоциаций! 

А мы бы могли договориться с учетом российского контекста? Как думаете? Обсудим на Институте оценки в ноябре.

среда, 26 августа 2026 г.

Институт оценки в США развивает тему ИИ

Институт оценки (TEI) при Университете Клермонт-Грейдуэйт предлагает впечатляющий каталог курсов, который охватывает практически все аспекты современной оценочной деятельности. 

Сегодня пришло объявление о том, что открыта регистрация на осеннюю онлайновую программу 2026 года (26.10 - 06.11). 

Примечательно, что Институт активно реагирует на вызовы времени и включает множество курсов по использованию искусственного интеллекта в оценке, что делает его программу одной из самых прогрессивных в этой области:

TEI 340: Оценка программ с помощью ИИ — практический курс по использованию машинного обучения и больших языковых моделей (LLM) для автоматизации оценки с помощью платформы KNIME (без необходимости программирования).

TEI 336: Искусственный интеллект в оценке — курс, посвященный интеграции ИИ на всех этапах оценки: от разработки теории программы до анализа данных и визуализации.

TEI 343: Анализ данных и подготовка отчетов с помощью ИИ — практическое введение в использование ИИ для очистки данных, автоматизации статистического анализа и подготовки отчетов.

TEI 301: Основы теории и практики оценки в эпоху ИИ — базовый курс, обновленный с учетом влияния ИИ на оценочную практику.

TEI 334: Введение в генеративный ИИ для оценки — знакомство с такими инструментами, как ChatGPT, Gemini и NotebookLM для решения практических задач оценки.

На нашем Институте оценки, который пройдет офлайн в Москве в ноябре 2026 года тоже обязательно поговорим об использовании ИИ в оценке - в числе прочего (спойлер).  

среда, 19 августа 2026 г.

Оценка заявок на исследовательские гранты: чем может быть полезен ИИ

Диссертация на эту темы была опубликована в 2024 году (ссылка в конце). Вот четыре сферы, в которых, по мнению автора, от искусственного интеллекта есть или может быть польза: 

  • Скрининг и проверка заявок. Автоматическая проверка на соответствие требованиям. 
  • Подбор рецензентов. Семантический анализ заявок и профилей экспертов
  • Оценка и рейтингование. Переход от «одобрено/отклонено» к развернутой оценке. Объяснимость решений для стейкхолдеров.
  • Стратегическое «выравнивание». Учёт стратегических приоритетов агентства. Прогнозирование успеха. Категоризация заявок по приоритету.

Al-Ibrahim, H. (2024). The potential for artificial intelligence assistance in funding research (Doctoral dissertation, Frederick S. Pardee RAND Graduate School). RAND Corporation. 

вторник, 21 июля 2026 г.

Контекст и ракурс: 3 принципиальных отличия

1. Природа.

Контекст — это объективно существующая среда влияния, которую мы субъективно ограничиваем рамками нашего анализа. Это совокупность внешних сущностей, процессов и законов, которые система не контролирует, но обязана учитывать. Контекст отвечает на вопрос: «С чем система взаимодействует и в чем протекает ее жизнь?» (законодательство, экология, смежные системы, временные тренды). Контекст един для всех участников в рамках нашей аналитической модели, пока мы не переопределили границы системы.

Ракурс — это субъективная позиция. Это ментальная модель, призма, через которую конкретный наблюдатель видит этот самый контекст и саму систему. Ракурс отвечает на вопрос: «С какой позиции мы смотрим?» (донор, грантополучатель, благополучатель, конкурент). Ракурсов может быть бесконечное множество, и они могут радикально отличаться друг от друга.

2. Функция в анализе 

Контекст связан с определением границ. Системное мышление требует определить, что внутри системы, а что снаружи. Контекст — это потенциальное поле влияния. Граница — это наш выбор, какую часть этого поля мы включаем внутрь системы, а какую оставляем снаружи.

Ракурс выполняет функцию проекции. Это способ «увидеть» систему в контексте. Ракурс можно и нужно сознательно переключать, чтобы получить объемное представление о системе. Например, один и тот же социальный проект может быть для кого-то возможностью расширить круг общения, а для кого-то – способом сохранить семью.

3. Возможность влияния 

Контекст по определению находится вне зоны нашего влияния, поэтому мы не можем менять его напрямую — мы можем лишь адаптироваться к его изменениям. В отличие от ракурса, который мы переключаем мгновенно и произвольно.

PS Навеяно обсуждениями на заседании клуба PROОЦЕНКУ «Учет контекста в оценке»

среда, 8 июля 2026 г.

Эвалюатология: наука оценивания?

За 30 лет работы в области оценки не раз приходилось наблюдать, как люди, впервые пришедшие в эту сферу, берутся навести в ней порядок. Бывает, что такие инициативы проходят почти незаметно. Предполагаю, что статья, о которой пойдет речь ниже, незамеченной в международном профессиональном сообществе не останется, поскольку авторы претендуют на создание «науки и инженерии оценки».

Начну с цитаты.   

«Оценка является важнейшим аспектом человеческого существования и играет ключевую роль в каждой области. Однако зачастую к ней подходят эмпирически и ситуативно (ad-hoc), из-за чего отсутствует консенсус относительно универсальных понятий, терминологии, теорий и методологий. Это отсутствие согласия приводит к серьезным последствиям.

Данная статья призвана официально представить эвалюатологию (evaluatology) — дисциплину, которая охватывает науку и инженерию оценки. Мы предлагаем универсальную концептуальную базу для оценки, включающую понятия, терминологию, теории и методологии, которые могут применяться в различных, если не во всех дисциплинах».

Отметим, что журнал TBench и стоящий за ним BenchCouncil (International Open Benchmark Council) создавались и развивались в среде компьютерных наук и инженерии (бенчмарки производительности процессоров, систем ИИ и т.д.). Это как раз объясняет, почему язык и методология статей в этом журнале (включая статью про «эвалюатологию») радикально отличаются от языка, принятого в сообществе специалистов по оценке социальных программ. Для авторов статьи оценка — это эксперимент с контролируемыми условиями и математически формализованными переменными, что крайне сложно применить к социальным системам.

Ссылка на статью (есть в открытом доступе):

Zhan, J., Wang, L., Gao, W., Li, H., Wang, C., Huang, Y., Li, Y., Yang, Z., Kang, G., Luo, C., Ye, H., Dai, S., & Zhang, Z. (2024). Evaluatology: The science and engineering of evaluation. BenchCouncil Transactions on Benchmarks, Standards and Evaluations, 4(1), 1–25.

среда, 1 июля 2026 г.

"Плесните колдовства в хрустальный мрак бокала..."

Неожиданно для себя наткнулся на термин evidence-based evaluation, который можно перевести как оценка, основанная на данных или на доказательствах. Google даёт на этот термин около 800 тыс. ссылок, то есть довольно много. Вот, к примеру, публикация от инновационно-исследовательской программы Евросоюза (2020), предлагающая обзор такого подхода к оценке. Следуя сложившейся традиции, такую оценку можно было бы назвать «доказательной» - по аналогии с доказательной медициной, доказательным менеджментом и т.д.

Цитата из упомянутого выше пособия: "Доказательную оценку можно отличить от субъективной оценки и оценки по жестко заданным шаблонам. В то время как субъективная оценка опирается на интуицию, устоявшиеся традиции или личные знания, доказательная оценка строится на строгом анализе наилучших доступных данных. С другой стороны, оценка по жестким шаблонам обычно предопределена заранее и основывается преимущественно на взглядах самого оценщика, тогда как доказательная оценка учитывает предпочтения, потребности, ценности и особенности контекста заинтересованных сторон".

Термины "доказательная оценка" или "оценка, основанная на данных" кажутся мне избыточными. Указанные выше отличия от "субъективной оценки" и "оценки по жестко заданным шаблонам" выглядят крайне неубедительно. Если авторы имели в виду экспертную оценку, то это вполне легитимный подход, когда суждение основывается не на «взглядах», а на экспертизе, глубоком знании предмета. "Оценка по шаблонам" для меня вообще непонятна. 

Вот часто цитируемое определение Майкла Пэттона: «Оценка программы — это систематический сбор информации о деятельности в рамках программы, её характеристиках и результатах, который проводится для того, чтобы вынести суждение о программе, повысить её эффективность и/или разработать планы на будущее». 

Таким образом, оценка, не основанная на данных – это не оценка, если оставаться в профессиональном поле. 

Моя гипотеза: возможно, введение термина "доказательная оценка" было призвано добавить академизма. Отсюда - название сегодняшней публикации, заимствованное из известного романса "Напрасные слова" Давида Тухманова (музыка) и Ларисы Рубальской (стихи)  :)  На фото - Александр Малинин и Елена Темникова за исполнением этого произведения.

понедельник, 29 июня 2026 г.

Как обосновать, что вы используете практику с доказанной эффективностью

Будем исходить из положений «Стандарта доказательности практик в сфере детства» (МГППУ, 2021). 

«Социальную практику» стандарт определяет как "совокупность взаимосвязанных процедур и способов профессионального воздействия, направленных на достижение заранее запланированных позитивных изменений (социальных результатов) в жизни конкретных социальных групп или общества в целом".

Практикой с доказанной эффективностью называется "социальная практика, описанная в соответствии с правилами доказательного подхода и продемонстрировавшая свою эффективность в ходе исследований (в пользу эффективности которой есть эмпирические свидетельства, полученные в научных исследованиях и представленные профессиональному сообществу)". 

Правила доказательного подхода, согласно Стандарту, предполагают оценку практики по четырем критериям: 

  1. Обоснованность логической модели. Оценивается замысел практики — насколько действия соответствуют потребностям и позволяют достичь заявленных результатов. Максимальная оценка означает четкое понимание и обоснованность того, как и почему действия приведут к результату.
  2. Результативность (достижение социальных результатов). Оценивается фактическая результативность практики. Максимальная оценка подразумевает достижение устойчивых положительных результатов в сфере детства без негативных побочных эффектов.
  3. Обоснованность данных о результатах. Оценивается убедительность доказательств и строгость методологии оценки.
  4. Регламентированность практики. Оценивается стандартизированность и воспроизводимость процедур. Максимальная оценка означает высокую предсказуемость и повторяемость действий, закрепленных в методических рекомендациях и регламентах.

Для оценки степени доказанности эффективности практики Стандарт предлагает использовать порядковую шкалу, включающую начальный, базовый и продвинутый уровни. При этом отнесение практики к тому или иному уровню потребует их более-менее развернутого описания, которого в Стандарте пока нет. 

Три практических соображения: 

  • На мой взгляд было бы логично использовать идентичные шкалы для оценки по каждому из критериев. 
  • Было бы здорово также иметь методику для вынесения общего суждения о практике с учетом полученных по каждому критерию оценок. 
  • Я бы добавил к шкале «нулевой» уровень (когда какие-либо доказательства отсутствуют вовсе или почти отсутствуют), и «подтвержденный» уровень, следующий за продвинутым (когда есть все основания считать эффективность доказанной). 

вторник, 16 июня 2026 г.

Несколько вопросов об использовании результатов оценки

В октябре 2021 года вышло в свет 5-е издание книги Utilization Focused Evaluation (перевожу это название как «Оценка, ориентированная на практическое использование»). Автором первых 4-х изданий и автором самой концепции Utilization Focused Evaluation (UFE) является Майкл Куинн Пэттон (Michael Quinn Patton). Пятое издание гуру подготовил вместе со своей дочерью Шармейн (Charmagne E. Campbell-Patton).

У меня несколько вопросов:

  • Почему использование результатов оценки остается в поле зрения теоретиков и практиков оценки с 70-х годов прошлого века, когда вышло первое издание книги Пэттона? 
  • Означает ли это, что проблема использования результатов оценки сохраняется, как минимум, на протяжении последних 50 лет? 
  • Не наводит ли это на некоторые мысли относительно самой оценки как функции, дисциплины и профессии?

Думаю, что простого ответа на эти вопросы не существует. И здесь точно есть, о чем подумать и поговорить. В частности, я бы поговорил о том, как обстоят дела с использованием результатов само-оценивания и внутренней оценки. В таких случаях организация точно знает, зачем нужна оценка и использует полученные результаты соответствующим образом. Возможно, если бы оценка развивалась преимущественно «изнутри» организаций как функция управления, проблем с её использованием удалось бы избежать? Как думаете?

среда, 27 мая 2026 г.

Подмена проблемы

На семинаре по системному мышлению обсуждали концепцию «системных архетипов» Питера Сенге, описанных в книге «Пятая дисциплина» и в более поздних публикациях. Такие архетипы (по Сенге)  — это универсальные схемы, объясняющие, почему в разных ситуациях возникают схожие проблемы и почему стандартные решения часто не работают. Полагаю, это важно и для управленцев, и для тех, кто занимается оценкой проектов и программ.

Рассмотрим архетип «Подмена проблемы»: глубинная проблема проявляется в виде симптомов, требующих внимания. Однако зачастую из-за того, что она непонятна или ее решение слишком накладно, люди сдвигают фокус с проблемы на решения, которые им кажутся простыми и эффективными. К сожалению, простые «решения» ведут лишь к облегчению симптомов, тогда как сама проблема остается нерешенной. Она усугубляется, так как кажется, что симптомы исчезли, при этом постепенно система лишается оставшихся возможностей справиться с глубинной проблемой.

Ниже - примеры проявления этого архетипа для разных систем.

Управленческая система

  • Проблема: снижение прибыли из-за падения качества продукта.
  • Фундаментальное решение: вложиться в переобучение персонала, модернизацию контроля качества и доработку продукта (дорого и долго).
  • Симптоматическое решение: провести агрессивную рекламную кампанию «скидки 50%» и сократить расходы на персонал.
  • Подмена: прибыль временно растет за счет объема продаж, но качество падает еще сильнее. В итоге компания попадает в зависимость от постоянных скидок, а деньги на реальное улучшение продукта уже отсутствуют.

Личная продуктивность 

  • Проблема: хроническая усталость и выгорание.
  • Фундаментальное решение: нормализовать сон, уменьшить нагрузку, наладить баланс работа/отдых.
  • Симптоматическое решение: пить энергетики, кофе в больших дозах, брать работу на выходные.
  • Подмена: человек перестает искать причину усталости, полагаясь на стимуляторы. Со временем их эффективность падает, а здоровье ухудшается. Настоящая проблема (перегрузка) остается и усугубляется.

Здоровье

  • Проблема: регулярные головные боли.
  • Фундаментальное решение: обследование, поиск причины (например, проблемы с шеей, давлением или стресс).
  • Симптоматическое решение: постоянный прием обезболивающих.
  • Подмена: боли уходят на несколько часов, но причина не устранена. Возможно развитие лекарственно-индуцированной головной боли (от передозировки анальгетиков), и человек попадает в замкнутый круг: болит голова → пью таблетку → через время болит сильнее.

среда, 20 мая 2026 г.

Четыре измерения «мировоззрения»

На семинаре по системному мышлению обсуждали Критическую системную эвристику (Critical Systems Heuristics / CSH) Вернера Ульриха. Интересная особенность этого метода, по моим наблюдениям, состоит в том, что даже обсуждение инструментария (не применение, а только обсуждение) стимулирует рефлексию и бывает весьма интересным. Обычно, CSH представляют как систематизированную практику критического анализа представлений о границах системы. Одна из категорий границ – то, что Ульрих называет мировоззрением.

Ниже – фрагмент вчерашнего обсуждения. В контексте CSH «мировоззрение» имеет 4 измерения.

Измерение мировоззрения

Вопрос, на который отвечает

Пример (для проекта по работе с подростками)

Онтологическое (природа бытия)

Что считается «реальным»?

«Улучшение — это измеримый навык» vs «Улучшение — это субъективное ощущение»

Эпистемологическое (природа знания)

Как мы узнаём, что улучшение достигнуто?

«Через тесты» vs «Через отзывы родителей» vs «Через интервью с подростком»

Этическое

Что хорошо, а что плохо?

«Равноправие важнее иерархии» vs «Семейная ценность важнее автономии подростка»

Политическое

Кто имеет право принимать решения?

«Команда профессионалов» vs «Родители» vs «Сами подростки»

На рисунке - символ CSH со странички Вернера Ульриха