А мы бы могли договориться с учетом российского контекста? Как думаете? Обсудим на Институте оценки в ноябре.
Оценка программ и проектов
Заметки консультанта
пятница, 4 сентября 2026 г.
"Кто бы мог подумать, что это окажется так сложно?"
среда, 26 августа 2026 г.
Институт оценки в США развивает тему ИИ
Сегодня пришло объявление о том, что открыта регистрация на осеннюю онлайновую программу 2026 года (26.10 - 06.11).
Примечательно, что Институт активно реагирует на вызовы времени и включает множество курсов по использованию искусственного интеллекта в оценке, что делает его программу одной из самых прогрессивных в этой области:
TEI 340: Оценка программ с помощью ИИ — практический курс по
использованию машинного обучения и больших языковых моделей (LLM) для
автоматизации оценки с помощью платформы KNIME (без необходимости
программирования).
TEI 336: Искусственный интеллект в оценке — курс,
посвященный интеграции ИИ на всех этапах оценки: от разработки теории программы
до анализа данных и визуализации.
TEI 343: Анализ данных и подготовка отчетов с помощью ИИ —
практическое введение в использование ИИ для очистки данных, автоматизации
статистического анализа и подготовки отчетов.
TEI 301: Основы теории и практики оценки в эпоху ИИ —
базовый курс, обновленный с учетом влияния ИИ на оценочную практику.
TEI 334: Введение в генеративный ИИ для оценки — знакомство
с такими инструментами, как ChatGPT, Gemini и NotebookLM для решения
практических задач оценки.
среда, 19 августа 2026 г.
Оценка заявок на исследовательские гранты: чем может быть полезен ИИ
- Скрининг и проверка заявок. Автоматическая проверка на соответствие требованиям.
- Подбор рецензентов. Семантический анализ заявок и профилей экспертов
- Оценка и рейтингование. Переход от «одобрено/отклонено» к развернутой оценке. Объяснимость решений для стейкхолдеров.
- Стратегическое «выравнивание». Учёт стратегических приоритетов агентства. Прогнозирование успеха. Категоризация заявок по приоритету.
Al-Ibrahim, H. (2024). The potential for artificial intelligence assistance in funding research (Doctoral dissertation, Frederick S. Pardee RAND Graduate School). RAND Corporation.
вторник, 21 июля 2026 г.
Контекст и ракурс: 3 принципиальных отличия
Контекст — это объективно существующая среда влияния, которую мы субъективно ограничиваем рамками нашего анализа. Это совокупность внешних сущностей, процессов и законов, которые система не контролирует, но обязана учитывать. Контекст отвечает на вопрос: «С чем система взаимодействует и в чем протекает ее жизнь?» (законодательство, экология, смежные системы, временные тренды). Контекст един для всех участников в рамках нашей аналитической модели, пока мы не переопределили границы системы.
Ракурс — это субъективная позиция. Это ментальная модель, призма, через которую конкретный наблюдатель видит этот самый контекст и саму систему. Ракурс отвечает на вопрос: «С какой позиции мы смотрим?» (донор, грантополучатель, благополучатель, конкурент). Ракурсов может быть бесконечное множество, и они могут радикально отличаться друг от друга.
2. Функция в анализе
Контекст связан с определением границ. Системное мышление требует определить, что внутри системы, а что снаружи. Контекст — это потенциальное поле влияния. Граница — это наш выбор, какую часть этого поля мы включаем внутрь системы, а какую оставляем снаружи.
Ракурс выполняет функцию проекции. Это способ «увидеть» систему в контексте. Ракурс можно и нужно сознательно переключать, чтобы получить объемное представление о системе. Например, один и тот же социальный проект может быть для кого-то возможностью расширить круг общения, а для кого-то – способом сохранить семью.
3. Возможность влияния
Контекст по определению находится вне зоны нашего влияния, поэтому мы не можем менять его напрямую — мы можем лишь адаптироваться к его изменениям. В отличие от ракурса, который мы переключаем мгновенно и произвольно.
PS Навеяно обсуждениями на заседании клуба PROОЦЕНКУ «Учет контекста в оценке»
среда, 8 июля 2026 г.
Эвалюатология: наука оценивания?
Начну с цитаты.
«Оценка является важнейшим аспектом человеческого
существования и играет ключевую роль в каждой области. Однако зачастую к ней
подходят эмпирически и ситуативно (ad-hoc), из-за чего отсутствует консенсус
относительно универсальных понятий, терминологии, теорий и методологий. Это
отсутствие согласия приводит к серьезным последствиям.
Данная статья призвана официально представить эвалюатологию
(evaluatology) — дисциплину, которая охватывает науку и инженерию оценки. Мы
предлагаем универсальную концептуальную базу для оценки, включающую понятия,
терминологию, теории и методологии, которые могут применяться в различных, если
не во всех дисциплинах».
Отметим, что журнал TBench и стоящий за ним BenchCouncil
(International Open Benchmark Council) создавались и развивались в среде
компьютерных наук и инженерии (бенчмарки производительности процессоров, систем
ИИ и т.д.). Это как раз объясняет, почему язык и методология статей в этом
журнале (включая статью про «эвалюатологию») радикально отличаются от языка,
принятого в сообществе специалистов по оценке социальных программ. Для авторов
статьи оценка — это эксперимент с контролируемыми условиями и математически
формализованными переменными, что крайне сложно применить к социальным
системам.
Ссылка на статью (есть в открытом доступе):
Zhan, J., Wang, L., Gao, W., Li, H., Wang, C., Huang, Y., Li, Y., Yang, Z., Kang, G., Luo, C., Ye, H., Dai, S., & Zhang, Z. (2024). Evaluatology: The science and engineering of evaluation. BenchCouncil Transactions on Benchmarks, Standards and Evaluations, 4(1), 1–25.
среда, 1 июля 2026 г.
"Плесните колдовства в хрустальный мрак бокала..."
Цитата из упомянутого выше пособия: "Доказательную оценку можно отличить от субъективной оценки и оценки по жестко заданным шаблонам. В то время как субъективная оценка опирается на интуицию, устоявшиеся традиции или личные знания, доказательная оценка строится на строгом анализе наилучших доступных данных. С другой стороны, оценка по жестким шаблонам обычно предопределена заранее и основывается преимущественно на взглядах самого оценщика, тогда как доказательная оценка учитывает предпочтения, потребности, ценности и особенности контекста заинтересованных сторон".
Термины "доказательная оценка" или "оценка, основанная на данных" кажутся мне избыточными. Указанные выше отличия от "субъективной оценки" и "оценки по жестко заданным шаблонам" выглядят крайне неубедительно. Если авторы имели в виду экспертную оценку, то это вполне легитимный подход, когда суждение основывается не на «взглядах», а на экспертизе, глубоком знании предмета. "Оценка по шаблонам" для меня вообще непонятна.
Вот часто цитируемое определение Майкла Пэттона: «Оценка программы — это систематический сбор информации о деятельности в рамках программы, её характеристиках и результатах, который проводится для того, чтобы вынести суждение о программе, повысить её эффективность и/или разработать планы на будущее».
Таким образом, оценка, не основанная на данных – это не оценка, если оставаться в профессиональном поле.
Моя гипотеза: возможно, введение термина "доказательная оценка" было призвано добавить академизма. Отсюда - название сегодняшней публикации, заимствованное из известного романса "Напрасные слова" Давида Тухманова (музыка) и Ларисы Рубальской (стихи) :) На фото - Александр Малинин и Елена Темникова за исполнением этого произведения.
понедельник, 29 июня 2026 г.
Как обосновать, что вы используете практику с доказанной эффективностью
«Социальную практику» стандарт определяет как "совокупность взаимосвязанных процедур и способов профессионального воздействия, направленных на достижение заранее запланированных позитивных изменений (социальных результатов) в жизни конкретных социальных групп или общества в целом".
Практикой с доказанной эффективностью называется "социальная практика, описанная в соответствии с правилами доказательного подхода и продемонстрировавшая свою эффективность в ходе исследований (в пользу эффективности которой есть эмпирические свидетельства, полученные в научных исследованиях и представленные профессиональному сообществу)".
Правила доказательного подхода, согласно Стандарту, предполагают оценку практики по четырем критериям:
- Обоснованность логической модели. Оценивается замысел практики — насколько действия соответствуют потребностям и позволяют достичь заявленных результатов. Максимальная оценка означает четкое понимание и обоснованность того, как и почему действия приведут к результату.
- Результативность (достижение социальных результатов). Оценивается фактическая результативность практики. Максимальная оценка подразумевает достижение устойчивых положительных результатов в сфере детства без негативных побочных эффектов.
- Обоснованность данных о результатах. Оценивается убедительность доказательств и строгость методологии оценки.
- Регламентированность практики. Оценивается стандартизированность и воспроизводимость процедур. Максимальная оценка означает высокую предсказуемость и повторяемость действий, закрепленных в методических рекомендациях и регламентах.
Для оценки степени доказанности эффективности практики Стандарт предлагает использовать порядковую шкалу, включающую начальный, базовый и продвинутый уровни. При этом отнесение практики к тому или иному уровню потребует их более-менее развернутого описания, которого в Стандарте пока нет.
Три практических соображения:
- На мой взгляд было бы логично использовать идентичные шкалы для оценки по каждому из критериев.
- Было бы здорово также иметь методику для вынесения общего суждения о практике с учетом полученных по каждому критерию оценок.
- Я бы добавил к шкале «нулевой» уровень (когда какие-либо доказательства отсутствуют вовсе или почти отсутствуют), и «подтвержденный» уровень, следующий за продвинутым (когда есть все основания считать эффективность доказанной).
вторник, 16 июня 2026 г.
Несколько вопросов об использовании результатов оценки
У меня несколько вопросов:
- Почему использование результатов оценки остается в поле зрения теоретиков и практиков оценки с 70-х годов прошлого века, когда вышло первое издание книги Пэттона?
- Означает ли это, что проблема использования результатов оценки сохраняется, как минимум, на протяжении последних 50 лет?
- Не наводит ли это на некоторые мысли относительно самой оценки как функции, дисциплины и профессии?
среда, 27 мая 2026 г.
Подмена проблемы
Рассмотрим архетип «Подмена проблемы»: глубинная проблема проявляется в виде симптомов, требующих внимания. Однако зачастую из-за того, что она непонятна или ее решение слишком накладно, люди сдвигают фокус с проблемы на решения, которые им кажутся простыми и эффективными. К сожалению, простые «решения» ведут лишь к облегчению симптомов, тогда как сама проблема остается нерешенной. Она усугубляется, так как кажется, что симптомы исчезли, при этом постепенно система лишается оставшихся возможностей справиться с глубинной проблемой.
Ниже - примеры проявления этого архетипа для разных систем.
Управленческая система
- Проблема: снижение прибыли из-за падения качества продукта.
- Фундаментальное решение: вложиться в переобучение персонала, модернизацию контроля качества и доработку продукта (дорого и долго).
- Симптоматическое решение: провести агрессивную рекламную кампанию «скидки 50%» и сократить расходы на персонал.
- Подмена: прибыль временно растет за счет объема продаж, но качество падает еще сильнее. В итоге компания попадает в зависимость от постоянных скидок, а деньги на реальное улучшение продукта уже отсутствуют.
Личная продуктивность
- Проблема: хроническая усталость и выгорание.
- Фундаментальное решение: нормализовать сон, уменьшить нагрузку, наладить баланс работа/отдых.
- Симптоматическое решение: пить энергетики, кофе в больших дозах, брать работу на выходные.
- Подмена: человек перестает искать причину усталости, полагаясь на стимуляторы. Со временем их эффективность падает, а здоровье ухудшается. Настоящая проблема (перегрузка) остается и усугубляется.
Здоровье
- Проблема: регулярные головные боли.
- Фундаментальное решение: обследование, поиск причины (например, проблемы с шеей, давлением или стресс).
- Симптоматическое решение: постоянный прием обезболивающих.
- Подмена: боли уходят на несколько часов, но причина не устранена. Возможно развитие лекарственно-индуцированной головной боли (от передозировки анальгетиков), и человек попадает в замкнутый круг: болит голова → пью таблетку → через время болит сильнее.
среда, 20 мая 2026 г.
Четыре измерения «мировоззрения»
Измерение мировоззрения |
Вопрос, на который отвечает |
Пример (для проекта по работе с подростками) |
|
Онтологическое (природа бытия) |
Что считается «реальным»? |
«Улучшение — это измеримый навык» vs «Улучшение — это
субъективное ощущение» |
|
Эпистемологическое (природа знания) |
Как мы узнаём, что улучшение достигнуто? |
«Через тесты» vs «Через отзывы родителей» vs «Через
интервью с подростком» |
|
Этическое |
Что хорошо, а что плохо? |
«Равноправие важнее иерархии» vs «Семейная ценность важнее
автономии подростка» |
|
Политическое |
Кто имеет право принимать решения? |
«Команда профессионалов» vs «Родители» vs «Сами подростки» |




