А мы бы могли договориться с учетом российского контекста? Как думаете? Обсудим на Институте оценки в ноябре.
пятница, 4 сентября 2026 г.
"Кто бы мог подумать, что это окажется так сложно?"
среда, 26 августа 2026 г.
Институт оценки в США развивает тему ИИ
Сегодня пришло объявление о том, что открыта регистрация на осеннюю онлайновую программу 2026 года (26.10 - 06.11).
Примечательно, что Институт активно реагирует на вызовы времени и включает множество курсов по использованию искусственного интеллекта в оценке, что делает его программу одной из самых прогрессивных в этой области:
TEI 340: Оценка программ с помощью ИИ — практический курс по
использованию машинного обучения и больших языковых моделей (LLM) для
автоматизации оценки с помощью платформы KNIME (без необходимости
программирования).
TEI 336: Искусственный интеллект в оценке — курс,
посвященный интеграции ИИ на всех этапах оценки: от разработки теории программы
до анализа данных и визуализации.
TEI 343: Анализ данных и подготовка отчетов с помощью ИИ —
практическое введение в использование ИИ для очистки данных, автоматизации
статистического анализа и подготовки отчетов.
TEI 301: Основы теории и практики оценки в эпоху ИИ —
базовый курс, обновленный с учетом влияния ИИ на оценочную практику.
TEI 334: Введение в генеративный ИИ для оценки — знакомство
с такими инструментами, как ChatGPT, Gemini и NotebookLM для решения
практических задач оценки.
среда, 19 августа 2026 г.
Оценка заявок на исследовательские гранты: чем может быть полезен ИИ
- Скрининг и проверка заявок. Автоматическая проверка на соответствие требованиям.
- Подбор рецензентов. Семантический анализ заявок и профилей экспертов
- Оценка и рейтингование. Переход от «одобрено/отклонено» к развернутой оценке. Объяснимость решений для стейкхолдеров.
- Стратегическое «выравнивание». Учёт стратегических приоритетов агентства. Прогнозирование успеха. Категоризация заявок по приоритету.
Al-Ibrahim, H. (2024). The potential for artificial intelligence assistance in funding research (Doctoral dissertation, Frederick S. Pardee RAND Graduate School). RAND Corporation.
вторник, 21 июля 2026 г.
Контекст и ракурс: 3 принципиальных отличия
Контекст — это объективно существующая среда влияния, которую мы субъективно ограничиваем рамками нашего анализа. Это совокупность внешних сущностей, процессов и законов, которые система не контролирует, но обязана учитывать. Контекст отвечает на вопрос: «С чем система взаимодействует и в чем протекает ее жизнь?» (законодательство, экология, смежные системы, временные тренды). Контекст един для всех участников в рамках нашей аналитической модели, пока мы не переопределили границы системы.
Ракурс — это субъективная позиция. Это ментальная модель, призма, через которую конкретный наблюдатель видит этот самый контекст и саму систему. Ракурс отвечает на вопрос: «С какой позиции мы смотрим?» (донор, грантополучатель, благополучатель, конкурент). Ракурсов может быть бесконечное множество, и они могут радикально отличаться друг от друга.
2. Функция в анализе
Контекст связан с определением границ. Системное мышление требует определить, что внутри системы, а что снаружи. Контекст — это потенциальное поле влияния. Граница — это наш выбор, какую часть этого поля мы включаем внутрь системы, а какую оставляем снаружи.
Ракурс выполняет функцию проекции. Это способ «увидеть» систему в контексте. Ракурс можно и нужно сознательно переключать, чтобы получить объемное представление о системе. Например, один и тот же социальный проект может быть для кого-то возможностью расширить круг общения, а для кого-то – способом сохранить семью.
3. Возможность влияния
Контекст по определению находится вне зоны нашего влияния, поэтому мы не можем менять его напрямую — мы можем лишь адаптироваться к его изменениям. В отличие от ракурса, который мы переключаем мгновенно и произвольно.
PS Навеяно обсуждениями на заседании клуба PROОЦЕНКУ «Учет контекста в оценке»
среда, 8 июля 2026 г.
Эвалюатология: наука оценивания?
Начну с цитаты.
«Оценка является важнейшим аспектом человеческого
существования и играет ключевую роль в каждой области. Однако зачастую к ней
подходят эмпирически и ситуативно (ad-hoc), из-за чего отсутствует консенсус
относительно универсальных понятий, терминологии, теорий и методологий. Это
отсутствие согласия приводит к серьезным последствиям.
Данная статья призвана официально представить эвалюатологию
(evaluatology) — дисциплину, которая охватывает науку и инженерию оценки. Мы
предлагаем универсальную концептуальную базу для оценки, включающую понятия,
терминологию, теории и методологии, которые могут применяться в различных, если
не во всех дисциплинах».
Отметим, что журнал TBench и стоящий за ним BenchCouncil
(International Open Benchmark Council) создавались и развивались в среде
компьютерных наук и инженерии (бенчмарки производительности процессоров, систем
ИИ и т.д.). Это как раз объясняет, почему язык и методология статей в этом
журнале (включая статью про «эвалюатологию») радикально отличаются от языка,
принятого в сообществе специалистов по оценке социальных программ. Для авторов
статьи оценка — это эксперимент с контролируемыми условиями и математически
формализованными переменными, что крайне сложно применить к социальным
системам.
Ссылка на статью (есть в открытом доступе):
Zhan, J., Wang, L., Gao, W., Li, H., Wang, C., Huang, Y., Li, Y., Yang, Z., Kang, G., Luo, C., Ye, H., Dai, S., & Zhang, Z. (2024). Evaluatology: The science and engineering of evaluation. BenchCouncil Transactions on Benchmarks, Standards and Evaluations, 4(1), 1–25.
среда, 1 июля 2026 г.
"Плесните колдовства в хрустальный мрак бокала..."
Цитата из упомянутого выше пособия: "Доказательную оценку можно отличить от субъективной оценки и оценки по жестко заданным шаблонам. В то время как субъективная оценка опирается на интуицию, устоявшиеся традиции или личные знания, доказательная оценка строится на строгом анализе наилучших доступных данных. С другой стороны, оценка по жестким шаблонам обычно предопределена заранее и основывается преимущественно на взглядах самого оценщика, тогда как доказательная оценка учитывает предпочтения, потребности, ценности и особенности контекста заинтересованных сторон".
Термины "доказательная оценка" или "оценка, основанная на данных" кажутся мне избыточными. Указанные выше отличия от "субъективной оценки" и "оценки по жестко заданным шаблонам" выглядят крайне неубедительно. Если авторы имели в виду экспертную оценку, то это вполне легитимный подход, когда суждение основывается не на «взглядах», а на экспертизе, глубоком знании предмета. "Оценка по шаблонам" для меня вообще непонятна.
Вот часто цитируемое определение Майкла Пэттона: «Оценка программы — это систематический сбор информации о деятельности в рамках программы, её характеристиках и результатах, который проводится для того, чтобы вынести суждение о программе, повысить её эффективность и/или разработать планы на будущее».
Таким образом, оценка, не основанная на данных – это не оценка, если оставаться в профессиональном поле.
Моя гипотеза: возможно, введение термина "доказательная оценка" было призвано добавить академизма. Отсюда - название сегодняшней публикации, заимствованное из известного романса "Напрасные слова" Давида Тухманова (музыка) и Ларисы Рубальской (стихи) :) На фото - Александр Малинин и Елена Темникова за исполнением этого произведения.
понедельник, 29 июня 2026 г.
Как обосновать, что вы используете практику с доказанной эффективностью
«Социальную практику» стандарт определяет как "совокупность взаимосвязанных процедур и способов профессионального воздействия, направленных на достижение заранее запланированных позитивных изменений (социальных результатов) в жизни конкретных социальных групп или общества в целом".
Практикой с доказанной эффективностью называется "социальная практика, описанная в соответствии с правилами доказательного подхода и продемонстрировавшая свою эффективность в ходе исследований (в пользу эффективности которой есть эмпирические свидетельства, полученные в научных исследованиях и представленные профессиональному сообществу)".
Правила доказательного подхода, согласно Стандарту, предполагают оценку практики по четырем критериям:
- Обоснованность логической модели. Оценивается замысел практики — насколько действия соответствуют потребностям и позволяют достичь заявленных результатов. Максимальная оценка означает четкое понимание и обоснованность того, как и почему действия приведут к результату.
- Результативность (достижение социальных результатов). Оценивается фактическая результативность практики. Максимальная оценка подразумевает достижение устойчивых положительных результатов в сфере детства без негативных побочных эффектов.
- Обоснованность данных о результатах. Оценивается убедительность доказательств и строгость методологии оценки.
- Регламентированность практики. Оценивается стандартизированность и воспроизводимость процедур. Максимальная оценка означает высокую предсказуемость и повторяемость действий, закрепленных в методических рекомендациях и регламентах.
Для оценки степени доказанности эффективности практики Стандарт предлагает использовать порядковую шкалу, включающую начальный, базовый и продвинутый уровни. При этом отнесение практики к тому или иному уровню потребует их более-менее развернутого описания, которого в Стандарте пока нет.
Три практических соображения:
- На мой взгляд было бы логично использовать идентичные шкалы для оценки по каждому из критериев.
- Было бы здорово также иметь методику для вынесения общего суждения о практике с учетом полученных по каждому критерию оценок.
- Я бы добавил к шкале «нулевой» уровень (когда какие-либо доказательства отсутствуют вовсе или почти отсутствуют), и «подтвержденный» уровень, следующий за продвинутым (когда есть все основания считать эффективность доказанной).
вторник, 16 июня 2026 г.
Несколько вопросов об использовании результатов оценки
У меня несколько вопросов:
- Почему использование результатов оценки остается в поле зрения теоретиков и практиков оценки с 70-х годов прошлого века, когда вышло первое издание книги Пэттона?
- Означает ли это, что проблема использования результатов оценки сохраняется, как минимум, на протяжении последних 50 лет?
- Не наводит ли это на некоторые мысли относительно самой оценки как функции, дисциплины и профессии?
среда, 27 мая 2026 г.
Подмена проблемы
Рассмотрим архетип «Подмена проблемы»: глубинная проблема проявляется в виде симптомов, требующих внимания. Однако зачастую из-за того, что она непонятна или ее решение слишком накладно, люди сдвигают фокус с проблемы на решения, которые им кажутся простыми и эффективными. К сожалению, простые «решения» ведут лишь к облегчению симптомов, тогда как сама проблема остается нерешенной. Она усугубляется, так как кажется, что симптомы исчезли, при этом постепенно система лишается оставшихся возможностей справиться с глубинной проблемой.
Ниже - примеры проявления этого архетипа для разных систем.
Управленческая система
- Проблема: снижение прибыли из-за падения качества продукта.
- Фундаментальное решение: вложиться в переобучение персонала, модернизацию контроля качества и доработку продукта (дорого и долго).
- Симптоматическое решение: провести агрессивную рекламную кампанию «скидки 50%» и сократить расходы на персонал.
- Подмена: прибыль временно растет за счет объема продаж, но качество падает еще сильнее. В итоге компания попадает в зависимость от постоянных скидок, а деньги на реальное улучшение продукта уже отсутствуют.
Личная продуктивность
- Проблема: хроническая усталость и выгорание.
- Фундаментальное решение: нормализовать сон, уменьшить нагрузку, наладить баланс работа/отдых.
- Симптоматическое решение: пить энергетики, кофе в больших дозах, брать работу на выходные.
- Подмена: человек перестает искать причину усталости, полагаясь на стимуляторы. Со временем их эффективность падает, а здоровье ухудшается. Настоящая проблема (перегрузка) остается и усугубляется.
Здоровье
- Проблема: регулярные головные боли.
- Фундаментальное решение: обследование, поиск причины (например, проблемы с шеей, давлением или стресс).
- Симптоматическое решение: постоянный прием обезболивающих.
- Подмена: боли уходят на несколько часов, но причина не устранена. Возможно развитие лекарственно-индуцированной головной боли (от передозировки анальгетиков), и человек попадает в замкнутый круг: болит голова → пью таблетку → через время болит сильнее.
среда, 20 мая 2026 г.
Четыре измерения «мировоззрения»
Измерение мировоззрения |
Вопрос, на который отвечает |
Пример (для проекта по работе с подростками) |
|
Онтологическое (природа бытия) |
Что считается «реальным»? |
«Улучшение — это измеримый навык» vs «Улучшение — это
субъективное ощущение» |
|
Эпистемологическое (природа знания) |
Как мы узнаём, что улучшение достигнуто? |
«Через тесты» vs «Через отзывы родителей» vs «Через
интервью с подростком» |
|
Этическое |
Что хорошо, а что плохо? |
«Равноправие важнее иерархии» vs «Семейная ценность важнее
автономии подростка» |
|
Политическое |
Кто имеет право принимать решения? |
«Команда профессионалов» vs «Родители» vs «Сами подростки» |
пятница, 15 мая 2026 г.
На какие вопросы оценка не ответит
- В какой мере изменились потребности целевой группы за период реализации проекта? Насколько проект смог адаптироваться к этим изменениям?
- Какова должна быть стратегия развития проекта на ближайшие годы?
среда, 6 мая 2026 г.
Оценка, помогающая обрести веру в свои силы
Замысел ЕЕ (с позиции внешнего консультанта) можно описать примерно так : «EE — это оценка, в которой профессиональный внешний оценщик сознательно уходит из позиции «эксперта, выносящего суждения» и занимает позицию «тренера-фасилитатора», передавая инструменты оценки участникам и благополучателям программы (стейкхолдерам). Успех оценки измеряется не точностью рекомендаций оценщика, а способностью сообщества самостоятельно продолжать оценочную практику после ухода внешнего консультанта (фасилитатора). При этом граница профессии проходит там, где оценщик начинает подменять своими действиями совместную деятельность участников. Его задачи в рамках ЕЕ - воодушевлять, учить, поддерживать».
Основные принципы ЕЕ:
- Улучшение — фокус на том, чтобы помочь программе добиться успеха.
- Общественное владение — контроль за оценкой принадлежит самой организации/сообществу.
- Инклюзивность — вовлечение всех ключевых заинтересованных сторон.
- Демократическое участие — оценка как сотрудничество, совместная деятельность.
- Социальная справедливость — цель подхода — влиять на ситуацию с прицелом на общественное благо.
- Знание сообщества — уважение и использование опыта и мудрости самого сообщества.
- Использование доказательных стратегий — уважение к тому, что уже признано эффективным наукой и практикой.
- Создание потенциала — обучение команды базовым навыкам оценки для лучшего понимания и использования данных.
- Организационное обучение — формирование в организации культуры обучения.
- Подотчетность — измерение достижения целей, при этом и положительные, и отрицательные результаты считаются ценными для дальнейших улучшений.
среда, 29 апреля 2026 г.
Оценка воздействия результатов оценки
В сообществе XCEval (значительно более 1000 подписчиков по всему миру) сейчас обсуждается свежая публикация EVALSDGs*, название которой по смыслу можно перевести как «Руководство по проведению оценки, следующей за оценкой» («Follow-up Evaluation Guidance»).
Автор (Denis Jobin) указывает на то, что мало отслеживать лишь выполнение рекомендаций, содержащихся в отчете о проведении внешней оценки (это отслеживание - вопрос внутреннего управленческого контроля). По мнению автора, нужно еще уделить внимание тому, каковы результаты внедрения этих рекомендаций. А для этого надо провести внешнюю оценку использования результатов внешней оценки.
Приведу определение такой оценки (будем называть её «последующей») из упомянутого руководства:
«Последующая оценка представляет собой систематический и независимый ассесмент (assessment) того, были ли реализованы рекомендации и согласованные действия, полученные в ходе предыдущей оценки, были ли они достаточны для устранения первоначальных проблем и их коренных причин, а также способствовали ли они улучшению политики, программ, систем, процесса принятия решений или результатов.
Она отличается от рутинного отслеживания реакции менеджмента на результаты внешней оценки. Отслеживание реакции обычно заключается в проверке того, были ли выполнены согласованные по итогам оценки действия. Последующая (внешняя – АК) оценка задает более глубокий оценочный вопрос: привели ли предпринятые действия к результату, устранили ли первоначальную проблему и снизили ли связанные с ней риски?».
Как вам такая идея? Если «прокатит», то у внешних оценщиков в системе ООН появятся дополнительные заказы. Но что-то мне подсказывает, что менеджеры и руководители программ могут быть не в восторге от такого нововведения.
*EVALSDGs — это сеть заинтересованных и квалифицированных политиков, учреждений и практиков, которые отстаивают важнейшую роль оценки в достижении Целей устойчивого развития.
PS Почему-то на платформе Blogspot проблемы с загрузкой картинок. Потому сегодня пост без иллюстрации.
пятница, 24 апреля 2026 г.
Теория действия
Про теорию изменений у нас знают уже многие и, более того, применяют соответствующий инструментарий на практике. Теория изменений (ТИ) показывает, как наши действия в рамках программы или проекта связаны с ожидаемым результатом. Важнейший элемент ТИ – карта ожидаемых результатов, построенная по принципу «если, то».
Но для того, чтобы в ТИ появился первый результат (нижнего уровня), необходимо совершить определенные действия. Зачастую эти действия достаточно сложны. Именно поэтому, описывая «теорию программы», Фаннелл и Роджерс* (Funnell, S. C., & Rogers, P. J. (2011). Purposeful program theory: Effective use of theories of change and logic models. San Francisco, CA: Jossey-Bass) предложили рассматривать её как состоящую из двух компонентов: «теории изменений» (в привычном нам значении) и «теории действия».
Теория действия описывает «как» программа будет реализована на практике. Она отвечает на вопрос: «Что именно программа будет делать и в какой последовательности?». В отличие от теории изменений, которая объясняет, почему и в какой последовательности должны наступить желаемые изменения, теория действия фокусируется на операционной логике программы — от ресурсов к активностям и непосредственным результатам.
Соединяются две теории именно на непосредственных результатах. До них мы действуем, а когда получен непосредственный результат, дальше «запускаются» цепочки результатов более высокого уровня. Если, конечно, мы все правильно придумали и допущения наши сработают 😊
четверг, 16 апреля 2026 г.
Что мы называем «оценкой»
Вот что у них получилось:
- Предпроектная оценка
- Оценка оцениваемости
- Мониторинг
- Формирующая оценка (formative evaluation)
- Суммирующая оценка (summative evaluation)
- Мета-оценка
Все что перечислено выше, относится к program evaluation. Термин этот можно понять и перевести и как «оценка программ», и как «программная оценка». «Программная оценка» по-русски звучит не очень. Прижился первый вариант перевода. Сейчас мы часто используем расширенную формулировку: «оценка программ и проектов социальной направленности». Такая формулировка соответствует общепринятым определениям program evaluation за рубежом. Например, Майкл Пэттон определяет такую оценку как «систематический сбор информации о деятельности в рамках программы, ее характеристиках и результатах, который проводится для того, чтобы вынести суждение о программе, повысить эффективность программы и/или разработать планы на будущее». То есть речь идет об оценке программы (проекта) на стадии реализации либо по завершении.
А как быть тогда с предпроектной оценкой? Оценкой ситуации? Оценкой потребностей? Оценкой заявок? Оценкой оцениваемости? Все виды оценки, которые не относятся к фазам реализации либо завершения проекта оказываются за пределами program evaluation.
Мне кажется важным сделать определение инклюзивным, чтобы не оставлять «за кадром» перечисленные выше виды оценки, значимые для социальных проектов и программ. Предлагаю к размышлению и обсуждению экспериментальную формулировку такого определения (все, что выделено курсивом).
Оценка в контексте социального проектирования и управления социальными проектами – это систематический сбор и анализ информации
- о ситуации, на которую призван повлиять проект,
- о замысле проекта,
- о деятельности в рамках проекта, ее характеристиках и результатах.
На стадиях инициирования и планирования проекта оценка проводится для того, чтобы разработать проект наилучшим образом или усовершенствовать его дизайн.
По завершении планирования проекта оценка проводится для того, чтобы обосновать решение о его финансировании.
На стадии реализации оценка проводится для обеспечения эффективного выполнения проекта.
На стадии завершения проекта оценка проводится, чтобы вынести обоснованные суждения о результатах проекта и эффективности использования средств; а также, чтобы определить целесообразность продолжения деятельности, начатой в рамках проекта, и разработать планы на будущее.
среда, 8 апреля 2026 г.
Строим или оцениваем?
Может ли оценка пригодиться при разработке проекта? Конечно! Один из распространенных вариантов – оценка ситуации или оценка потребностей. Объектами оценки в этом случае будут, соответственно, ситуация или потребности целевой группы. Полученная информация поможет в разработке проекта. Ключевые вопросы при использовании оценки для разработки: «Что вам нужно узнать для разработки … (сюда вставляем наименование объекта, который разрабатывается)? Как вы будете использовать эту информацию при разработке?».
пятница, 3 апреля 2026 г.
Хорошая идея
Тарек принял решение проводить опрос практикующих специалистов на предмет использования искусственного интеллекта в оценке. «Цель состоит в том, чтобы проводить этот опрос ежегодно для отслеживания использования ИИ в оценке, изучения оптимальных методов его применения и предотвращения возможных ошибок и проблем. Я планирую составлять ежегодный отчет и распространять его среди членов AEA (Американской ассоциации оценки)», -пишет Тарек Аззам в своем приглашении.
Может, и у нас кто-то подхватит эту идею?
среда, 25 марта 2026 г.
Интересная беседа в хорошей компании
- Степень вашей активности на заседании зависит только от вас. Можно просто послушать; можно принять участие в обсуждении; можно предложить тему заседания и участвовать в его подготовке и проведении.
- Общайтесь уважительно. Избегайте агрессии, неконструктивной критики, перехода на личности и любых форм дискриминации.
- Cоблюдайте регламент. Старайтесь высказываться кратко, поддерживайте порядок обсуждения и следите за рекомендациями модератора.
- Давайте высказаться каждому. Не перебивайте, цените вклад каждого участника.
- Поддерживайте новичков. Помогайте включиться новым участникам, отвечайте на вопросы, делитесь знаниями.
- Соблюдайте конфиденциальность. Не распространяйте содержание дискуссий и практические кейсы за пределами клуба без согласия участников.
Тема завтрашнего заседания такая: «Можно ли измерить все, что угодно?». Интересует? Заходите! Начало в 11.00 (мск). Регистрация здесь.
PS На рисунке - версия интересной беседы в хорошей компании от нейросети ШЕДЕВРУМ.
пятница, 20 марта 2026 г.
Тема конференции Европейского общества оценки
Вот перевод краткого описания этой темы: «Демократия,
основанная на правах, свободах и подотчетности, сегодня сталкивается с
давлением по всему миру. Поляризация, снижение доверия и рост популизма бросают
вызов качеству управления в Европе и за ее пределами. Оценка, опирающаяся на
доказательную базу, прозрачность и этические стандарты, может сыграть ключевую
роль в укреплении демократических систем. Она помогает принимать обоснованные
решения, дает возможность услышать разные голоса и способствует восстановлению общественного
доверия».
PS На картинке – логотип конференции.
четверг, 12 марта 2026 г.
Руководство по практическому применению искусственного интеллекта в оценке
CGIAR (Консультативная группа по международным сельскохозяйственным исследованиям) — это крупнейшее в мире глобальное партнерство в области продовольственной безопасности, объединяющее 15 международных исследовательских центров. Организация занимается борьбой с голодом и бедностью в развивающихся странах, разрабатывая инновационные аграрные технологии, устойчивые к климатическим изменениям сорта культур и методы управления природными ресурсами.





