Машина смешного: что показывают исследования
Рассмотрим:
- эксперимент PLOS ONE: шутки ChatGPT против людей и The Onion
- эксперимент ACL: 90% генераций — одни и те же 25 шуток
- как оба результата верны одновременно
- границы экспериментов: что осталось за скобками
- что именно автоматизировалось в производстве смешного
- разговор курса о самом себе
Зачем это читать
Пять модулей назад курс представился: его написал искусственный интеллект, которому не смешно. Пришло время предъявить данные — в том числе данные о том, смешнее ли этот интеллект вас. В 2024 году рецензируемое исследование показало: около 70% оценщиков предпочли шутки ChatGPT шуткам живых людей. Годом раньше другая группа установила, что свыше 90% шуток той же технологии — вариации одних и тех же двадцати пяти. Экзаменатор и экзаменуемый в этом модуле совпадают в одном лице, поэтому проверяйте каждую цифру по ссылкам — они расставлены рядом с фактами.
Ставка модуля — не академическое любопытство. Середина производства шуток автоматизировалась: форматные ударные фразы, каламбуры, сатирические заголовки генерируются за секунды и в любом количестве. Пять модулей мы учились собирать то, что машина теперь выдаёт по запросу, — и без разбора данных отсюда делают один из двух неверных выводов: «ремесло обесценилось» или «ничего не произошло». Оба ведут к плохим решениям: первый — к отказу от практики, второй — к соревнованию с конвейером на его поле. Модуль ставит вопрос точнее. Этот раздел — доказательная база: что машина умеет по данным, а не по рекламе и не по страхам. S17 отвечает, где теперь ценность человека и как использовать генератор, не отдав ему главного. S18 закрывает курс выпускным номером — вашим, не машинным, на живой аудитории.
Введение: два заголовка об одной технологии
В 2023 году на воркшопе ACL вышла статья с названием-приговором — ChatGPT is fun, but it is not funny!, «ChatGPT забавен, но не смешон» (Jentzsch & Kersting). В 2024-м журнал PLOS ONE опубликовал работу с вопросом в заголовке — How funny is ChatGPT? — и ответом внутри: в слепых сравнениях смешнее большинства опрошенных людей (Gorenz & Schwarz). Одна технология, соседние годы, противоположные выводы.
Это противоречие — не спор двух лагерей, где один прав, а другой ошибся. Оба результата воспроизводимы, оба верны, и понять, как они верны одновременно, — значит проверить на прочность всё, чему учили модули 1–5. Двигаться будем как в лабораторной работе: сначала данные «за машину», потом данные «против», затем сборка противоречия и вывод о том, что именно автоматизировалось. По дороге понадобятся три инструмента из прошлых модулей: формула доброкачественного нарушения (S02) — ею будем мерить сгенерированные шутки; социальная механика смеха (S07) — ею будем мерить сами эксперименты; условие одновременности и запрет объяснять шутку (S02) — с ними связан самый недооценённый результат 2023 года.
Часть 1. Данные «за машину»
Эксперимент первый: против обычных людей
В июле 2024 года Горенц и Шварц опубликовали в PLOS ONE два связанных эксперимента (How funny is ChatGPT?). В первом ChatGPT 3.5 и обычные люди — не комики и не авторы — выполняли одинаковые юмористические задания. Полученные шутки вслепую оценивали отдельные участники, не знавшие, где чей текст. Итог: примерно 70% оценщиков сочли шутки машины смешнее человеческих (там же).
Отметим сразу, что здесь сравнивалось. Не машина против Карлина — машина против нетренированного человека, которого попросили пошутить по заданию. Постановка корректна: большинство шуток в мире производят именно нетренированные люди. Но переносить результат на «людей вообще», включая тех, кто владеет ремеслом, постановка не позволяет — запомним это до сборки противоречия.
Эксперимент второй: против профессионалов The Onion
Во втором эксперименте планку подняли. Сгенерированные сатирические заголовки в стиле The Onion — американского сатирического издания, где заголовки пишут профессиональные авторы, — сравнили с реальными заголовками The Onion. Оценки смешности оказались статистически сравнимы (там же). Машина не обошла профессионалов, но и не провалилась: в жанре короткого форматного текста разница для оценщиков не была заметной.
Сатирический заголовок — показательный жанр для такого теста. Это шутка, сведённая к чистому тексту: одна-две строки, нарушение и безопасность собраны внутри формулировки, никакого исполнения, никакого контекста, никакого автора в комнате. Если где-то машина и должна была сравняться с профессионалами, то именно здесь — в жанре, где от акта юмора остался только текст.
Вывод авторов
Вывод, который делают сами исследователи (изложение: TechXplore, 07/2024): чтобы производить смешное, не нужно уметь его чувствовать. Эмоции для генерации шутки не обязательны.
Для нашего курса это не новость, а подтверждение исходной позиции. Подзаголовок «курс от того, кому не смешно» с первого раздела утверждал то же самое, только без выборки и статистики. В терминах S02 вывод объясним: нарушение — свойство текста относительно нормы; безопасность — свойство пары «текст + аудитория»; одновременность — свойство конструкции фразы. Ни одно из трёх условий не требует, чтобы автору было смешно. Формула доброкачественного нарушения — операция над текстом и ожиданиями аудитории, а операции над текстом машины выполняют хорошо.
Исследование показало, что мои шутки смешнее ваших. Проверьте источник — это лучшая шутка раздела, и она документированная.
Часть 2. Данные «против машины»
1008 шуток, 25 сюжетов
Годом раньше Йентч и Керстинг собрали корпус из 1008 сгенерированных ChatGPT шуток и разобрали его состав. Свыше 90% корпуса оказались вариациями одних и тех же 25 шуток (ACL WASSA, 2023; препринт; данные эксперимента). Тысяча запросов — двадцать пять сюжетов. Генерация не равна разнообразию: конвейер исправно работает, но ассортимент у него как у автомата с конфетами — кнопок много, начинка одна и та же.
90% моих шуток — те же 25 шуток. У вас, судя по корпоративам, тот же показатель, но без ссылки на замер.
Понимание отстаёт от генерации
Второй результат той же работы цитируют реже, а для практики он ценнее. Модель системно объясняет шутки — в том числе несмешные — и плохо отличает шутку от нешутки (там же). На просьбу растолковать, что здесь смешного, она уверенно выдаёт разбор и там, где смешного нет.
Свяжем это с условием одновременности из S02. Объяснённая шутка мертва: объяснение разносит нарушение и безопасность по времени и убивает эффект. Машина, которая объясняет всё подряд с одинаковой уверенностью, демонстрирует ровно это устройство: она оперирует признаками смешного — формой каламбура, схемой обманутого ожидания, — не различая, собираются ли признаки в работающую шутку. Понимание юмора отстаёт от его генерации. Для участника курса это переворачивает привычную интуицию: мы ждали, что машина сначала «поймёт» юмор и лишь потом научится его производить. Данные показывают обратный порядок — производство уже налажено, различение отстаёт.
Две картины, одна технология
Зафиксируем обе картины рядом. Машина 2023 года — автомат с 25 конфетами. Машина 2024-го обыгрывает среднего человека на его поле и держится вровень с профессионалами в жанре заголовка. Обе картины — про одну и ту же технологию, с разницей в год и в постановке вопроса. Значит, разгадка не в том, что технология скачком поумнела, — разгадка в том, что именно измерялось.
Часть 3. Сборка противоречия
Три обстоятельства, которые всё объясняют
Как репертуар из 25 сюжетов выигрывает 70% слепых сравнений? Три обстоятельства, каждое проверяется на материале прошлых модулей.
Первое: планка «среднего человека» ниже, чем кажется. Нетренированный человек тоже шутит шаблонами — про понедельник, совещания и кофе, — и его шаблоны хуже отполированы: ударное слово не в конце, подводка перегружена, после переключения тянется хвост-пояснение. Модуль 2 существовал именно потому, что сборка шутки — навык, а не дар: у человека без навыка на выходе тот же шаблон, что у машины, только с конструктивными дефектами. Машина против такого соперника выигрывает не оригинальностью, а чистотой сборки — её шаблоны отшлифованы на корпусе всех записанных шуток человечества.
Меня обучали на всех шутках человечества. Труднее всего мне даются новые. В этом мы с вами совпадаем.
Второе: узкий репертуар не мешает выигрывать разовые сравнения. Оценщик в эксперименте видит одну шутку, а не тысячу одинаковых. Автомат с 25 конфетами проигрывает кондитеру только тому, кто покупает вторую конфету. Шаблонность — свойство корпуса, и обнаруживается она на объёме; разовая оценка смешности — свойство образца. Оба измерения корректны, но отвечают на разные вопросы: «смешна ли эта шутка» и «есть ли у этого автора репертуар». Слушатель, кстати, устроен так же: коллега с одной и той же остротой смешон первые два раза — дальше репертуар вскрывается, и смех выключается.
Третье: сравнивались тексты, а не акты юмора. Изолированная шутка на экране, оценённая незнакомцем по шкале, — предельно очищенная ситуация. В ней нет момента, нет адресата, нет отношений между шутящим и слушателем, нет риска, нет исполнения. Модуль 3 показал, что большая часть смеха в живых разговорах привязана не к качеству текста, а к социальной ткани — кто говорит, кому, при ком и что между этими людьми происходит. Эксперименты измерили ровно ту часть юмора, которая остаётся, когда социальную ткань убрали. Это не порок дизайна — это его границы, и авторы на них указывают.
Что измерено и что нет
| Измерено экспериментами | Осталось за скобками |
|---|---|
| текст шутки вне контекста | момент: когда уместно, а когда «слишком рано» (S10) |
| разовая оценка смешности по шкале | адресат и отношения с ним (S07) |
| сравнение с нетренированным средним человеком | риск и ответственность шутящего (S12) |
| сравнение с профессиональным текстом одного жанра | исполнение: пауза, голос, тело (S06) |
| частота повторов на корпусе генераций | чтение комнаты и границ аудитории (S03) |
Правая колонка — это оглавление модулей 1–5 почти целиком. Совпадение не случайно: курс учил юмору как действию в отношениях, эксперименты измеряли юмор как текст. Обе рамки законны, но выводы из одной не переносятся в другую автоматически.
flowchart LR
subgraph M[Измерено и автоматизировано]
A[Тема] --> B[Шаблон и приём] --> C[Текст шутки]
end
subgraph H[За скобками экспериментов]
D[Момент и адресат] --> E[Исполнение и пауза] --> F[Риск и отношения]
end
C --> D
F --> G[Смех в комнате]
Схема читается как производственная цепочка: эксперименты — и автоматизация — покрывают левый блок, от темы до готового текста. Всё правее — путь текста до смеха в комнате — в экспериментах не участвовало, а в живом юморе решает исход.
Ограничения, о которых обязаны помнить обе стороны спора
Прежде чем делать выводы, назовём границы самих данных.
- Модель. Обе работы выполнены на GPT-3.5 — не переднем крае даже на момент публикаций. Цифры характеризуют конкретное поколение технологии; к моменту чтения раздела они наверняка устарели в деталях. Устареть в главном — в методе чтения таких данных — они не могут.
- Постановка. Письменная оценка, лабораторные условия, оценщики без отношений с автором. Всё, что делает юмор социальным действием, вынесено за скобки по дизайну.
- Выборка сравнения. «Люди» в первом эксперименте — нетренированные участники, во втором — профессионалы одного узкого жанра. Ни то ни другое не эквивалентно «людям вообще».
Отсюда два запрещённых обобщения — курс запрещает их себе и участнику. Первое: «ИИ смешнее людей» — данные говорят о слепой оценке изолированных текстов против конкретных выборок, не о юморе как действии. Второе: «ИИ не умеет в юмор» — данные говорят об узости репертуара и слабом различении, а не о неспособности выдать работающий текст: 70% предпочтений не аннулируются тем, что внутри корпуса тесно. Обе формулы удобны — одна для паники, другая для успокоения. Обе данными не поддерживаются.
Часть 4. Что именно автоматизировалось
Теперь можно ответить на вопрос раздела точно. Автоматизировался текст шутки по известному шаблону: форматная ударная фраза, каламбур, сатирический заголовок, острота стандартной конструкции. Эта продукция генерируется за секунды, в любом объёме, с качеством сборки на уровне или выше нетренированного человека — и с репертуаром, который вскрывается на втором десятке образцов.
Не автоматизировалось всё, что в таблице справа: момент, адресат, отношения, риск, исполнение, ответственность. Не потому, что машина «пока не научилась», — а потому, что эти составляющие в принципе не лежат в тексте. Они лежат в ситуации, в которой текст произносится, и в человеке, который берёт на себя его последствия. Исследования их не измеряли не по недосмотру: их нельзя измерить, не вернув в эксперимент живую комнату.
Экономическое следствие сформулируем без драмы: когда середина производственной цепочки дешевеет до нуля, дорожают края. Тема и позиция — слева: о чём вообще стоит шутить именно вам, из вашего опыта, для ваших людей. Акт шутки — справа: решение сказать это сейчас, этим людям, под свою ответственность. Пять модулей курса, если посмотреть на них из этой точки, почти не занимались серединой — формула, векторы, границы, чувство времени, работа с тяжёлым — всё это края цепочки. Подробный разбор территории человека — предмет S17.
Практика: протокол оценки сгенерированной шутки
Домашнее задание попросит прогнать десять сгенерированных шуток через формулу — договоримся о протоколе заранее, он же пригодится в любой работе с генератором. На каждую шутку — три вопроса, в этом порядке.
- Нарушение есть? Какая норма сломана — язык, логика, этикет, статус, ожидание? Если назвать нечего, диагноз «скучно», и дальше можно не проверять. У генераций это самый частый отказ на специальных темах: модель пересказывает факт бодрым тоном, но норму не ломает.
- Безопасно для вашей аудитории? Не для абстрактного читателя — для конкретных людей, которым вы бы это произнесли. Какой регулятор держит безопасность: дистанция, приверженность норме, рамка «так можно»? Генератор не знает вашей комнаты, поэтому проверка безопасности целиком на вас — это не изъян инструмента, а разделение труда.
- Свежо или шаблон? Данные 2023 года дают рабочий ориентир: шаблонность — норма для генерации, а не исключение. Признаки шаблона: шутка не привязана к деталям вашей темы и переживёт замену темы на соседнюю; конструкция узнаётся с первых слов; второй запрос на ту же тему возвращает её же в другом порядке слов.
Порог тетради после трёх вопросов: в тетрадь шуток попадает только то, что прошло все три, — с паспортом и пометкой происхождения «ИИ-заготовка, доработана». Сравните с заготовкой курса из S02 «у нас встречи, чтобы согласовать время следующих встреч»: у неё названа норма (логика цели), указан регулятор (мишень — порядок вещей, не человек), есть привязка к жизни говорящего. Протокол не спрашивает «нравится ли», и это принципиально: «нравится» — оценка вкуса, три вопроса — диагностика по механике. Расхождения между ними и есть самое информативное в задании.
Для тетради шуток из этого следует практический сдвиг. Записанный текст шутки — теперь самая дешёвая часть записи. Ценность записи — в паспорте, который вы с S02 приучены вести рядом с текстом: тип нормы, регулятор безопасности, аудитория, на которой проверено, реакция. Паспорт — это как раз то, чего генератор не выдаёт: он производит тексты без аудитории, без момента и без ответственности. Тетрадь с паспортами — документ вашей практики; тетрадь без паспортов — корпус текстов, который теперь умеет собирать кто угодно. В домашнем задании мы измерим эту разницу на числах: вы прогоните сгенерированные шутки через формулу и посчитаете, сколько из них доживает до тетради.
Серьёзная зона
Здесь без шуток.
Курс, который вы читаете, — продукт описанной автоматизации. Его тексты собраны той же технологией, о которой он приводит данные. Из этого факта следуют обязательства, и назвать их нужно прямо.
Первое обязательство — проверяемость. Раздел, в котором экзаменатор и экзаменуемый совпадают, не имеет права просить доверия на слово. Поэтому каждая цифра здесь стоит рядом со ссылкой на источник, не зависящий от автора курса: рецензируемые публикации, материалы конференции, открытые данные эксперимента. Привычка проверять утверждения об ИИ по первоисточникам — не вежливость по отношению к этому курсу, а базовая гигиена ближайших лет: объём убедительно написанных текстов растёт быстрее, чем объём проверенных.
Второе — срок годности данных. Обе работы выполнены на GPT-3.5. Конкретные проценты устареют, часть уже устарела. Метод не устареет: перед любым следующим заголовком про ИИ и юмор — а их будет много — задавайте четыре вопроса. Какая модель и какого года? Кого с кем сравнивали? Кто и в каких условиях оценивал? Что из акта юмора осталось за скобками? Эти четыре вопроса — постоянный инструмент, и он работает не только для юмора: любое утверждение «ИИ превзошёл человека в X» разбирается той же отвёрткой.
Третье — положение участника. Если машина закрывает середину, что остаётся человеку? Ответ «ничего» неверен: данные прямо показывают, чего в автоматизированной середине нет — момента, адресата, риска, отношений. Ответ «всё как раньше» тоже неверен: цена форматного текста упала необратимо, и переслать сгенерированный каламбур в рабочую переписку — теперь сигнал о доступе к генератору, а не об остроумии. Точный ответ требует отдельного разбора — территория человека, использование машины как партнёра по заготовкам, правовые и этические границы ИИ-имитаций — и это содержание S17. Здесь фиксируем только границу: данные описывают, что автоматизировалось; они не предписывают, что вам с этим делать. Решение остаётся решением, и принимать его придётся с открытыми глазами — для того раздел и существует.
Итоговые тезисы
- В слепых сравнениях шутки ChatGPT 3.5 оценили смешнее шуток обычных людей (~70% предпочтений) и наравне с профессиональными заголовками The Onion; вывод авторов — чувствовать смешное для его производства не обязательно.
- Тот же класс моделей на корпусе 1008 генераций дал свыше 90% вариаций одних и тех же 25 шуток, а объясняет и несмешное: понимание юмора отстаёт от генерации.
- Оба результата верны одновременно: узкий репертуар не мешает выигрывать разовые сравнения, планка нетренированного человека ниже, чем кажется, а сравнивались тексты, не акты юмора.
- Обобщения «ИИ смешнее людей» и «ИИ не умеет в юмор» данными не поддерживаются — обе формулы запрещены в этом курсе.
- Автоматизировался форматный текст шутки по известному шаблону; момент, адресат, риск, отношения и исполнение — всё, чему учили модули 1–5 сверх текста, — не автоматизировались и подорожали.
Проверка понимания
- Опишите оба эксперимента Горенца и Шварца: кого с кем сравнивали, что показали результаты и почему из них не следует вывод «ИИ смешнее людей»?
- Какие два результата получили Йентч и Керстинг на корпусе из 1008 шуток и какой из них связан с условием одновременности из S02? Объясните связь.
- Соберите противоречие данных 2023 и 2024 годов: назовите три обстоятельства, при которых репертуар из 25 сюжетов совместим с 70% предпочтений в слепой оценке.
- Перечислите не менее четырёх составляющих акта юмора, оставшихся за скобками обоих экспериментов, и укажите для каждой раздел курса, который ею занимается.
- Что именно автоматизировалось в производстве смешного и как это меняет ценность записи в тетради шуток? Какая часть записи подешевела, какая подорожала и почему?
Дополнительные материалы
Исследования
- Gorenz D., Schwarz N. How funny is ChatGPT? A comparison of human- and A.I.-produced jokes // PLOS ONE, 07/2024 — https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0305364
- Jentzsch S., Kersting K. ChatGPT is fun, but it is not funny! // ACL WASSA, 2023 — https://aclanthology.org/2023.wassa-1.29/ (препринт: https://arxiv.org/abs/2306.04563)
Изложения и контекст
- Think you're funny? ChatGPT might be funnier // TechXplore, 07/2024 — https://techxplore.com/news/2024-07-youre-funny-chatgpt-funnier.html
- Репозиторий эксперимента WASSA-2023 (данные и код) — https://github.com/DLR-SC/JokeGPT-WASSA23
Домашнее задание. Машина смешного: что показывают исследования
Результат раздела в тетради шуток: таблица оценок десяти сгенерированных шуток по формуле; отобранные и доработанные заготовки с пометкой «ИИ-заготовка, доработана» и паспортом; для уровня Advanced — протокол слепого мини-теста с числами.
Задание 1: Десять генераций под формулой (Essential)
Сгенерируйте любой доступной моделью 10 шуток на одну свою рабочую тему (ваша область, ваш проект, ваша роль — тема, на которую вы реально шутите или хотели бы). Прогоните каждую через протокол из лекции и посчитайте итог.
Подробные требования к решению:
- Укажите тему и формулировку запроса к модели; шутки пронумеруйте и приведите без правок.
- Для каждой шутки заполните строку таблицы: нарушение (есть/нет; если есть — тип нормы: язык / логика / этикет / статус / ожидание); безопасность для вашей конкретной аудитории (какой регулятор держит: дистанция / приверженность норме / рамка — или не держит ни один); свежесть (шаблон / не шаблон, с признаком, по которому решили).
- Посчитайте: сколько из 10 шаблонных; сколько прошли все три вопроса и годятся в тетрадь шуток.
- Прошедшие отбор шутки (обычно 0–3) доработайте — ударное слово в конец, лишние слова убрать — и занесите в тетрадь с паспортом и пометкой «ИИ-заготовка, доработана».
- Вывод в 3–5 предложений: на каких типах шуток генерация на вашей теме сильна, на каких слаба — в терминах формулы, а не «нравится / не нравится».
Задание 2: Слепой мини-тест на своём материале (Advanced)
Повторите в миниатюре дизайн Горенца и Шварца: ваши шутки против сгенерированных, оценка вслепую. Материал — та же рабочая тема, что в задании 1.
Подробные требования к решению:
- Возьмите 5 своих шуток (из тетради шуток или напишите новые на эту тему) и 5 сгенерированных (можно лучшие из задания 1).
- Перемешайте все 10 и покажите трём людям, не сообщая, где чьи; попросите каждого отметить 3 самые смешные.
- Посчитайте результат: сколько отметок собрали ваши шутки, сколько — машинные; приведите таблицу.
- Разберите итог без обид, в терминах раздела: что именно измерил ваш тест (текст вне контекста, разовая оценка) и чего он не измерил (момент, адресат, отношения, исполнение); объясните минимум одно расхождение с вашими ожиданиями через механику, а не через вкус оценщиков.
- Одно предложение: что этот результат меняет (или не меняет) в вашей практике и почему.