Исходный размер 632x951

Naive Horror: генеративные монстры в детском стиле

Генерация хоррор-персонажей в детском стиле с помощью Stable Diffusion

big
Исходный размер 2106x422

Идея проекта

В этом проекте я хотела проверить, может ли нейросеть воспроизводить не просто стиль, а именно «ощущение» рисунка — в моём случае это детский стиль.

Я выбрала довольно контрастную тему: взяла известных хоррор-персонажей и попыталась представить, как бы они выглядели, если бы их рисовал ребёнок 6–8 лет. Мне было интересно, что произойдёт, если соединить что-то пугающее с очень наивной и простой визуальной формой.

В итоге проект стал не только про стиль, но и про восприятие: как меняется ощущение страха, если его «упростить» до детского рисунка.

big
Исходный размер 2106x422

Концепция

В основе проекта лежит контраст между формой и содержанием. С одной стороны — детский рисунок: простой, яркий, немного неровный. С другой — образы, которые изначально воспринимаются как страшные.

Мне было важно сохранить узнаваемость персонажей, но при этом упростить их до уровня детского восприятия. За счёт этого возникает странный эффект: рисунки вроде бы простые, но при этом в них остаётся тревожность.

Особенно хорошо это видно в лицах — большие глаза, странные улыбки, прямой взгляд на зрителя. В детском рисунке это нормально, но в контексте хоррора это начинает выглядеть немного пугающе.

Датасет фотографий

Для обучения модели я собрала датасет из своих собственных рисунков. Это важно, потому что по условиям задания можно использовать только авторские изображения или материалы с разрешением.

Все рисунки я делала в одном стиле: — простые фигуры (голова, тело, руки); — неровные линии; — яркие цвета; — минимальные детали; — акцент на лице. (просто потому, что это мои детские рисунки)

Все изображения были приведены к квадратному формату (1:1), чтобы их можно было использовать для обучения модели.

Всего в датасете — 50 изображений.

Примеры изображений из обучающего датасета

Рисунки «маленькой Аминат», на них обучалась нейросеть, чтобы создать последующие рисунки по запросам

Рисунки «маленькой Аминат», на них обучалась нейросеть, чтобы создать последующие рисунки по запросам

Рисунки «маленькой Аминат», на них обучалась нейросеть, чтобы создать последующие рисунки по запросам

На многих рисунках подписано мое имя (Ната). Рисунки были собраны и бережно хранились моей прабабушкой.

Больше рисунков можно найти по этой ссылке

Исходный размер 2106x422

Процесс обучения

Для обучения я использовала Stable Diffusion XL и метод DreamBooth LoRA. Я работала в Google Colab, используя готовый ноутбук, который был дан в задании.

Перед обучением я подготовила изображения (обрезала, проверила формат), после чего загрузила их в ноутбук.

Сам процесс обучения занял некоторое время — модель постепенно подстраивалась под мой стиль. После этого я начала тестировать генерации и подбирать промпты, чтобы добиться нужного результата.

Отдельно пришлось поработать с формулировками: сначала изображения получались слишком абстрактными или не похожими на персонажей, но со временем удалось настроить промпты так, чтобы сохранялась узнаваемость.

Скрины из Colab

Исходный размер 1429x609

В этом блоке запускается обучение модели Stable Diffusion XL с использованием метода DreamBooth LoRA.

Я указываю путь к датасету, параметры обучения и директорию для сохранения результата. В процессе обучения модель анализирует изображения и выделяет характерные особенности моего стиля.

Использование LoRA позволяет обучить модель быстрее и с меньшими ресурсами, при этом сохраняя ключевые визуальные признаки: упрощённые формы, неровные линии и искажённые пропорции.

Исходный размер 2306x359

Здесь происходит подготовка датасета для обучения. Для каждого изображения автоматически создаётся текстовое описание (caption), которое затем используется моделью.

Я задаю общий текстовый префикс (caption_prefix), который описывает стиль моих изображений — наивный, нарисованный от руки, с использованием цветных карандашей.

Этот этап важен, потому что именно через текст модель «понимает», какой стиль ей нужно выучить и воспроизводить при генерации.

Исходный размер 2323x263

В этом блоке происходит генерация изображения на основе текстового описания (prompt). Я описываю персонажа максимально подробно: внешний вид, одежду, пропорции и окружение.

Также задаются параметры генерации: количество шагов (num_inference_steps) и степень следования промпту (guidance_scale). Эти параметры влияют на то, насколько точно модель воспроизводит заданный образ.

На этом этапе я проверяла, насколько хорошо модель передаёт мой стиль и насколько узнаваемым получается персонаж.

После генерации изображения сохраняются на Google Drive.

Исходный размер 2106x422

Итоговая серия изображений

В результате я получила серию изображений, где каждый персонаж интерпретирован в детском стиле.

Я старалась сохранить ключевые признаки каждого: — Slenderman — вытянутая фигура и отсутствие лица; — Cartoon Cat — голова кошки и злая ухмылка; — Momo — большие глаза и странное лицо; — Pyramid Head — треугольная голова и оружие; — Jeff the Killer — черные длинные волосы, нож и зловещая улыбка.

Несмотря на упрощение, персонажи остаются узнаваемыми, что было одной из главных целей проекта.

Исходный размер 1024x1024

Слендермен из крипипасты

PROMT: " a creepy monster in alikidsketch style, A tall white monster in a black jacket and black trousers, with a red tie, no face, long arms and legs. He stands in the forest, with three trees behind him, on a path, childlike drawing, colored pencils, naive illustration, eerie but playful, "

Исходный размер 1024x1024

Картун Кэт из крипипасты

Naive Horror: генеративные монстры в детском стиле
Проект создан 23.03.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше