Концепция


Моя давняя любовь к творчеству младшей сестры, к её уникальному, искреннему, чуть наивному, но невероятно выразительному стилю детских рисунков, вдохновила меня на следующий проект. Я захотела обучить генеративную нейросеть Stable Diffusion создавать персонажей именно в этом неповторимом стиле.
Мне всегда было интересно, как бы выглядели иллюстрации к популярным детским сказкам, если бы их автором была именно она, с её особой оптикой и нетронутым взрослым миром видением. Этот проект призван ответить на вопрос: какими бы вышли эти иллюстрации, наполненные её искренним почерком, и как нейросеть сможет перенести эту детскую непосредственность в новые, волшебные образы для знакомых историй. Это будет попытка увидеть мир сказок через призму чистого, неподдельного искусства.
Список использованных в проекте инструментов:
Stable Diffusion — обучение генеративной нейросети под свой стиль; Google Colab — выполнение кода и генераций; Hugging Face — получение токена для обучения нейросети, загрузка полученной модели на сайт; Adobe Photoshop — для обработки фото (улучшение, кадрирование)
Примеры рисунков


Описание процесса обучения
Начнем с настройки технической среды: проверяем доступность GPU, инсталлируем необходимые библиотеки, обновляем фреймворк diffusers до последней версии и загружаем обучающий скрипт для DreamBooth под SDXL. Данный этап формирует инфраструктурный фундамент для реализации проекта.
Переходим к подготовке обучающего набора данных, состоящего из 23 рисунков. Для ускорения обработки все изображения заранее приведены к компактному формату 512×512 пикселей. В процессе создаётся целевая директория «cher», предназначенная для загрузки снимков, на основе которых нейросеть будет обучаться распознаванию заданного образа.
Проверим установки, выведя 5 случайных изображений.
Приступаем к созданию текстовых описаний для каждой фотографии в датасете с использованием модели BLIP. К полученным описаниям добавляем единый префикс — «a photo of TOK girl», — который впоследствии будет служить ключевым запросом для генерации новых изображений. После завершения процесса генерации подписей освобождаем оперативную память, чтобы снизить нагрузку на вычислительную среду и обеспечить стабильность дальнейших операций.
Переходим к установке требуемых зависимостей и авторизации в системе Hugging Face. Этот шаг служит страховкой на случай сбоя выполнения кода в Google Colab — после обучения модель можно будет загрузить на платформу и продолжить генерацию изображений непосредственно через веб-интерфейс.
Приступаем к процессу обучения модели. Для оптимизации вычислений и снижения нагрузки на GPU устанавливаем количество шагов обучения: 500 и 250. В параметры также обязательно включаем тот же префикс для текстовых запросов, который использовался при подготовке обучающего датасета. После завершения обучения сохраняем итоговую модель на платформе Hugging Face и получаем прямую ссылку на её страницу.
Генерация иллюстраций
Все иллюстрации сгенерированы в Goggle Colab





















