Исходный размер 2480x3500

Обучение генеративной нейросети — Kagurabachi_style

Концепция

Задача

Обучение генеративной нейросети Stable Diffusion под стиль манги Кагурабачи (Kagurabachi, カグラバチ) авторства Хоказоно Такеру (Hokazono Takeru)

Исходный размер 2480x1383

Изображения из манги «Кагурабачи» Хоказоно Такеру

Идея проекта

В нынешнее время многие творческие люди пробуют себя на роль мангак, придумывая и рисуя истории для себя, своих друзей или широкой аудитории. Каждый из них, уже написав интересный сюжет, продумав внешний вид героев, пространства и все другие важные детали, с решительностью приступает к отрисовыванию и наталкивается на одну и ту же проблему: фон и важность его детализации. Задний и передний планы пространств играют огромную роль в восприятии работы мангаки и иногда заводят в ступор колоссальной тратой времени и эмоциональных ресурсов для рисования побочных элементов. Вырисовывать фоны может потребоваться от 5 до 20 раз за главу, что очень тормозит развитие сюжетного творческого процесса. Именно для таких задач и может пригодиться нейросеть в создании манги или комикса. Она бы помогла не только сэкономить время и получить нужный результат, но и дополнила бы интерьер или экстерьер своими деталями, которые не пришлось  бы выдумывать самостоятельно для каждого отдельного фона.

Важно сказать, что знаменитые мангаки создают фоны с помощью обрисовывания фотографий или же 3Д моделей. И в том и в другом случае, авторы добавляют свой стиль рисования, отображая предметы с отличительными особенностями: штрихами, материалами и художественными приёмами, которые повторяются от изображения к изображению.

Цели

Для демонстрации пользы обучения генеративной нейросети в стиле манги я решила взять в пример Хоказоно Такеру — автора манги «Кагурабачи». Для этого у меня есть 3 цели:

  1. Продемонстрировать особенности стиля мангаки (пример: Хоказоно Такеру), которые нейросеть способна перенимать и использовать для дальнейшей генерации в этом стиле.
  2. Доказать полезность обучения нейросети на стиль манги, которое могло бы помочь в создании собственного комикса (с помощью обучения на свой неповторимый стиль).
  1. Не менее важный пункт. Если у вас пока нет своего стиля, а начать рисовать хочется уже сейчас, то можно на основе генераций по стилю мангаки создавать фоны для своих работ. Необходимо уточнить, что при использовании такого метода работы скорее всего должны быть некоммерческими и при возможности указанными с деталью о том, что они созданы на основе генерации стиля изначального автора в случае публикации (если есть возможность, то стоило бы спросить у автора разрешение на использование его стиля в таких целях, однако конечно это необязательно в силу трудностей связи). Однако это всё ещё прекрасный способ, если вы учитесь рисовать фоны и хотели бы перенять стиль какого-либо автора или кастомизирую сгенерированные изображения добавлением цвета, дополнительных деталей, персонажей и многого другого.

Особенности стиля

Стиль Хоказоно Такеру в манге «Кагурабачи» был выбран из-за своих особенностей: он отлично подходит для всех трёх целей, а особенно для кастомизации, так как не слишком перегружен тонами чёрно-белой гаммы, точечными текстурами, предметами, а также не имеет иных цветов, что позволяет дополнять картину своим видением и использованием картинок в цветных мангах и вебтунах.

Технически он отличается характером штриха: автор использует одну и ту же кисть, имитирующую графитовый карандаш. Иногда для крупных участков он использует крупную кисть для чернил. Тени заливаются серым цветом, а самые тёмные участки чёрным. Есть множественные повторения окон, черепицы, листьев и травы, а также плитки. Иногда появляется шум, созданный штрихом или массами тёмных красок.

Исходные изображения датасета для обучения нейросети

Все изображения были взяты из манги Хоказоно Такеру "Кагурабачи" в квадратном формате. Количество изображений: 41 штука (в силу способностей Colab)

Исходный размер 2480x1383

Изображения из датасета

Процесс обучения генеративной модели

Для лучшего понимания процесса обучения давайте пройдёмся по основным шагам. Полный код и объяснения каждого шага — в конце лонгрида.

Модель на Hugging Face: https://huggingface.co/Meadowiknetort/Kagurabachi_style_LoRA

Загрузка датасета

Исходный размер 2480x732

Загрузим в гугл коллаб наш датасет используя команды импорта. Локальную директорию, на которую будут загружены изображения называем kagu

Исходный размер 1638x532

Дальше нам необходимо привести изображения к общему квадратному формату и цветовому полю с помощью импортирования библиотеки PIL и создания функции image_grid, позволяющую перенастроить размеры

Генерация подписей с помощью BLIP

Исходный размер 1660x625

Помимо датасета в виде картинок нам также необходимо их описание. Получаем мы их с помощью загрузки модели Bootstrapping Language-Image Pre-training, помогающей нам автоматизировать монотонный процесс

Исходный размер 1206x366

Для работы с данными в формате json импортируем библиотеку. Добавляем к каждому определённому нейросетью описанию изображения определяющий префикс «manga background in KAGURABACHI style»

Исходный размер 2274x296

С помощью команды! cat выводим все полученные данные работы BLIP на экран

Обучение генеративной модели

Запускаем ячейку обучения. Вызываем Lora и выставляем такие параметры, чтобы память не закончилась до окончания обучения: --dataset_name="kagu" --output_dir="Kagurabachi_style_LoRA" --instance_prompt="manga background in KAGURABACHI style" --resolution=512 --train_batch_size=2 --gradient_accumulation_steps=3 --max_train_steps=500 --checkpointing_steps=250 Самое главное — качество 512, так как 1024 уже тяжелее тянется Colab и может слететь

Исходный размер 1502x816

Сохранение модели в huggingface_hub

Исходный размер 1478x892

Сохраняем и загружаем модели LoRA в Hugging Face Hub с помощью функции save_model_card, сохраняющую информацию о модели в Hugging Face. Также upload_folder и create_repo

Обучение генеративной нейросети — Kagurabachi_style
Проект создан 10.04.2025
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше