(01) Концепция
Для обучения своей модели нейросети Stable Diffusion XL я решила выбрать одну из своих любимых игр — Alice: Madness Returns (2011). В 2023 году вышел артбук для продолжения этой игры Alice: Asylum, которое, возможно, никогда не выйдет, поэтому я захотела

Alice: Madness Returns (2011) - это мрачный и психоделический экшен-платформер, разработанный Spicy Horse, являющийся продолжением игры American McGee's Alice. Сюжет разворачивается после событий первой игры, American McGee's Alice. Алиса пытается прийти в себя после трагической гибели своей семьи в пожаре, находясь под присмотром психиатра в Лондоне. Однако, её психическое состояние ухудшается, и она вновь погружается в безумную, искажённую Страну Чудес.

Кадры из игры Alice: Madness Returns

Некоторые персонажи из игры Alice: Madness Returns
В игре есть 2 основных стиля: 3д игровая часть и стилизованная нарисованная часть катсцен и флэшбеков. Я хотела сосредоточиться на втором стиле, так как он более интересный для меня, и обучить свою модель именно на нем.

Скриншоты катсцен и флэшбеков из игры
Основные черты этого стиля:
Использование четких линий и текстур, напоминающее винтажные иллюстрации.
Текстура бумаги и контур вокруг разных деталей, будто вырезанные из бумаги куклы, которых анимируют.
Персонажи часто имеют преувеличенные (чаще всего отталкивающие) черты и необычные пропорции.
Использование глубоких, насыщенных цветовых палитр, часто с контрастом между яркими и темными оттенками.
Использование фантастических деталей и необычной композиции.
(02) Датасет для обучения
Часть изображений из датасета
У меня получилось собрать датасет из 53 скриншотов катсцен из игры размера 1024х1024 пикселей.
(03) Процесс обучения
После импорта блокнота с Github и установки нужных библиотек, я загрузила свой датасет и продолжила работу с ним. Следующим шагом было создание локальной директорий для хранения изображений из него.
Импорт и открытие датасета
Далее были сгенерированы подписи для изображений, используя модель BLIP, и сохранены вместе с именами файлов изображений в JSONL-файл. Затем мы очистили память, удаляя модель BLIP и освобождая GPU-память.
Фрагменты кода
После этого я привязала собственный токен на платформе Hugging Face, и приступила непосредственно к обучению модели с использованием LoRA.
Фрагмент кода
Фрагмент кода для тренировки модели
После этого я сохранила мою модель на Hugging Face Hub для удобства дальнейшего использования и приступила к первым генерациям.
(04) Генерация изображений
Сначала я попробовала изменить параметр lora_scale на более низкие значения, такие как 0.6 и 0.8
Я использовала одинаковые промпты, чтобы посмотреть различия генерации изображений.
Изображения, полученные с параметром lora_scale=0.6











