Концепция
Проект исследует пересечение классического балетного костюма и высокой моды через призму генеративного искусства. В основе лежит идея создания универсальной «модели-конструктора», способной интерпретировать балетную эстетику в современных материалах и цветах.


исходные изображения
Объект обучения: Сложносочиненное балетное платье, сочетающее элементы сценической пачки и вечернего наряда от кутюр.
Ключевой токен: TOKSTYLE.


исходные изображения
Задача проекта состояла в том, чтобы на основе небольшого датасета обучить нейросеть узнаваемому визуальному стилю. Необходимо было добиться того, чтобы модель понимала принципы построения сложного балетного платья и могла генерировать новые вариации, сохраняя уникальную эстетику в разных цветах, формах и ракурсах.
Процесс обучения
Процесс строился по следующим этапам:
Настройка среды: Google Colab (GPU Nvidia T4). Библиотеки: diffusers, accelerate, bitsandbytes. Модель: Stable Diffusion XL (SDXL 1.0) + LoRA. Параметры: 500 шагов обучения, разрешение 512px, оптимизатор 8-bit Adam. Тайминг: Само обучение длилось 52 минуты. Пост-обработка: Использование SDXL-Refiner (Upscaling) для прорисовки текстур.
Для обучения использовалась архитектура Stable Diffusion XL (SDXL) и метод LoRA (Low-Rank Adaptation), который позволяет «вживить» новый стиль в мощную базовую модель.
Датасет: Серия из 12 изображений-референсов, отобранных по принципу визуальной консистентности.
Подготовка: Каждое изображение прошло автоматическую разметку моделью BLIP, что позволило нейросети понять нюансы: «layered tulle», «intricate embroidery», «bodice».
Параметры: 500 шагов обучения при разрешении 512px. Использование оптимизатора 8-bit Adam позволило сохранить высокую детализацию при ограниченных ресурсах GPU.
Результат
Итоговая серия изображений представляет собой виртуальную капсульную коллекцию, созданную обученной моделью. Я специально вынесла объекты из контекста сцены в минималистичное пространство фотостудии, чтобы подчеркнуть детализацию самих изделий.




Первоначальная идея заключалась в переносе сложной деконструкции балетного костюма в формат высокой моды. Нейросеть успешно усвоила и воспроизвела ключевые визуальные маркеры:
Архитектоника силуэта: Модель четко передает контраст между жестким, расшитым лифом (корсетная часть) и облаком многослойного тюля юбки. Удалось сохранить «балетную» посадку платья, характерную для классических пачек, но адаптированную под длину миди и макси.
Детализация фактур: На изображениях отчетливо видны микро-фактуры: плетение кружева, зернистость фатина и тяжелый глянец шелка. Нейросеть не просто рисует «белое пятно», она имитирует физические свойства тканей и их взаимодействие со светом.
Обучение LoRA (SDXL): Благодаря качественной разметке датасета через модель BLIP, нейросеть «поняла» семантику таких понятий, как intricate embroidery (сложная вышивка) и mannequin (манекен). Это позволило вычленить объект из хаотичного фона и представить его в чистом студийном пространстве.
Метод Upscaling & Refinement: Для финализации образов применялся метод «изображение-в-изображение» (Img2Img) с низким коэффициентом изменения (denoising strength 0.3). Это позволило «проявить» детали: кристальную вышивку и тонкие бретели, которые на базовом разрешении могли выглядеть размытыми.
Визуальный анализ и вариативность
Цветовая палитра: при изменении цветового промпта (от Ivory White до Emerald Green) нейросеть не просто перекрашивает пиксели, а меняет характер декора. Например, в темных вариантах (сапфировый, изумрудный) вышивка становится более контрастной и рельефной, имитируя золотое шитье.
Индивидуальность моделей: каждое платье в серии уникально по крою: в одном акцент сделан на объемные рукава-фонарики из прозрачного органзы, в другом — на каскадную структуру юбки. Это подтверждает, что модель не «копирует» исходники, а генерирует новые формы на основе выученных закономерностей.
Работа с пространством: использование светлой фотостудии с естественным боковым светом подчеркивает объем изделий. Тени ложатся мягко, что создает ощущение реального физического объекта, стоящего на манекене.
Заключение и инструменты
Задача проекта выполнена, удалось успешно интегрировать авторский визуальный код в нейросеть: модель «выучила» стиль и корректно воспроизводит его по запросу. Обучение на небольшой, но выверенной коллекции из 12 образов позволило создать цифровую «ДНК» уникального стиля. Теперь возможно управлять процессом создания целых коллекций, сохраняя авторский почерк в каждой детали от пышности фатина до блеска вышивки.
Использованные инструменты:
Google Colab / Python: среда разработки и код обучения. Diffusers / SDXL: базовая архитектура нейросети. Chatgpt: помощь в написании текста и промтов BLIP: автоматическая генерация текстовых описаний для датасета.
Файл с кодом







