Вычислительная креативность генеративной сети Midjourney в полимодальном пространстве

Жикулина К.П.; Костромина В.В.

В данной статье исследуется полимодальное пространство в области вычислительной креативности у нейронных сетей. Объектом нашего исследования является полимодальная среда, которая объединяет в себе ряды разнородных кодов для выражения общей идеи, а предметом - возможность создания полимодального цифрового искусства с помощью текстового и голосового промта в генеративной сети Midjourney. Цель исследования - доказать, что вычислительная креативность у машин может быть обнаружена и описана по результатам итераций в процессе создания изображений, что в свою очередь позволит говорить о сложной полимодальной системе как об отдельной цифровой категории полимодальности. Задачи, которые решались в рамках данного исследования: 1) обоснование использования термина полимодальный в контексте вычислительной креативности в цифровом искусстве нейронных сетей; 2) проведение серии тестов с генеративной сетью Midjourney для возможности описания вербально-визуального контента; 3) анализ и выведение алгоритма создания изображения в условиях суммаризации данных и трансформационной креативности. Нами был использован метод сплошной выборки при сборе языковых единиц по мере их встречаемости; контекстный анализ для систематического описания присутствующих вербальных и невербальных компонентах. Необходимо было провести эксперимент с генеративной сетью Midjourney для выявления закономерностей при создании графического пространства, а далее сравнить и сопоставить результаты итераций с оригинальным изображением. Научная новизна заключается в отсутствии исследований о полимодальном пространстве в контексте нейронных сетей и их генеративной способности. В ходе проведённого эксперимента нами были получены следующие результаты: термин «полимодальность» в контексте генеративной сети Midjourney и её «цифрового искусства» обусловлен наличием трёх каналов: вербального, визуального и голосового (звукового); тесты показали, что способность нейронной сети к созданию изображений посредством промта находится на высоком уровне, однако прослеживаются грубые технические ошибки в системе, которые не позволяют пользователям в полной мере приблизиться к желаемому результату при генерации изображения; суммаризация данных позволяет говорить о наличии черт вычислительной креативности у генеративных сетей, так как в ходе создания изображения возникают новые образы (идеи), ранее не предполагаемые пользователем.

Вычислительная креативность генеративной сети Midjourney в полимодальном пространстве

Связанные документы (рекомендация CORE)

Новости проекта

Новости

Партнеры

Индексация