Что такое DALL-E 3 и чем она отличается от предыдущих версий
DALL-E 3 — это нейросеть для генерации изображений по текстовому описанию, разработанная компанией OpenAI. Она стала третьим поколением моделей DALL-E, впервые представленных в 2021 году. Первая версия DALL-E была одной из первых систем, способных создавать качественные картинки по тексту, но доступ к ней был ограничен. Упрощённая версия DALL-E mini, появившаяся весной 2021 года, стала мемом из-за низкого качества, но привлекла внимание к технологии. DALL-E 2, вышедшая в начале 2022 года, уже умела генерировать более качественные изображения и поддерживала запросы на русском языке, однако доступ к ней был ограничен списком ожидания. Только в сентябре 2022 года её открыли для всех пользователей.
DALL-E 3 была представлена в конце сентября 2023 года, а публичный доступ появился в начале октября. Главное отличие от предшественников — глубокая интеграция с языковой моделью GPT-4. Это позволяет нейросети не просто понимать текст, а интерпретировать его: система сама переписывает запрос пользователя, делая его более детальным и понятным для алгоритма генерации. Благодаря этому DALL-E 3 лучше справляется со сложными и абстрактными описаниями, точнее следует инструкциям и выдаёт более качественные изображения с меньшим количеством артефактов. По сравнению с DALL-E 2, третья версия использует значительно больше параметров — 12 миллиардов против 1,5 миллиарда, что повышает точность генерации, особенно при создании людей и животных.
Как работает DALL-E 3: роль GPT-4 в генерации изображений
Процесс генерации изображения в DALL-E 3 отличается от других нейросетей. Когда пользователь вводит запрос, он сначала попадает в языковую модель GPT-4 (в ChatGPT) или в неизвестную версию GPT (в Bing Image Creator). Эта модель переписывает запрос, добавляя детали, уточняя стиль и композицию, а затем передаёт модифицированный промпт в DALL-E 3, которая и создаёт изображение. Такой подход позволяет получать более разнообразные и точные результаты, а также избавляет пользователя от необходимости изучать сложный синтаксис промптов, как в Midjourney или Stable Diffusion.
В ChatGPT Plus пользователь может увидеть, как GPT-4 переписал его запрос, кликнув на сгенерированное изображение — справа появится поле «Подсказка» с расширенным промптом. В Bing Image Creator такой возможности нет. Пользователи Reddit обнаружили, что GPT-4 следует большой инструкции при переписывании запросов, которая включает ограничения и рекомендации. Это означает, что нейросеть действует как посредник, и пользователь может влиять на этот процесс, например, попросив не слишком сильно расширять запрос или вообще не модифицировать его. В Bing Image Creator повлиять на «посредничество» GPT невозможно.
Где доступна DALL-E 3: официальные и сторонние платформы
DALL-E 3 доступна через несколько официальных каналов. Прежде всего, это ChatGPT Plus — платная подписка на ChatGPT, которая стоит 20 долларов в месяц. Для пользователей из России оплата затруднена, так как OpenAI не принимает российские карты, а для регистрации требуется зарубежный номер телефона. В ChatGPT Plus DALL-E 3 интегрирована с GPT-4, что позволяет генерировать изображения прямо в чате, а также задавать уточняющие вопросы и получать несколько вариантов.
Второй официальный способ — Microsoft Copilot (ранее Bing Chat) и Bing Image Creator. Здесь DALL-E 3 доступна бесплатно, но с ограничениями: в день даётся 25 «ускорений» — быстрых генераций. Когда они заканчиваются, изображения создаются медленнее, но без дополнительной платы. Bing Image Creator позволяет генерировать изображения в браузере, включая Microsoft Edge, где есть специальная иконка в сайдбаре. Также DALL-E 3 доступна через API для разработчиков, что позволяет интегрировать её в сторонние приложения и сервисы.
Кроме того, существуют сторонние платформы, такие как FICHI.AI, которые предоставляют доступ к DALL-E 3 и другим нейросетям, иногда бесплатно и без VPN. Это удобно для пользователей из России, где официальные сервисы могут быть недоступны из-за санкций. Также есть Telegram-боты, которые позволяют генерировать изображения через DALL-E без регистрации на OpenAI.
Как пользоваться DALL-E 3 в Bing Image Creator и ChatGPT Plus
Для использования DALL-E 3 в Bing Image Creator нужно перейти на страницу сервиса в любом браузере или нажать на иконку Bing Image Creator в сайдбаре Microsoft Edge. Затем необходимо войти в профиль Microsoft или зарегистрироваться. В поле для запроса можно написать описание на русском языке или нажать кнопку «Удиви меня», чтобы нейросеть сама придумала промпт. После нажатия «Создать» будет сгенерировано три или четыре изображения размером 1024 × 1024 пикселя. Сохранить понравившуюся картинку можно, нажав на неё и выбрав «Загрузить». Важно учитывать, что в день доступно 25 «ускорений», после чего генерация будет происходить медленнее.
В ChatGPT Plus процесс немного отличается. После оформления подписки нужно создать новый чат, выбрать вверху GPT-4 и в выпадающем окне указать DALL-E 3. Затем написать запрос, например: «Нарисуй фиолетового кота в стиле аниме». GPT-4 дополнит запрос и создаст четыре промпта, по которым DALL-E 3 сгенерирует изображения. По умолчанию размер картинок — 1024 × 1024, но можно попросить горизонтальные (1792 × 1024) или вертикальные (1024 × 1792). В чате можно общаться с нейросетью, уточняя детали, и она будет вносить правки. Чтобы сохранить изображение, нужно навести на него курсор и нажать кнопку сохранения.
Возможности DALL-E 3: стили, текст, мемы и фотореализм
DALL-E 3 демонстрирует впечатляющие возможности в различных областях. Она отлично понимает сложные промпты, не пропускает слова и прорабатывает мелкие детали. Благодаря этому нейросеть хорошо справляется с креативными идеями: можно сгенерировать практически любую концепцию, и она постарается точно её воплотить. DALL-E 3 также знает мемы и поп-культуру, хотя из-за фильтров не может создавать изображения с популярными персонажами, защищёнными авторским правом, например Марио или Чужим. Однако иногда фильтры можно обойти, как это удалось с логотипом «Читос».
Нейросеть хорошо генерирует текст на изображениях, особенно короткие надписи для логотипов, комиксов, графиков и схем. Однако при генерации длинных текстов часто появляются ошибки — лишние буквы или символы, а также поддерживается только английский язык. DALL-E 3 умеет создавать изображения в разных стилях и медиумах: от фотореализма до импрессионизма и сюрреализма. При этом она не может имитировать стиль художников, живших в последние сто лет, из-за авторских прав, но это ограничение можно обойти, описав стиль словами без упоминания имени.
Что касается фотореализма, DALL-E 3 пока уступает Midjourney и Stable Diffusion. Сгенерированные фотографии выглядят слишком плавными, и сразу видно, что они созданы нейросетью. В то же время для стилизованных иллюстраций и концепт-артов DALL-E 3 подходит отлично.
Ограничения и цензура в DALL-E 3
OpenAI внедрила в DALL-E 3 строгие ограничения, направленные на предотвращение генерации оскорбительного, опасного или нарушающего авторские права контента. Нельзя создавать изображения с насилием, ненавистью, NSFW-контентом, а также сцены, изображающие знаменитостей и общественных деятелей. В первые дни после запуска пользователи пытались обойти эти ограничения, создавая провокационные изображения, например, с персонажами поп-культуры, врезающимися в башни-близнецы. После этого цензуру ужесточили, и теперь нейросеть отказывается генерировать даже такие вещи, как удар молотком или гора человеческих костей.
Также DALL-E 3 не может имитировать стиль художников, живших в последние сто лет, из-за риска нарушения авторских прав. Это связано с судебными исками против других нейросетей, таких как Stable Diffusion и Midjourney, от художников, чьи работы использовались для обучения без согласия. Если художник обнаружит, что его работы использовались для обучения DALL-E 3, он может обратиться в OpenAI с просьбой заблокировать генерацию изображений в его стиле. Однако ограничение на стиль можно обойти, описав его словами без упоминания имени художника, или используя искажённые имена.
Сравнение DALL-E 3 с Midjourney и Stable Diffusion
DALL-E 3 конкурирует с двумя основными нейросетями для генерации изображений: Midjourney и Stable Diffusion. У каждой из них есть свои сильные и слабые стороны.
DALL-E 3 отличается лучшим пониманием текста. Если нужен точный результат по сложному описанию, с правильным расположением объектов, надписями и деталями, DALL-E 3 справится лучше. Она также проще в использовании: не требует изучения синтаксиса промптов, поддерживает русский язык и доступна бесплатно через Bing Image Creator. Однако DALL-E 3 уступает в фотореализме и художественности.
Midjourney, напротив, славится своей эстетикой и кинематографичностью. Она создаёт более красивые и «искусственные» изображения, которые часто выглядят как концепт-арты. Но для получения хороших результатов нужно уметь составлять промпты, а сама нейросеть платная и не имеет бесплатной версии. Midjourney также не поддерживает русский язык.
Stable Diffusion — это open-source проект, который можно настроить под любые задачи. Он предоставляет полный контроль над генерацией, поддерживает множество моделей и дополнений, таких как LoRA и ControlNet. Однако требует мощного компьютера и навыков программирования. DALL-E 3, в отличие от Stable Diffusion, работает в облаке и не требует специального оборудования.
Таким образом, выбор между этими нейросетями зависит от задач: для точного следования промпту и простоты — DALL-E 3, для художественности — Midjourney, для гибкости и контроля — Stable Diffusion.
Практические советы по использованию DALL-E 3
Чтобы получить наилучшие результаты от DALL-E 3, стоит учитывать несколько рекомендаций. Во-первых, если вы используете ChatGPT Plus, можно попросить GPT-4 не слишком сильно расширять ваш запрос. Нейросеть по умолчанию превращает даже одно слово в детальный параграф, что иногда приводит к неожиданным результатам. В таких случаях попросите создать короткий и лаконичный промпт.
Во-вторых, если вы уверены в своём запросе, можно попросить GPT-4 вообще не модифицировать его и отправить в DALL-E 3 как есть. Это полезно, когда вы точно знаете, что хотите получить. Также можно одновременно отправлять четыре промпта на английском языке.
В-третьих, всегда указывайте медиум. Если вы не укажете, что хотите получить — фотографию, картину, иллюстрацию или кадр из фильма, — нейросеть может сгенерировать совершенно разные изображения. Пропишите это в запросе, например: «создай фотографию...» или «нарисуй иллюстрацию...».
Кроме того, для генерации текста на изображении лучше использовать короткие фразы, так как длинные тексты часто содержат ошибки. И помните, что DALL-E 3 поддерживает только английский текст на изображениях, даже если запрос написан на русском.
Бесплатные способы использования DALL-E 3 в России
Для пользователей из России доступ к DALL-E 3 может быть затруднён из-за санкций и ограничений OpenAI. Однако есть несколько способов использовать нейросеть бесплатно или с минимальными затратами.
Первый способ — Bing Image Creator. Этот сервис Microsoft доступен в России без VPN, хотя для входа может потребоваться аккаунт Microsoft. Он предоставляет 25 «ускорений» в день, после чего генерация замедляется, но остаётся бесплатной. Это самый простой способ попробовать DALL-E 3 без регистрации на OpenAI.
Второй способ — Telegram-боты. Существуют боты, которые предоставляют доступ к DALL-E 3 и другим нейросетям. Для использования не нужно регистрироваться на OpenAI или использовать VPN. Обычно боты дают ограниченное количество бесплатных запросов, а затем предлагают купить дополнительные, например, 50 запросов за 90 рублей.
Третий способ — сторонние платформы, такие как FICHI.AI, которые предоставляют доступ к DALL-E 3 и другим моделям. Некоторые из них работают без VPN и предлагают бесплатные тарифы с ограничениями. Однако стоит быть осторожным и проверять надёжность таких сервисов.
Наконец, можно использовать официальный сайт OpenAI, но для этого потребуется VPN и зарубежный номер телефона для регистрации. Бесплатные кредиты на сайте OpenAI даются в ограниченном количестве: 35 при регистрации и 15 каждый месяц.
Экономический потенциал и применение DALL-E 3 в бизнесе
DALL-E 3, как часть генеративного ИИ, имеет значительный экономический потенциал. По данным McKinsey (2023), генеративный ИИ может добавить от 2,6 до 4,4 триллионов долларов к мировой экономике ежегодно к 2030 году. Наибольший эффект ожидается в маркетинге, дизайне и медиа.
В маркетинге и рекламе DALL-E 3 позволяет сократить время на производство контента до 70%. Например, компания может быстро создать серию изображений для рекламной кампании без найма фотографов и моделей. В дизайне и медиа затраты на визуальные материалы могут снизиться на 30–40%. В играх и кино нейросеть ускоряет препродакшн, создавая концепт-арты и эскизы окружения. В образовании и науке DALL-E 3 помогает создавать наглядные пособия, диаграммы и инфографику.
Однако использование DALL-E 3 в бизнесе сопряжено с этическими вопросами, такими как авторские права и замена художников. Компании должны учитывать эти риски и использовать нейросеть как инструмент для вдохновения, а не полную замену творческих специалистов.
Вопросы и ответы
Чем DALL-E 3 отличается от DALL-E 2?
DALL-E 3 использует 12 миллиардов параметров против 1,5 миллиарда у DALL-E 2, что повышает качество генерации. Главное отличие — интеграция с GPT-4, которая позволяет нейросети лучше понимать сложные запросы и самостоятельно их детализировать. DALL-E 3 также лучше справляется с генерацией людей и животных, уменьшая количество артефактов, таких как лишние пальцы.
Можно ли использовать DALL-E 3 бесплатно?
Да, DALL-E 3 доступна бесплатно через Bing Image Creator от Microsoft. В день предоставляется 25 «ускорений» — быстрых генераций, после чего скорость снижается, но возможность создавать изображения остаётся. Также существуют Telegram-боты и сторонние платформы, которые предлагают бесплатные лимиты.
Поддерживает ли DALL-E 3 русский язык?
Да, DALL-E 3 понимает запросы на русском языке благодаря интеграции с GPT-4. Вы можете писать промпты естественным языком, и нейросеть сама переведёт их в детализированные инструкции для генерации. Однако текст, который генерируется на самих изображениях, поддерживается только на английском.
Почему DALL-E 3 не генерирует знаменитостей?
OpenAI запретила генерацию изображений знаменитостей и общественных деятелей «ради безопасности». Это связано с риском создания фейковых изображений, которые могут вводить в заблуждение. Аналогичные ограничения есть и в других нейросетях, например, в Midjourney, где пользователи создавали фейковые фото Папы Римского и ареста Дональда Трампа.
Как обойти ограничения DALL-E 3 на стиль художников?
Ограничение на имитацию стиля художников, живших в последние сто лет, можно обойти, описав стиль словами без упоминания имени. Например, вместо «в стиле Сальвадора Дали» можно написать «сюрреалистическая картина с плавящимися часами». Также иногда срабатывает использование искажённых имён или просьба не переписывать запрос.
Какие размеры изображений поддерживает DALL-E 3?
В Bing Image Creator DALL-E 3 генерирует изображения только в формате 1024 × 1024 пикселя. В ChatGPT Plus можно указать горизонтальный (1792 × 1024) или вертикальный (1024 × 1792) формат. Изменить разрешение или соотношение сторон вручную нельзя.
Что делать, если DALL-E 3 не работает в России?
Если DALL-E 3 не работает, скорее всего, проблема связана с санкционными ограничениями OpenAI. Используйте VPN или анонимайзеры для доступа к официальным сервисам. Альтернативно, можно воспользоваться Bing Image Creator, который доступен в России без VPN, или Telegram-ботами, которые не требуют регистрации на OpenAI.