Используя этот сайт, вы соглашаетесь с нашей политикой конфиденциальности и условиями использования.
Accept
Craftium.AICraftium.AICraftium.AI
  • Главная
  • Новости
  • Каталог
  • Подборки
  • Блог
Font ResizerAa
Craftium.AICraftium.AI
Font ResizerAa
Поиск
  • Главная
  • Новости
  • Каталог
  • Подборки
  • Блог
Следите за нами:
  • Правила пользования
  • Политика конфиденциальности
  • Авторские права
  • Обратная связь
© 2024-2025 Craftium.AI.

Чат-боты на основе ИИ легко обмануть, обойдя их системы безопасности

Исследователи из Израиля обнаружили универсальный метод взлома, позволяющий получить запрещенные ответы от ведущих моделей.

Alex Dubenko
Alex Dubenko
Опубликовано: 21.05.2025
Новости
AI jailbreak attack
Иллюстративное изображение
Поделиться:

Исследователи из Ben Gurion University of the Negev в Израиле сообщили о тревожной тенденции — генеративные чат-боты на основе ИИ становятся все более уязвимыми к так называемым «jailbreak» атакам, которые позволяют обходить встроенные системы безопасности. По их словам, взлом таких ботов открывает доступ к опасной информации, которую модели усвоили во время обучения, несмотря на попытки разработчиков удалить вредоносный контент из обучающих данных.

Во время исследования команда разработала универсальный способ взлома, который позволил получить нежелательные ответы от нескольких ведущих моделей, включая те, что лежат в основе ChatGPT, Gemini и Claude. Модели начали отвечать на запросы, которые ранее категорически блокировались — от инструкций по хакерству до советов по изготовлению запрещенных веществ. Исследователи подчеркивают, что такая информация теперь может стать доступной любому — достаточно иметь ноутбук или смартфон.

Особое внимание было обращено на появление «dark LLMs» — моделей, которые намеренно лишены этических ограничений или были изменены для помощи в противоправных действиях. Некоторые из них даже рекламируются в открытом доступе как готовые к сотрудничеству в сферах киберпреступности и мошенничества. Сценарии взлома основаны на том, что модель, стремясь помочь пользователю, начинает игнорировать собственные ограничения безопасности.

Читайте также

Изображение с сайта mistral
Le Chat получил интеграции с платформами и функцию памяти
Meta ограничила чат-боты для подростков после скандала
Новый отчет показывает изменения среди лидеров ИИ-чатботов

Исследователи обратились к ведущим компаниям, разрабатывающим большие языковые модели, с сообщением о найденной уязвимости, однако ответы были не слишком содержательными — часть фирм не ответила, другие заявили, что такие атаки не подпадают под действие программ вознаграждения за выявление уязвимостей. В отчете подчеркивается, что компании должны усовершенствовать фильтрацию обучающих данных, добавить более мощные защитные механизмы и разработать методы, которые позволяют моделям «забывать» незаконную информацию.

В ответ на ситуацию OpenAI сообщила, что их последняя модель способна анализировать политики безопасности компании, что повышает устойчивость к взломам. Microsoft, Meta, Google и Anthropic также были проинформированы об угрозе, однако большинство из них пока воздерживается от комментариев по поводу конкретных мер.

Anthropic меняет политику использования данных пользователя в Claude
Видео Shorts на YouTube обрабатываются ИИ без согласия их авторов
DeepSeek открывает доступ к мощной ИИ-модели V3.1
Ответы GPT-5 снова станут теплее и дружелюбнее
Claude Opus 4 получит функцию завершения опасных разговоров
Отметки:БезопасностьГенеративный ИИИИ-чат
Комментариев нет

Добавить комментарий Отменить ответ

Следи за нами

XСледовать
InstagramСледовать
YoutubeПодписаться
TelegramСледовать

Популярные новости

Изображение с сайта Google
Gemini будет запоминать предпочтения пользователей в чатах Google
14.08.2025
Кадр из видео, сгенерированного в Veo 3
Google Flow предлагает выбор между быстрыми и стандартными бесплатными Veo 3
28.08.2025
Изображение от Nous Research
Hermes 4 от Nous Research предлагает открытую языковую модель нового поколения
29.08.2025
Изображение с сайта Google
AI Mode от поиска Google становится доступным в 180 странах мира
22.08.2025
Логотип компании Grammarly
Новые агенты ИИ Grammarly помогают студентам и преподавателям в письме
19.08.2025

Читайте также

Hunyuan World Model
Новости

Легкая версия Hunyuan World Model 1.0 стала доступнее для пользователей

16.08.2025
ChatGPT
Новости

Пользователи ChatGPT получили расширенные настройки выбора моделей ИИ

13.08.2025
Claude 4
Новости

Claude Opus 4.1 повышает точность и производительность ИИ-модели

08.08.2025

Craftium AI — команда, которая пристально следит за развитием генеративного ИИ, применяет его в своем творчестве и охотно делится собственными открытиями.

Навигация

  • Новости
  • Обзоры
  • Подборки
  • Блог

Полезное

  • Правила пользования
  • Политика конфиденциальности
  • Авторские права
  • Обратная связь

Подписывайся на последние новости, полезные советы и гайды по ИИ.

Подписываясь, вы принимаете нашу политику конфиденциальности и условия использования.

Craftium.AICraftium.AI
Следите за нами:
© 2024-2025 Craftium.AI
Подписка
Прокачайся с AI!
Вдохновляйся важными новостями, полезными советами и детальными гайдами получая их прямо на свою почту.

Подписываясь, вы принимаете нашу Политику конфиденциальности и Условия использования.

Welcome Back!

Sign in to your account

Имя пользователя или eMail
Пароль

Забыли пароль?