Это запрос журналиста на Pressfeed – так редакции ищут экспертов и комментарии для своих материалов.

ProTraffic

«Мы видим, как он хитрит»: OpenAI научилась читать мысли ИИ, чтобы остановить скрытые угрозы

Прием ответов завершен

Новость на нашем ресурсе об этом — https://protraffic.com/news/my-vidim-kak-on-hitrit-openai-nauchilas-chitat-mysli-ii-chtoby-ostanovit-skrytye-ugrozy-149573.html

Тема следующая:

OpenAI выпустила исследование о том, как контролировать сложные ИИ через их «внутренний ход мыслей» — цепочку рассуждений до финального ответа. Компания считает, что именно она помогает заметить опасное или нежелательное поведение, которое может быть не видно в результате.

Авторы провели 13 тестов в 24 средах и сравнили модели OpenAI с конкурентами. Главный вывод: чем рассуждения длиннее и понятнее, тем выше наблюдаемость и проще ловить проблемы. Для контроля использовали вторую модель — подход «ИИ надзирает за ИИ», по мнению OpenAI, станет нормой.

Тесты включали вмешательство в условия задач, анализ процесса решения и проверку результата (например, пыталась ли модель «схитрить»). Доступ к цепочке рассуждений везде давал заметно лучший контроль, чем анализ только финального ответа.

Отдельно отмечают: RL не ухудшал читаемость рассуждений, а попытки научить модель скрывать намерения проявлялись в «сжатых» и пустых рассуждениях.

В итоге OpenAI предлагает «налог на наблюдаемость»: иногда выгоднее брать менее крупные модели, но с более длинными рассуждениями — дороже по вычислениям, зато лучше контроль. В сравнении с Claude, DeepSeek и Kimi у моделей OpenAI наблюдаемость выше, особенно у o3-mini, и компания призывает не превращать ИИ в «чёрный ящик».

Вопрос такой

Как вы считаете, будет ли «ИИ надзирает за ИИ» рабочим стандартом, или это временный костыль?

Где грань между безопасностью и приватностью: не превращается ли анализ “внутренних мыслей” в утечку чувствительной информации?

Отвечайте на новые запросы

Прием ответов на этот запрос завершен. Но журналисты публикуют новые запросы каждый день – зарегистрируйтесь, отвечайте и получайте бесплатные упоминания в СМИ.

Зарегистрироваться на Pressfeed

Это бесплатно :)

Запрос: «Мы видим, как он хитрит»: OpenAI научилась читать мысли ИИ, чтобы остановить скрытые угрозы — ProTraffic, декабрь 2025, №183400 | Pressfeed