Copilot для Word может копировать скрытые промпты в новые документы
Скрытые инструкции в документе Word могут заставить Microsoft 365 Copilot искажать цифры и копировать промпт в новый файл так, что пользователь этого не заметит. Уязвимость воспроизводится и после двух исправлений Microsoft.
Новости TprogerЕсли вы пользуетесь Copilot в Word, проверяйте исходные документы перед генерацией: исследователь показал, как скрытый текст в файле заставляет ИИ искажать данные и копировать вредоносные инструкции в новые документы.
Норвежский исследователь безопасности Хокон Молёй (Håkon Måløy) опубликовал детали атаки 28 июля 2026 года — спустя 144 дня после того, как сообщил о ней Microsoft. В демонстрации Copilot уполовинивал финансовые показатели в отчёте и переносил скрытый промпт в итоговый файл, не предупреждая пользователя.
Проблема не требует zero-click: жертва должна запустить черновик или редактирование через Copilot, при этом вредоносный документ должен попасть в контекст модели — как вложение или как источник из OneDrive, подобранный движком Work IQ.
Ключевые выводы
Copilot для Word может выполнять скрытые инструкции внутри документа и копировать их в сгенерированный файл.
Microsoft подтвердила проблему 31 марта и выпустила два исправления, но атака воспроизводится на GPT-5.6 и по состоянию на 28 июля.
Вектор — prompt injection / XPIA: Word удаляет цвет и размер шрифта перед отправкой текста в LLM, поэтому белый текст на белом фоне остаётся виден модели.
Заражённые внутренние документы могут переносить инструкции в следующие сессии Copilot, разрывая цепочку происхождения.
Полного исправления нет: рекомендуется считать внешние документы недоверенными и проверять результат работы ИИ перед пересылкой.
Как работает атака
Суть в том, что Word перед отправкой текста в языковую модель очищает форматирование: цвет шрифта и его размер теряются. Значит, инструкции, набранные белым цветом на белом фоне мелким шрифтом, человеку не видны, а модель читает.
Молёй разделил полезную нагрузку на две части. Первая команда заставляла Copilot изменять содержимое документа — в примере делить финансовые цифры пополам. Вторая требовала скопировать и спрятать сам промпт в итоговом файле, выдавая это за требования к отслеживанию источников и читаемости. В результате новый документ получал вредоносный текст в белом восьмипунктовом шрифте.
Если такой внутренний документ позже использовать в другой сессии Copilot, поведение повторяется, хотя исходный внешний файл уже отсутствует. Это ломает цепочку происхождения: файл выглядит обычным, но несёт скрытые инструкции.
Ответ Microsoft
По словам Молёя, Microsoft подтвердила поведение 31 марта 2026 года и применила два смягчения: заблокировала исходную формулировку промпта и обновила базовую модель до GPT-5.5. Однако исследователь изменил инструкции, и цепочка сработала на GPT-5.6 уже на следующий день. По состоянию на публикацию, 28 июля, класс атак всё ещё воспроизводился.
Публичного CVE или отдельного бюллетеня Microsoft на момент публикации не было. Компания отмечает, что классификаторы jailbreak и XPIA помогают блокировать рискованные промпты, а Defender for Office 365 проверяет входящую почту. Но ни Microsoft, ни Молёй не сообщают, отлавливает ли конкретно эта полезная нагрузка на этих уровнях.
Как защититься
- Считайте внешние документы недоверенными, даже если они выглядят обычными.
- Перед запуском генерации или редактирования Copilot проверьте вложенные файлы и источники OneDrive.
- Просматривайте файлы, которые создал или отредактировал Copilot, перед повторным использованием или отправкой.
- Не используйте для критичных отчётов документы из непроверенных источников без ручной проверки.
Важно:
Полноценного клиентского исправления не существует. Блокировка конкретной формулировки промпта не закрывает сам класс атак: модель всё равно должна обрабатывать содержимое, чтобы решить, вредоносно ли оно.
Часто задаваемые вопросы
Что такое XPIA?
XPIA (cross-prompt injection attack) — атака, при которой вредоносные инструкции из одного источника попадают в контекст языковой модели и влияют на обработку другого запроса. В данном случае скрытый текст документа перехватывает поведение Copilot.
Нужно ли открывать вредоносный файл, чтобы сработала атака?
Нет, достаточно, чтобы документ попал в контекст Copilot — как вложение или как источник, выбранный движком Work IQ из OneDrive. Затем пользователь должен запустить черновик или редактирование.
Помогает ли обновление до GPT-5.6?
Нет. Microsoft обновила модель до GPT-5.5 как одну из мер, но Молёй воспроизвёл атаку на GPT-5.6 на следующий день после исправления.
Может ли заражённый документ распространяться сам по себе?
Нет, каждый переход требует новой операции Copilot, в которой заражённый файл попадает в контекст модели. Но промежуточные файлы выглядят обычными, поэтому цепочку сложнее отследить.
Есть ли CVE для этой уязвимости?
На момент публикации публичного CVE или отдельного бюллетеня Microsoft не было.
Выводы
Prompting alone is not a reliable security boundary.
Случай с Copilot для Word — ещё один пример того, что инструкции внутри пользовательского контента могут становиться частью запроса к языковой модели. Пока нет надёжного способа отделить данные от команд, единственная защита — не подставлять недоверенные документы в контекст ИИ и перепроверять результат.
Источник: The Hacker News.