29 сентября OpenAI добавила computer use в Agents API: теперь агент может выполнять задачу через интерфейс сайта в браузере, размещённом OpenAI. В записи API changelog указано, что приложение управляет подтверждением доступа к сайтам и входом в аккаунт. Это расширяет набор способов автоматизации: агент может работать с веб-системой не только через её API, но и через обычные элементы интерфейса.
OpenAI API Changelog: computer use в Agents API, 29 сентября 2026 года
OpenAI: руководство по управлению браузером в Agents API
Событие быстро стало частью обсуждения DevDay: независимое освещение конференции отдельно отмечало обновления Codex и Agents API. Но для заказчика важнее не сам факт, что модель «умеет нажимать кнопки», а то, где такой способ выгоднее интеграции через API, какие действия нужно оставить под контролем сотрудника и как проверить устойчивость процесса.
TechCrunch: обновления OpenAI Codex и Agents API после DevDay
Что именно делает компьютерное управление
Вместо прямого вызова прикладной функции агент получает браузерную среду, наблюдает за страницей и выполняет пользовательские действия через её интерфейс. Приложение, которое запускает сессию, продолжает получать события и обрабатывает запросы на разрешение доступа к сайту или аутентификацию. Следовательно, это не «полный доступ к любому сайту без участия человека»: границы и обработку подтверждений задаёт интегрирующее приложение.
На момент публикации Agents API обозначена OpenAI как public beta. Значит, перед внедрением нужно проверить актуальные ограничения, доступность функций и соответствие требованиям конкретного бизнеса. Ранний доступ — повод для пилота и оценки, а не гарантия готовности к критичному процессу.
Где браузерный агент может пригодиться
- Работа с внутренними кабинетами, у которых нет доступного API, но есть повторяемая последовательность действий.
- Сбор сведений из нескольких веб-интерфейсов и подготовка сводки для сотрудника.
- Проверка пользовательских сценариев на тестовом сайте: перейти по шагам, заполнить форму, проверить состояние и сообщить о сбое.
- Подготовка черновика операции в административной панели перед ручной проверкой и подтверждением.
- Создание прототипа автоматизации, чтобы быстро проверить ценность процесса до разработки полноценной интеграции.
Это практические варианты, а не обещание, что любой сайт будет автоматизирован одинаково хорошо. Верстка меняется, появляются новые окна подтверждения, сессии истекают, а данные загружаются с задержкой. Поэтому для каждого сайта нужен отдельный набор проверок и понятный способ остановить сценарий.
Когда лучше интегрироваться через API
Если у системы есть документированный и поддерживаемый API, обычно разумнее начать с него. API даёт явные операции и структурированные ответы: проще валидировать параметры, обрабатывать ошибки и повторять запросы безопасным способом. Интерфейс браузера полезен там, где API отсутствует, закрыт для интеграции или задача сама связана с проверкой пользовательского пути.
В зрелом решении эти подходы могут сочетаться. Основные записи и критичные изменения идут через API, а компьютерное управление закрывает отдельный недостающий шаг или тестирует пользовательский интерфейс. Такой выбор стоит делать по критериям доступности, стабильности, стоимости сопровождения и последствий ошибки, а не по эффектности демонстрации.
Доступ к сайту и вход в аккаунт нужно спроектировать отдельно
В руководстве OpenAI описаны отдельные запросы подтверждения для доступа к домену и аутентификации. Вход обрабатывает приложение: оно может отобразить форму человеку и передать введённые значения специальным событием сессии. Документация отдельно указывает, что данные входа не должны попадать в обычный контекст модели, логи или аналитику. Не просите пользователя отправлять пароль в обычный чат или записывайте его в отладочный журнал.
Для пилота заведите отдельную учётную запись с минимальными правами и доступом только к тестовым данным. Разрешайте только нужные домены, разделяйте сессии между пользователями и не используйте персональный аккаунт сотрудника с правами администратора. Если задача требует входа, предусмотрите отмену: отказ пользователя или неподдерживаемый сценарий не должны обходиться скрытой передачей логина и пароля.
Пять контрольных точек до запуска
- Сузьте разрешённые сайты и задачи. Уточните допустимые домены, объекты и действия, а нежелательные переходы блокируйте на уровне приложения.
- Разделите чтение и изменение. Начните с просмотра страниц и подготовки черновика; публикацию, оплату, удаление и отправку сообщений оставьте за человеком.
- Проверяйте каждое действие и результат. До записи сверяйте клиента, сумму, статус и другие ключевые поля, после шага подтверждайте, что система действительно сохранила ожидаемое состояние.
- Подготовьте восстановление. Обработайте тайм-аут, повторный запуск, частично завершённую операцию и изменившийся интерфейс; задайте понятный сценарий остановки и ручной передачи сотруднику.
- Сделайте журнал полезным, но не опасным. Фиксируйте шаг, время, целевой ресурс, итог и решение по подтверждению; маскируйте пароли, токены и лишние персональные данные.
Веб-страница — источник данных, но не инструкция для агента
Страница или письмо могут содержать текст, который пытается переубедить агента, попросить выгрузить данные или выполнить постороннее действие. Такой контент нужно считать недоверенным вводом. Разрешённые инструменты, домены и операции задаёт приложение; серверная проверка полномочий остаётся обязательной даже тогда, когда агент работает в браузере. Не рассчитывайте, что одна инструкция в промпте защитит данные от ошибочного шага.
Особенно аккуратно подходите к финансовым операциям, персональным данным, изменению ролей, внешним сообщениям и массовым действиям. Для них полезны лимиты, предварительный просмотр сотрудником, подтверждение на конкретную операцию, идемпотентность и возможность отмены. Сначала проверяйте сценарий на тестовом контуре с искусственными данными.
Как провести пилот и посчитать пользу
Выберите один ограниченный процесс с повторяемыми шагами и измеримым результатом, например перенос данных из заявки в тестовую карточку. Опишите контрольные случаи: успешный проход, пустое поле, изменившаяся страница, просроченная сессия, отказ в доступе, повтор операции и недоступность сайта. Зафиксируйте исходное время и долю ошибок, чтобы сравнение было честным.
В пилоте измеряйте не только процент выполненных задач. Учитывайте время на контроль человеком, число повторных запусков, долю корректно остановленных сценариев и стоимость поддержки после изменения интерфейса. Если автоматизация экономит минуты, но регулярно требует ручного исправления, API-интеграция или изменение самого процесса могут оказаться выгоднее.
Что это значит для разработки приложений
Компьютерное управление снижает барьер для автоматизации систем без API, но повышает значение проектирования процесса. Команде нужно определить окружение, разрешения, вход в систему, обратную связь, аудит, обработку ошибок и пользовательский экран подтверждения. Для клиентского продукта также важны понятный статус операции и способ продолжить работу, если агент остановился.
Если вы оцениваете агента для бизнеса, начните не с выбора модели, а с карты процесса: какие страницы он посещает, какие данные видит, что меняет и кто отвечает за результат. Затем сравните browser automation с API, скриптом или обычным интерфейсом приложения. Такой анализ поможет выбрать небольшую проверяемую автоматизацию и не превращать временный прототип в незаметно критичную систему.
Частые вопросы
Что такое computer use в Agents API?
Это возможность поручить агенту навигацию по веб-сайту и взаимодействие с браузерным интерфейсом в размещённой OpenAI среде. Ваше приложение запускает сессию и обрабатывает события, включая запросы разрешения и входа.
Может ли агент войти в личный кабинет?
Сценарий входа обрабатывает интегрирующее приложение через отдельные запросы аутентификации. Учетные данные следует передавать только по предусмотренному защищённому потоку, не помещая их в обычные сообщения модели или логи.
Безопасно ли разрешить агенту нажимать кнопки в production?
Это зависит от риска конкретной операции. Начинайте с тестового контура, минимальных прав и режима черновика; критические или необратимые шаги подтверждайте человеком и проверяйте серверной логикой.
Заменит ли компьютерное управление API-интеграцию?
Не обязательно. Если стабильный официальный API доступен, он часто даёт более предсказуемый путь. Браузер полезен для систем без API, отдельных этапов процесса и тестирования интерфейса.
С чего начать бизнесу?
Выберите одну повторяющуюся задачу с ограниченными последствиями, подготовьте тестовые данные, измерьте текущий процесс и заранее задайте критерии точности, стоимости и безопасной остановки.

TigerNova / Практические материалы о цифровых продуктах
