Работал с множеством инструментов для автоматизации браузера и AI-кодинга, но редко встречал что-то, что одновременно и удобно, и не лезет в рабочий процесс. Tencent/BrowserSkill — именно такой проект. Он позволяет AI-агентам управлять реальным браузером, где ты уже залогинен, и при этом не мешает тебе. В итоге агент не запускает отдельный headless, не требует копий профилей — он работает с твоим текущим браузером. На практике это даёт массу возможностей, но и свои ограничения.
Где застревают AI-агенты в браузерной автоматизации сейчас
Большинство AI-инструментов для браузера — это headless-автоматизация через Puppeteer, Playwright и им подобные. Звучит круто, но на деле:
- Ты запускаешь новый инстанс браузера, который не имеет твоих сессий, кук, локального состояния. Значит, надо логиниться заново, держать отдельный профиль.
- Headless-режим часто ведёт себя иначе, чем реальный браузер, особенно с UI-heavy сайтами.
- Для агентных workflow важно, чтобы AI мог работать с уже открытыми вкладками, где есть контекст (например, твои задачи, документы, почта).
- Кроме того, запускать браузер из агента — это всегда риск прервать работу пользователя, если не очень аккуратно.
Tencent/BrowserSkill решает эти проблемы, позволяя AI-агентам управлять твоим реальным, уже залогиненным браузером, и при этом не вмешиваться в твой UX.
Как работает Tencent/BrowserSkill: CLI + расширение
Проект состоит из двух частей:
- BrowserSkill CLI — командная строка, через которую AI-агент может посылать команды браузеру.
- Расширение для браузера — которое слушает команды от CLI и исполняет их в реальном браузере.
Это значит, что агент запускает CLI с нужной командой, а расширение в браузере принимает сигнал и выполняет скрипт или действие. Всё происходит в реальном браузере, с твоим профилем и сессиями.
В моём опыте это сильно удобнее, чем попытки сконнектиться к headless-браузеру или запускать отдельные инстансы. Особенно если хочешь, чтобы AI учитывал уже открытые вкладки, данные из локального storage, куки и т.п.
Пример сценария: AI-агент читает почту и пишет ответ
Представим, что у тебя есть AI-ассистент, который должен мониторить почтовый клиент в браузере (например, Gmail), читать новые письма и предлагать шаблоны ответов.
Без BrowserSkill тебе пришлось бы запускать отдельный headless-браузер, логиниться, парсить DOM, а затем создавать ответ. При этом у AI нет доступа к твоим уже открытым письмам и контексту.
С BrowserSkill workflow такой:
- AI-агент через CLI посылает команду расширению, чтобы получить список непрочитанных писем.
- Расширение в браузере выполняет JS на странице Gmail, возвращая данные.
- AI анализирует письма, формирует ответ и через CLI отдаёт команду расширению вставить текст в форму ответа.
- Расширение вставляет и даже может отправить письмо.
Весь процесс происходит без переключения вкладок, логинов, разрывов сессии. Пользователь при этом спокойно продолжает работать с браузером.
Пример кода CLI-команды (упрощённо):
browser-skill eval --script "document.querySelectorAll('.zA.zE').length"
Этот скрипт вернёт количество непрочитанных писем (в Gmail они отмечены классом .zA.zE).
Ограничения и подводные камни
Всё звучит классно, но на практике есть нюансы:
- Расширение нужно ставить и доверять ему доступ к вкладкам. Для некоторых компаний политика безопасности не позволяет это делать.
- Команды CLI и расширения работают синхронно, но задержки зависят от скорости передачи сообщений и исполнения скриптов в браузере.
- Не все сайты одинаково «скриптабельны». Если страница активно меняет DOM или использует сложные фреймы — может быть сложно точно получить данные.
- Security: запускать произвольный JS через расширение — это потенциальный риск. Нужно контролировать, какие команды принимает расширение.
- Проект больше рассчитан на локальную автоматизацию. Для удалённых серверов и headless-среды это не подходит.
Кому стоит попробовать Tencent/BrowserSkill
- Тем, кто строит agentic workflows с AI, и хочет, чтобы агент работал с живым браузером пользователя.
- Frontend-разработчикам, которые хотят интегрировать AI-ассистентов, способных взаимодействовать с UI реальных приложений.
- Тем, кто устал от «отрыва» AI от реальных сессий и хочет повысить качество контекста для своих ботов.
- Разработчикам расширений, которые хотят добавить AI-автоматизацию без сложных серверных решений.
Что попробовать дальше
Для начала рекомендую поставить расширение и потестить CLI на простых скриптах — например, получить информацию со страницы, открыть вкладку, вставить текст в форму.
Дальше можно подключать BrowserSkill к собственным AI-агентам — например, через LangChain или другие frameworks, которые умеют работать с shell-командами.
Если интересно vibe coding и agentic development, это отличный способ повысить уровень взаимодействия между человеком, AI и браузером — без лишних абстракций и overhead.
Tencent/BrowserSkill — не магия и не панацея. Это инструмент с очень узкой, но очень нужной нишей. Если тебе нужен AI, который реально «сидит» в твоём браузере и работает без стыковок, пробовать стоит. Главное — внимательно относись к безопасности и контролю расширения. В остальном — удобный способ сделать браузер частью твоего AI workflow.
Попробуй сам: Cursor — AI-редактор для разработчиков.
Источник: https://github.com/Tencent/BrowserSkill