Tencent/BrowserSkill: Автоматизация браузера для AI-агентов без прерывания работы

#AI coding#agentic workflows#browser automation#Tencent/BrowserSkill

Работал с множеством инструментов для автоматизации браузера и AI-кодинга, но редко встречал что-то, что одновременно и удобно, и не лезет в рабочий процесс. Tencent/BrowserSkill — именно такой проект. Он позволяет AI-агентам управлять реальным браузером, где ты уже залогинен, и при этом не мешает тебе. В итоге агент не запускает отдельный headless, не требует копий профилей — он работает с твоим текущим браузером. На практике это даёт массу возможностей, но и свои ограничения.

Где застревают AI-агенты в браузерной автоматизации сейчас

Большинство AI-инструментов для браузера — это headless-автоматизация через Puppeteer, Playwright и им подобные. Звучит круто, но на деле:

Tencent/BrowserSkill решает эти проблемы, позволяя AI-агентам управлять твоим реальным, уже залогиненным браузером, и при этом не вмешиваться в твой UX.

Как работает Tencent/BrowserSkill: CLI + расширение

Проект состоит из двух частей:

  1. BrowserSkill CLI — командная строка, через которую AI-агент может посылать команды браузеру.
  2. Расширение для браузера — которое слушает команды от CLI и исполняет их в реальном браузере.

Это значит, что агент запускает CLI с нужной командой, а расширение в браузере принимает сигнал и выполняет скрипт или действие. Всё происходит в реальном браузере, с твоим профилем и сессиями.

В моём опыте это сильно удобнее, чем попытки сконнектиться к headless-браузеру или запускать отдельные инстансы. Особенно если хочешь, чтобы AI учитывал уже открытые вкладки, данные из локального storage, куки и т.п.

Пример сценария: AI-агент читает почту и пишет ответ

Представим, что у тебя есть AI-ассистент, который должен мониторить почтовый клиент в браузере (например, Gmail), читать новые письма и предлагать шаблоны ответов.

Без BrowserSkill тебе пришлось бы запускать отдельный headless-браузер, логиниться, парсить DOM, а затем создавать ответ. При этом у AI нет доступа к твоим уже открытым письмам и контексту.

С BrowserSkill workflow такой:

Весь процесс происходит без переключения вкладок, логинов, разрывов сессии. Пользователь при этом спокойно продолжает работать с браузером.

Пример кода CLI-команды (упрощённо):

browser-skill eval --script "document.querySelectorAll('.zA.zE').length"

Этот скрипт вернёт количество непрочитанных писем (в Gmail они отмечены классом .zA.zE).

Ограничения и подводные камни

Всё звучит классно, но на практике есть нюансы:

Кому стоит попробовать Tencent/BrowserSkill

Что попробовать дальше

Для начала рекомендую поставить расширение и потестить CLI на простых скриптах — например, получить информацию со страницы, открыть вкладку, вставить текст в форму.

Дальше можно подключать BrowserSkill к собственным AI-агентам — например, через LangChain или другие frameworks, которые умеют работать с shell-командами.

Если интересно vibe coding и agentic development, это отличный способ повысить уровень взаимодействия между человеком, AI и браузером — без лишних абстракций и overhead.


Tencent/BrowserSkill — не магия и не панацея. Это инструмент с очень узкой, но очень нужной нишей. Если тебе нужен AI, который реально «сидит» в твоём браузере и работает без стыковок, пробовать стоит. Главное — внимательно относись к безопасности и контролю расширения. В остальном — удобный способ сделать браузер частью твоего AI workflow.


Попробуй сам: Cursor — AI-редактор для разработчиков.


Источник: https://github.com/Tencent/BrowserSkill