doc-scraper: Go краулер, который создает локальный контекст документации для LLM.
doc-scraper, разработанный Срирамом ПР, собирает техническую документацию веб-сайтов и подготавливает ее для рабочих процессов с поддержкой ИИ. Приложение сканирует сайты документации и извлекает читаемый контент, оптимизированный для использования в качестве контекста модели, нацеливаясь на разработчиков и исследователей ИИ. Оно подчеркивает чистый, удобный для поиска вывод и локальное хранилище знаний, чтобы помощники на основе редакторов могли получать доступ к соответствующим справочным материалам без извлечения шумных веб-страниц во время составления запросов.
Преобразует HTML сайта в структурированный Markdown, подходящий для контекста модели
Инструмент представляет собой краулер на основе Go, который преобразует HTML документации в структурированный Markdown, удаляя навигационные панели, подножки и другие элементы, не относящиеся к содержанию. Преобразование сохраняет заголовки и встроенный код, уменьшая текстовый шум и создавая компактные файлы корпуса, которые сохраняют навигационный контекст через чистые заголовки и ссылки для облегчения поиска и ссылки в последующих рабочих процессах модели.
Поисковая способность и обнаружение изменений делают корпус надежным для агентов
Приложение встраивает оффлайн BM25 поиск, реализованный через SQLite FTS5, позволяя выполнять локальные запросы к собранному корпусу без доступа в интернет. Состояние сохраняется с помощью BadgerDB и SQLite, поддерживая возобновляемые операции и индекс истории. Механизм различий, учитывающий содержание, определяет фактические изменения страниц, а не полагается исключительно на временные метки, что уменьшает избыточные загрузки и сохраняет локальный корпус сосредоточенным на существенных правках.
Шаблоны ввода и ограничения обхода определяют, где он успешен
doc-scraper автоматически определяет фреймворки документации, такие как Docusaurus, MkDocs, Sphinx, GitBook и ReadTheDocs, и использует экстрактор на основе читаемости на незнакомых сайтах. Обход выполняется параллельно с управлением общими ресурсами и встроенным ограничением скорости, и краулер уважает robots.txt, чтобы оставаться вежливым. Эти границы приоритизируют извлечение контента, относящегося к разработчикам, избегая чрезмерной нагрузки на сеть.
Локальный хостинг MCP подходит для ориентированных на редактора AI рабочих процессов и потребностей в конфиденциальности
Когда приложение работает в серверном режиме, оно действует как сервер Протокола Контекста Модели, чтобы локальные AI агенты могли читать и искать документацию внутри редакторов. Дизайн локальной, оффлайн базы знаний сохраняет доступную для поиска документацию для таких агентов, как Claude Desktop, Claude Code и Cursor, уменьшая зависимость от удаленного извлечения. Инструмент отмечен в сообществах разработчиков Go и AI за создание чистого вывода на сайтах, с которыми другие краулеры сталкиваются с трудностями.
Лучше всего подходит для технически грамотных разработчиков, которые могут создавать и размещать локальный контекст
doc-scraper является практичным вариантом для разработчиков и исследователей, которым нужна проверяемая, локально размещенная документация в качестве контекста модели. Поскольку инструмент требует сборки из исходного кода с помощью Go (версии 1.25 или выше), он ориентирован на технически способных пользователей; командам, которые не могут компилировать проекты Go, следует ожидать дополнительных затрат на настройку. Пользователи должны проверять извлеченные отрывки перед использованием их в качестве авторитетных входных данных для модели.