Парсинг (Scraping/Скрейпинг)
Автоматизированный процесс программного сбора данных с веб-страниц сайтов с целью их последующего извлечения, очистки и структурирования (как правило, в виде таблиц Excel, баз данных или JSON-файлов).
Объясняем сложную техническую терминологию простым языком, чтобы сократить барьер между Data-инженерами и бизнесом
Автоматизированный процесс программного сбора данных с веб-страниц сайтов с целью их последующего извлечения, очистки и структурирования (как правило, в виде таблиц Excel, баз данных или JSON-файлов).
Процесс систематического и автоматизированного обхода страниц в интернете. В отличие от парсинга (нацеленного на точечный сбор конкретных данных), краулинг направлен на обнаружение новых URL-адресов и сканирование структуры сайтов, по принципу работы поисковых роботов Google.
Соглашение об уровне сервиса. В контексте наших услуг — это измеримые стандарты дедупликации, очистки от мусора, регулярности проверок и форматных валидаций, которые мы обязуемся выполнять для обеспечения качества собираемых данных.
Сегмент рынка «Бизнес для бизнеса». Наши профильные B2B базы состоят из верифицированных контактов юридических лиц (ООО, ПАО, ЗАО, АО) и Индивидуальных предпринимателей (ИП).
Программное обеспечение как услуга. Бизнес-модель, при которой ПО доступно в браузере по подписке. Платформа XMLDATAFEED является классическим Data-SaaS решением.
Процесс алгоритмического выявления и удаления дублирующихся (повторяющихся) записей в базе данных. Для юридических лиц мы используем жесткую дедупликацию по связке ИНН + ОГРН, а для контактов — по нормализованным телефонам и email-адресам.
Процесс дополнения имеющейся у клиента базы (например, списка ИНН или названий) новыми полезными атрибутами (телефоны, email, адреса, выручка, ФИО директора), собранными из внешних источников.
Классический подход в Data Engineering: Извлечение данных из множества источников (Extract), их очистка, фильтрация и приведение к единому формату (Transform), а затем загрузка в конечную базу данных или CRM клиента (Load).
Общероссийский классификатор видов экономической деятельности. Цифровые коды, по которым Федеральная налоговая служба (ФНС) определяет профиль коммерческой деятельности компании. Мы используем ОКВЭД как главный семантический фильтр при таргетированном сборе B2B баз.
Набор уникальных государственных идентификаторов юридического лица в РФ. ИНН — идентификационный номер налогоплательщика. ОГРН — основной регистрационный номер. Регулярно используются как первичный ключ (Primary Key) для объединения разных баз.
Процент Email-писем или SMS-сообщений, успешно дошедших до сервера получателя и не отбитых почтовыми фильтрами. Для B2B-баз холодного обзвона нормой Delivery Rate считается показатель в 80-85% в связи с регулярной текучестью кадров в компаниях.
Интерфейс программирования приложений. Механизм, с помощью которого две разные программы обмениваются данными напрямую, минуя графический интерфейс. Парсинг через внутренние API или мобильные API приложений работает в 10-100 раз быстрее и стабильнее, чем классический парсинг HTML-кода.
Механизм получения уведомлений в реальном времени. В отличие от API, где клиент должен постоянно опрашивать сервер («Готово?»), вебхук позволяет серверу самому отправить данные на указанный URL-адрес клиента в момент завершения парсинга.
Тест Тьюринга для отличия компьютеров от людей (например, ReCaptcha, hCaptcha, Cloudflare Turnstile). Сайты используют капчу для защиты от парсеров. Наши технические решения предусматривают использование сервисов и ML-алгоритмов для их автоматизированного прохождения.
Промежуточные транзитные серверы. Позволяют имитировать запросы от разных реальных пользователей (из разных городов, мобильных операторов и стран). Критически необходимы для обхода блокировок по IP. Различают серверные, резидентные и мобильные прокси.
Полноценный веб-браузер (например, на базе Chromium), который запускается на сервере без графического интерфейса пользователя. Позволяет парсить сложные сайты, написанные на React/Vue/Angular (SPA), которые требуют выполнения JavaScript для отображения контента.
Искусственные ограничения, накладываемые веб-серверами на количество запросов в единицу времени (например, 'не более 10 запросов в секунду с одного IP'). Для преодоления лимитов применяется троттлинг (задержки) и пулы прокси-серверов.
Сетевой HTTP-заголовок (строка), который браузер отправляет серверу при запросе страницы, сообщая свою версию, тип устройства и операционную систему. Важный фактор при маскировке бота под обычного пользователя (Spoofing).
Объектная модель документа. Представление HTML-документа в виде древовидной структуры, где каждый элемент (тег, текст) является узлом. Парсеры перемещаются по этому дереву, чтобы находить нужные фрагменты данных.
Шаблоны, используемые для поиска HTML-элементов на странице. Например, селектор '.price > span' найдет все элементы span внутри блоков с классом price. Это один из самых популярных способов навигации для извлечения информации при парсинге.
Мощный язык запросов к элементам XML и HTML документов. В отличие от CSS-селекторов, позволяет осуществлять поиск элементов не только «сверху вниз», но и двигаться вверх по дереву, а также искать элементы по внутреннему текстовому содержимому.
Формальный язык поиска и манипуляций с подстроками в тексте. Применяется для извлечения номеров телефонов, email-адресов, цен или артикулов из сплошного неструктурированного текста на странице.
Процесс разделения большого массива данных на отдельные страницы (например, список товаров из 1000 позиций, разбитый по 50 товаров на страницу). Парсер должен уметь алгоритмически «прокликивать» пагинацию или обходить её через манипуляции с URL параметрами.
Простейший «плоский» текстовый формат, где табличные значения разделены запятыми (,) или точками с запятой (;). Идеально и максимально быстро подходит для последующего импорта собранных баз в CRM (Битрикс24, AmoCRM, 1C) или анализа в Pandas (Python).
Расширяемый язык разметки. Используется для жестко структурированной передачи данных. В e-commerce применяется для передачи конфигураций каталоговых деревьев и товарных фидов для Яндекс.Маркета или Ozon (форматы YML — Yandex Market Language).
Универсальный текстовый формат обмена данными, основанный на синтаксисе объектов JavaScript. Самый популярный в мире формат для взаимодействия через API. Отличается гибкостью, позволяя хранить сложные вложенные массивы данных.
Проприетарный формат электронных таблиц Microsoft. Поддерживает форматирование, фильтры и несколько листов (табов) внутри одной книги. Мы предоставляем выгрузки в XLSX для ручного анализа данных менеджерами или бухгалтерами.