Глоссарий терминов

Объясняем сложную техническую терминологию простым языком, чтобы сократить барьер между Data-инженерами и бизнесом

27 из 27 терминов
Категории:

Базовые понятия

Парсинг (Scraping/Скрейпинг)

Автоматизированный процесс программного сбора данных с веб-страниц сайтов с целью их последующего извлечения, очистки и структурирования (как правило, в виде таблиц Excel, баз данных или JSON-файлов).

Краулинг (Crawling / Spidering)

Процесс систематического и автоматизированного обхода страниц в интернете. В отличие от парсинга (нацеленного на точечный сбор конкретных данных), краулинг направлен на обнаружение новых URL-адресов и сканирование структуры сайтов, по принципу работы поисковых роботов Google.

SLA (Service Level Agreement)

Соглашение об уровне сервиса. В контексте наших услуг — это измеримые стандарты дедупликации, очистки от мусора, регулярности проверок и форматных валидаций, которые мы обязуемся выполнять для обеспечения качества собираемых данных.

B2B (Business to Business)

Сегмент рынка «Бизнес для бизнеса». Наши профильные B2B базы состоят из верифицированных контактов юридических лиц (ООО, ПАО, ЗАО, АО) и Индивидуальных предпринимателей (ИП).

SaaS (Software as a Service)

Программное обеспечение как услуга. Бизнес-модель, при которой ПО доступно в браузере по подписке. Платформа XMLDATAFEED является классическим Data-SaaS решением.

Аналитика и Данные

Дедупликация

Процесс алгоритмического выявления и удаления дублирующихся (повторяющихся) записей в базе данных. Для юридических лиц мы используем жесткую дедупликацию по связке ИНН + ОГРН, а для контактов — по нормализованным телефонам и email-адресам.

Обогащение данных (Data Enrichment)

Процесс дополнения имеющейся у клиента базы (например, списка ИНН или названий) новыми полезными атрибутами (телефоны, email, адреса, выручка, ФИО директора), собранными из внешних источников.

ETL (Extract, Transform, Load)

Классический подход в Data Engineering: Извлечение данных из множества источников (Extract), их очистка, фильтрация и приведение к единому формату (Transform), а затем загрузка в конечную базу данных или CRM клиента (Load).

ОКВЭД

Общероссийский классификатор видов экономической деятельности. Цифровые коды, по которым Федеральная налоговая служба (ФНС) определяет профиль коммерческой деятельности компании. Мы используем ОКВЭД как главный семантический фильтр при таргетированном сборе B2B баз.

ИНН / ОГРН / КПП

Набор уникальных государственных идентификаторов юридического лица в РФ. ИНН — идентификационный номер налогоплательщика. ОГРН — основной регистрационный номер. Регулярно используются как первичный ключ (Primary Key) для объединения разных баз.

Delivery Rate (Показатель доставки)

Процент Email-писем или SMS-сообщений, успешно дошедших до сервера получателя и не отбитых почтовыми фильтрами. Для B2B-баз холодного обзвона нормой Delivery Rate считается показатель в 80-85% в связи с регулярной текучестью кадров в компаниях.

Разработка и Инфраструктура

API (Application Programming Interface)

Интерфейс программирования приложений. Механизм, с помощью которого две разные программы обмениваются данными напрямую, минуя графический интерфейс. Парсинг через внутренние API или мобильные API приложений работает в 10-100 раз быстрее и стабильнее, чем классический парсинг HTML-кода.

Webhook (Вебхук)

Механизм получения уведомлений в реальном времени. В отличие от API, где клиент должен постоянно опрашивать сервер («Готово?»), вебхук позволяет серверу самому отправить данные на указанный URL-адрес клиента в момент завершения парсинга.

CAPTCHA (Капча)

Тест Тьюринга для отличия компьютеров от людей (например, ReCaptcha, hCaptcha, Cloudflare Turnstile). Сайты используют капчу для защиты от парсеров. Наши технические решения предусматривают использование сервисов и ML-алгоритмов для их автоматизированного прохождения.

Proxy (Прокси / Мобильные IP)

Промежуточные транзитные серверы. Позволяют имитировать запросы от разных реальных пользователей (из разных городов, мобильных операторов и стран). Критически необходимы для обхода блокировок по IP. Различают серверные, резидентные и мобильные прокси.

Headless Browser (Безголовый браузер)

Полноценный веб-браузер (например, на базе Chromium), который запускается на сервере без графического интерфейса пользователя. Позволяет парсить сложные сайты, написанные на React/Vue/Angular (SPA), которые требуют выполнения JavaScript для отображения контента.

Rate Limits (Лимиты сетевых запросов)

Искусственные ограничения, накладываемые веб-серверами на количество запросов в единицу времени (например, 'не более 10 запросов в секунду с одного IP'). Для преодоления лимитов применяется троттлинг (задержки) и пулы прокси-серверов.

User-Agent

Сетевой HTTP-заголовок (строка), который браузер отправляет серверу при запросе страницы, сообщая свою версию, тип устройства и операционную систему. Важный фактор при маскировке бота под обычного пользователя (Spoofing).

Методы извлечения данных

DOM (Document Object Model)

Объектная модель документа. Представление HTML-документа в виде древовидной структуры, где каждый элемент (тег, текст) является узлом. Парсеры перемещаются по этому дереву, чтобы находить нужные фрагменты данных.

CSS Selectors (CSS-селекторы)

Шаблоны, используемые для поиска HTML-элементов на странице. Например, селектор '.price > span' найдет все элементы span внутри блоков с классом price. Это один из самых популярных способов навигации для извлечения информации при парсинге.

XPath (XML Path Language)

Мощный язык запросов к элементам XML и HTML документов. В отличие от CSS-селекторов, позволяет осуществлять поиск элементов не только «сверху вниз», но и двигаться вверх по дереву, а также искать элементы по внутреннему текстовому содержимому.

Regex (Регулярные выражения)

Формальный язык поиска и манипуляций с подстроками в тексте. Применяется для извлечения номеров телефонов, email-адресов, цен или артикулов из сплошного неструктурированного текста на странице.

Пагинация (Pagination)

Процесс разделения большого массива данных на отдельные страницы (например, список товаров из 1000 позиций, разбитый по 50 товаров на страницу). Парсер должен уметь алгоритмически «прокликивать» пагинацию или обходить её через манипуляции с URL параметрами.

Стандарты Форматов

CSV (Comma-Separated Values)

Простейший «плоский» текстовый формат, где табличные значения разделены запятыми (,) или точками с запятой (;). Идеально и максимально быстро подходит для последующего импорта собранных баз в CRM (Битрикс24, AmoCRM, 1C) или анализа в Pandas (Python).

XML (eXtensible Markup Language)

Расширяемый язык разметки. Используется для жестко структурированной передачи данных. В e-commerce применяется для передачи конфигураций каталоговых деревьев и товарных фидов для Яндекс.Маркета или Ozon (форматы YML — Yandex Market Language).

JSON (JavaScript Object Notation)

Универсальный текстовый формат обмена данными, основанный на синтаксисе объектов JavaScript. Самый популярный в мире формат для взаимодействия через API. Отличается гибкостью, позволяя хранить сложные вложенные массивы данных.

Excel (XLSX)

Проприетарный формат электронных таблиц Microsoft. Поддерживает форматирование, фильтры и несколько листов (табов) внутри одной книги. Мы предоставляем выгрузки в XLSX для ручного анализа данных менеджерами или бухгалтерами.