Data Engineer (OSINT and Web Data Infrastructure)
$$$
🪖 DefTech
Product
У зв’язку з розширенням R&D-відділу шукаємо Data Engineer для створення та розвитку розподiленої інфраструктури збору, обробки та моделювання OSINT і веб-даних.
Якщо ваша амбіція — не просто писати скрейпери, а будувати високонавантажені ETL/ELT-пайплайни, розбудовувати Data Lakehouse та графові БД для виявлення неочевидних зв'язків у терабайтах неструктурованих даних, ця роль саме для вас.
Що тебе чекає?
- Архітектура інфраструктури даних: З нуля проєктувати та будувати масштабовану, стійку до відмов інфраструктуру для збору, нормалізації та збагачення даних із відкритих і напівпублічних джерел (API, реєстри, соцмережі, веб-ресурси).
- Розробка Ingestion-платформи: Створювати уніфікований фреймворк для розподiленого збору даних (з підтримкою черг, ротації IP/проксі, обходу anti-bot систем та headless-браузерів), замість написання ізольованих скриптів.
- Оркестрація та ETL/ELT: Розробляти та підтримувати автоматизовані пайплайни обробки даних (batch & streaming) із використанням сучасних оркестраторів.
- Моделювання даних та DWH/Graph DB: Проєктувати схеми зберігання в Data Lake, колоночних (ClickHouse/Snowflake) та графових БД (Neo4j) для швидкого побудови мап зв'язків між компаніями, об'єктами та decision-makers.
- Time-Series та CDC: Впроваджувати підходи версіонування даних, Time-Series та Change Data Capture (CDC) для відстеження точної історії змін у джерелах.
- Data Quality & Lineage: Налаштовувати автоматизоване тестування якості даних (Data Quality), дедуплікацію, моніторинг аномалій та відстеження походження даних (Data Lineage).
- CI/CD та DevOps-практики: Контейнеризувати сервіси, налаштовувати моніторинг (Prometheus/Grafana) та логування пайплайнів для забезпечення високої доступності систем (SLA).
- Взаємодія з продуктовою командою: Забезпечувати Data Analysts, ML-інженерів та OSINT-дослідників готовими, очищеними та структурованими датасетами через зручні API або вигрузки.
Необхідні навички та досвід:
- Досвід: 3+ роки на позиції Data Engineer або Software Engineer із фокусом на побудову розподілених систем обробки даних / Ingestion-систем.
- Мови програмування: Впевнене володіння Python (asyncio, multiprocessing)
- Оркестрація та обробка: Практичний досвід із Apache Airflow / Prefect / Dagster та брокерами повідомлень (Kafka, RabbitMQ, Celery).
- Бази даних та моделювання:
- Досвід роботи з реляційними (PostgreSQL) та колоночними БД (ClickHouse, BigQuery, Snowflake).
- Розуміння принципів роботи Graph DB (Neo4j, Memgraph) — буде вагомим плюсом.
- Практичні знання dbt, SQL, розробки REST/gRPC API.
- Distributed Scraping & Ingestion Architecture: Глибоке розуміння мережевих протоколів (HTTP/HTTPS, WebSockets), роботи headless-браузерів (Playwright, Puppeteer), методів обходу anti-bot захисту (Cloudflare, CAPTCHA) та роботи проксі-мереж.
- Data Quality: Досвід роботи з інструментами перевірки якості даних (Great Expectations, Soda) та розуміння Time-Series підходів.
- Інфраструктура: Досвід із Docker, Kubernetes, Terraform, Linux, CI/CD (GitHub Actions / GitLab CI) та системами моніторингу.
- Soft Skills: Системне інженерне мислення, вміння проєктувати рішення під масштабування, ведення технічної документації та активна співпраця з суміжними командами.
Що ми пропонуємо: - Оформлення: прозоре співробітництво через Дія.City.
- Локація: сучасний офіс у Києві (Правий берег).
- Турбота: медичне страхування та можливість консультацій з психологом.
- Розвиток: компенсація профільних курсів, доступ до навчальних матеріалів, система менторингу та бадді.
- Відпочинок: 24 дні оплачуваної відпустки, додатковий вихідний на День народження, подарунки до важливих дат та спільні заходи.
- Оплата: конкурентна ринкова компенсація та система бонусів.
Required languages
Ukrainian
Native
Published 17 August
10 views
·
1 application
📊
Average salary range of similar jobs in
analytics →
Loading...