Audyt jakości danych Job Posting in Hungary

Cel projektu

Celem projektu była ocena jakości danych zbioru Job Posting Data in Hungary pochodzących zserwisu kaggle.com, oraz określenie, czy dane pozwalają na przeprowadzenie wiarygodnej analizy rynku pracy.

Status projektu: Dokumentacja projektu została ukończona. Repozytorium GitHub jest obecnie uzupełniane o kod SQL oraz materiały źródłowe wykorzystane podczas audytu jakości danych.

Pipeline ETLi Analizy danych rynku pracy
Pipeline przetwarzania i analizy danych rynku pracy

Projekt: Analiza rynku ofert pracy
Narzędzia: Power Query / Pandas: profilowanie, czyszczenie i przygotowanie danych. Sql: audyt jakości danych, analiza spójności i kompletności zbioru.
Opis: Projekt początkowo zakładał analizę rynku pracy na Węgrzech na podstawie zbioru ofert pracy. Podczas eksploracji danych przeprowadzono ocenę jakości i reprezentatywności zbioru, w wyniku której stwierdzono, że spośród blisko 10 000 rekordów jedynie 16 ofert było powiązanych z rynkiem węgierskim. Tak ograniczona próba nie pozwalała na wyciąganie wiarygodnych wniosków, dlatego zakres projektu został zweryfikowany i rozszerzony na analizę całego zbioru danych. Przed właściwą analizą przeprowadzono proces czyszczenia i przygotowania danych w Pythonie z wykorzystaniem biblioteki Pandas, usuwając kolumny o niskiej wartości analitycznej oraz porządkując strukturę danych. Oczyszczony dataset został następnie załadowany do bazy danych, gdzie przy pomocy SQL przeprowadzono analizę wymagań rekrutacyjnych, poszukiwanych kompetencji, technologii oraz wybranych charakterystyk publikowanych ofert pracy.

Dane


Analiza została przeprowadzona na podstawie następujących zmiennych:

  •   Website, Domain: Domena, skąd pchodzi ogłoszenie.
  •   Job_Opening_Title: Początkowa nazwa stanowiska
  •   First_Seen_At: Dataperwszej publikacji.
  •   Last_Seen_At: Data zdjęia ogłoszenia.
  •   Location: Umiejscowienie oferty.
  •  Category: categoria ogłoszenia
  •  Seniority: Poziom stanowiska
  •  Contract_Type: Rodzaj umowy
  •  Job_Status: Status oferty
  •  Job_Language: Język stanowiska
  •  Job_Last_Processed: Data ostatniego procesowania oferty

Zakres prac


W ramach projektu przeprowadzono profilowanie i ocenę jakości danych pochodzących ze zbioru ofert pracy. Prace rozpoczęto od eksploracji struktury danych oraz identyfikacji kluczowych atrybutów wykorzystywanych w potencjalnej analizie rynku pracy. Następnie przy użyciu zapytań SQL zweryfikowano spójność danych lokalizacyjnych, stanowiskowych oraz kategorii zawodowych. Szczególną uwagę poświęcono wykrywaniu brakujących wartości, niespójnych formatów zapisu, błędów kodowania znaków oraz różnic w poziomie szczegółowości danych. W dalszej części projektu oceniono możliwość wykorzystania poszczególnych kolumn do analiz biznesowych oraz określono ograniczenia wynikające z jakości danych. Projekt zakończono przygotowaniem wniosków dotyczących gotowości zbioru do dalszej analizy i raportowania.

Njważniejsze ustalenia oraz wnioskki


W trakcie profilowania zbioru danych zidentyfikowano istotne problemy jakościowe, które znacząco ograniczają możliwość przeprowadzenia wiarygodnej analizy rynku pracy. Największe nieprawidłowości wystąpiły w danych lokalizacyjnych, gdzie w jednej kolumnie równocześnie znajdowały się kraje, miasta, regiony administracyjne oraz wartości niepełne lub błędnie zapisane. Dodatkowo wykryto przypadki niepoprawnego kodowania znaków, co utrudniało jednoznaczną identyfikację części lokalizacji.

Analiza stanowisk wykazała bardzo wysoką różnorodność nazw oraz brak wspólnego standardu ich zapisu. W efekcie podobne role występowały pod wieloma wariantami nazw, co uniemożliwiało przeprowadzenie rzetelnych agregacji bez wcześniejszej normalizacji danych. Podobne problemy zaobserwowano w kategoriach zawodowych, które były przypisywane w sposób niejednorodny, a część rekordów zawierała wartości nieokreślone.

Spośród analizowanych atrybutów jedynie zmienna Seniority charakteryzowała się względnie spójną strukturą i ograniczonym zestawem wartości. Należy jednak podkreślić, że opisywała ona poziom odpowiedzialności menedżerskiej, a nie klasyczny poziom doświadczenia zawodowego. Z tego względu mogła zostać wykorzystana jedynie w ograniczonym zakresie.

rzeprowadzona ocena jakości danych doprowadziła do wniosku, że badany zbiór nie jest wystarczająco przygotowany do wiarygodnej analizy rynku pracy. Wykorzystanie danych bez wcześniejszej standaryzacji i rekonstrukcji części informacji mogłoby prowadzić do błędnych lub mylących wniosków analitycznych.

Wniosek: Przeprowadzenie wiarygodnej analizy rynku pracy na podstawie badanego zbioru danych nie było możliwe bez szeroko zakrojonej normalizacji danych. Projekt zakończono identyfikacją problemów jakościowych oraz oceną gotowości danych do dalszej analizy.