MC, 2025
Ilustracja do artykułu: Zmeňte prácu s dátami: Pandas tutorial with examples

Zmeňte prácu s dátami: Pandas tutorial with examples

Knižnica Pandas je jednou z najobľúbenejších a najpoužívanejších knižníc v jazyku Python na prácu s dátami. Ak ste niekedy pracovali s tabuľkami, CSV súbormi, dátovými rámcami alebo štatistickými výpočtami, je veľmi pravdepodobné, že ste narazili na Pandas – alebo by ste mali! Tento pandas tutorial with examples vám zábavnou a zrozumiteľnou formou ukáže, ako sa s Pandas pracuje, od úplných základov až po praktické príklady použitia.

Čo je Pandas a prečo ho používať?

Pandas je open-source knižnica určená na manipuláciu s dátami a ich analýzu. Ponúka dve základné dátové štruktúry: Series a DataFrame, ktoré vám umožnia efektívne pracovať s jednorozmernými a dvojrozmernými dátami. Medzi hlavné výhody patrí jednoduchosť, čitateľnosť a rýchlosť práce s veľkými objemami dát.

Začíname s Pandas

Najskôr si Pandas nainštalujeme. Ak ho ešte nemáte, stačí použiť pip:

pip install pandas

Potom si môžeme knižnicu importovať v našom skripte:

import pandas as pd

Vytvorenie základných dátových štruktúr

V Pandas sa najčastejšie pracuje s dátovými rámcami (DataFrame) a sériami (Series). Tu sú príklady ich vytvorenia:

# Series
data = pd.Series([10, 20, 30, 40])
print(data)

# DataFrame
data_dict = {
    'Meno': ['Anna', 'Peter', 'Lucia'],
    'Vek': [25, 30, 28]
}
df = pd.DataFrame(data_dict)
print(df)

Všimnite si, ako rýchlo a intuitívne vytvárame štruktúrované dáta. A to je len začiatok!

Nahrávanie dát zo súboru

Pandas podporuje čítanie dát z rôznych formátov – CSV, Excel, JSON a ďalšie. Najčastejšie sa používa CSV:

df = pd.read_csv('data.csv')
print(df.head())

Funkcia head() zobrazí prvých päť riadkov. Môžete tiež použiť tail() pre posledné riadky.

Preskúmanie dát

Aby sme pochopili štruktúru dát, použijeme niekoľko užitočných metód:

print(df.info())
print(df.describe())
print(df.columns)
print(df.shape)

Tieto funkcie vám povedia, koľko máte riadkov a stĺpcov, aké typy dát obsahujú, základné štatistiky a viac.

Výber a filtrovanie dát

Výber dát z DataFrame je v Pandas extrémne flexibilný:

# Výber jedného stĺpca
print(df['Meno'])

# Výber viacerých stĺpcov
print(df[['Meno', 'Vek']])

# Filtrovanie riadkov
print(df[df['Vek'] > 25])

pandas tutorial with examples nám tu jasne ukazuje, ako ľahko možno selektovať a filtrovať dáta.

Pridávanie a mazanie stĺpcov

Pridanie nového stĺpca je jednoduché ako priradenie hodnoty:

df['Mesto'] = ['Bratislava', 'Košice', 'Žilina']

Vymazanie stĺpca sa robí pomocou drop():

df = df.drop('Mesto', axis=1)

Funkcia axis=1 označuje, že pracujeme so stĺpcami (nie riadkami).

Agregačné funkcie a skupinovanie

Pandas obsahuje množstvo zabudovaných funkcií na analýzu dát:

print(df['Vek'].mean())     # priemer
print(df['Vek'].max())      # maximum
print(df['Vek'].min())      # minimum

Skupinovanie je ďalšia silná zbraň:

grouped = df.groupby('Mesto')['Vek'].mean()
print(grouped)

Toto vám dá priemerný vek podľa mesta – a to všetko v jednej elegantnej línii!

Práca s chýbajúcimi hodnotami

Chýbajúce hodnoty sú bežným problémom. Pandas ponúka jednoduché spôsoby, ako ich nájsť a opraviť:

print(df.isnull().sum())  # počet chýbajúcich hodnôt

df = df.fillna(0)         # nahradenie nulou
df = df.dropna()          # odstránenie riadkov s NaN

Ukladanie upravených dát

Po úpravách môžeme dáta uložiť späť do súboru:

df.to_csv('upraveny_data.csv', index=False)

Parametrom index=False zabránime uloženiu indexu ako samostatného stĺpca.

Vizualizácia dát

Aj keď Pandas nie je vizualizačný nástroj, v spolupráci s knižnicami ako Matplotlib alebo Seaborn dokáže vytvoriť grafy:

import matplotlib.pyplot as plt

df['Vek'].plot(kind='bar')
plt.show()

A hneď máte graf bez potreby veľkého úsilia. Čisté, jednoduché a efektívne.

Skutočný príklad z praxe

Predstavme si, že máme CSV s predajnými údajmi. Pomocou Pandas môžeme získať rôzne zaujímavé štatistiky:

df = pd.read_csv('predaje.csv')

# Celkový predaj podľa regiónov
print(df.groupby('Región')['Suma'].sum())

# Top 5 produktov podľa predaja
top_produkty = df.groupby('Produkt')['Suma'].sum().sort_values(ascending=False).head(5)
print(top_produkty)

Takéto analýzy sú kľúčové pre rozhodovanie v biznise. Pandas tutorial with examples dokazuje, že aj s minimálnym úsilím môžeme získať maximálnu hodnotu z dát.

Zhrnutie a odporúčanie na záver

Knižnica Pandas je neoceniteľným nástrojom pre každého, kto pracuje s dátami – či už ste výskumník, analytik, vývojár alebo len dátový nadšenec. V tomto pandas tutorial with examples sme si ukázali základy aj pokročilejšie triky, ktoré vám umožnia robiť s dátami zázraky.

Od čítania súborov cez úpravy a čistenie dát, až po agregáciu a vizualizáciu – Pandas má všetko, čo potrebujete. A čo je najlepšie? S Pandas je práca s dátami nielen jednoduchá, ale aj zábavná!

Teraz je čas, aby ste si to všetko vyskúšali sami. Otvorte si Jupyter Notebook alebo svoj obľúbený editor, načítajte údaje a ponorte sa do sveta Pandas. Nech vás analýza baví!

Komentarze (0) - Nikt jeszcze nie komentował - bądź pierwszy!

Imię:
Treść: