Zmeňte prácu s dátami: Pandas tutorial with examples
Knižnica Pandas je jednou z najobľúbenejších a najpoužívanejších knižníc v jazyku Python na prácu s dátami. Ak ste niekedy pracovali s tabuľkami, CSV súbormi, dátovými rámcami alebo štatistickými výpočtami, je veľmi pravdepodobné, že ste narazili na Pandas – alebo by ste mali! Tento pandas tutorial with examples vám zábavnou a zrozumiteľnou formou ukáže, ako sa s Pandas pracuje, od úplných základov až po praktické príklady použitia.
Čo je Pandas a prečo ho používať?
Pandas je open-source knižnica určená na manipuláciu s dátami a ich analýzu. Ponúka dve základné dátové štruktúry: Series a DataFrame, ktoré vám umožnia efektívne pracovať s jednorozmernými a dvojrozmernými dátami. Medzi hlavné výhody patrí jednoduchosť, čitateľnosť a rýchlosť práce s veľkými objemami dát.
Začíname s Pandas
Najskôr si Pandas nainštalujeme. Ak ho ešte nemáte, stačí použiť pip:
pip install pandas
Potom si môžeme knižnicu importovať v našom skripte:
import pandas as pd
Vytvorenie základných dátových štruktúr
V Pandas sa najčastejšie pracuje s dátovými rámcami (DataFrame) a sériami (Series). Tu sú príklady ich vytvorenia:
# Series
data = pd.Series([10, 20, 30, 40])
print(data)
# DataFrame
data_dict = {
'Meno': ['Anna', 'Peter', 'Lucia'],
'Vek': [25, 30, 28]
}
df = pd.DataFrame(data_dict)
print(df)
Všimnite si, ako rýchlo a intuitívne vytvárame štruktúrované dáta. A to je len začiatok!
Nahrávanie dát zo súboru
Pandas podporuje čítanie dát z rôznych formátov – CSV, Excel, JSON a ďalšie. Najčastejšie sa používa CSV:
df = pd.read_csv('data.csv')
print(df.head())
Funkcia head() zobrazí prvých päť riadkov. Môžete tiež použiť tail() pre posledné riadky.
Preskúmanie dát
Aby sme pochopili štruktúru dát, použijeme niekoľko užitočných metód:
print(df.info()) print(df.describe()) print(df.columns) print(df.shape)
Tieto funkcie vám povedia, koľko máte riadkov a stĺpcov, aké typy dát obsahujú, základné štatistiky a viac.
Výber a filtrovanie dát
Výber dát z DataFrame je v Pandas extrémne flexibilný:
# Výber jedného stĺpca print(df['Meno']) # Výber viacerých stĺpcov print(df[['Meno', 'Vek']]) # Filtrovanie riadkov print(df[df['Vek'] > 25])
pandas tutorial with examples nám tu jasne ukazuje, ako ľahko možno selektovať a filtrovať dáta.
Pridávanie a mazanie stĺpcov
Pridanie nového stĺpca je jednoduché ako priradenie hodnoty:
df['Mesto'] = ['Bratislava', 'Košice', 'Žilina']
Vymazanie stĺpca sa robí pomocou drop():
df = df.drop('Mesto', axis=1)
Funkcia axis=1 označuje, že pracujeme so stĺpcami (nie riadkami).
Agregačné funkcie a skupinovanie
Pandas obsahuje množstvo zabudovaných funkcií na analýzu dát:
print(df['Vek'].mean()) # priemer print(df['Vek'].max()) # maximum print(df['Vek'].min()) # minimum
Skupinovanie je ďalšia silná zbraň:
grouped = df.groupby('Mesto')['Vek'].mean()
print(grouped)
Toto vám dá priemerný vek podľa mesta – a to všetko v jednej elegantnej línii!
Práca s chýbajúcimi hodnotami
Chýbajúce hodnoty sú bežným problémom. Pandas ponúka jednoduché spôsoby, ako ich nájsť a opraviť:
print(df.isnull().sum()) # počet chýbajúcich hodnôt df = df.fillna(0) # nahradenie nulou df = df.dropna() # odstránenie riadkov s NaN
Ukladanie upravených dát
Po úpravách môžeme dáta uložiť späť do súboru:
df.to_csv('upraveny_data.csv', index=False)
Parametrom index=False zabránime uloženiu indexu ako samostatného stĺpca.
Vizualizácia dát
Aj keď Pandas nie je vizualizačný nástroj, v spolupráci s knižnicami ako Matplotlib alebo Seaborn dokáže vytvoriť grafy:
import matplotlib.pyplot as plt df['Vek'].plot(kind='bar') plt.show()
A hneď máte graf bez potreby veľkého úsilia. Čisté, jednoduché a efektívne.
Skutočný príklad z praxe
Predstavme si, že máme CSV s predajnými údajmi. Pomocou Pandas môžeme získať rôzne zaujímavé štatistiky:
df = pd.read_csv('predaje.csv')
# Celkový predaj podľa regiónov
print(df.groupby('Región')['Suma'].sum())
# Top 5 produktov podľa predaja
top_produkty = df.groupby('Produkt')['Suma'].sum().sort_values(ascending=False).head(5)
print(top_produkty)
Takéto analýzy sú kľúčové pre rozhodovanie v biznise. Pandas tutorial with examples dokazuje, že aj s minimálnym úsilím môžeme získať maximálnu hodnotu z dát.
Zhrnutie a odporúčanie na záver
Knižnica Pandas je neoceniteľným nástrojom pre každého, kto pracuje s dátami – či už ste výskumník, analytik, vývojár alebo len dátový nadšenec. V tomto pandas tutorial with examples sme si ukázali základy aj pokročilejšie triky, ktoré vám umožnia robiť s dátami zázraky.
Od čítania súborov cez úpravy a čistenie dát, až po agregáciu a vizualizáciu – Pandas má všetko, čo potrebujete. A čo je najlepšie? S Pandas je práca s dátami nielen jednoduchá, ale aj zábavná!
Teraz je čas, aby ste si to všetko vyskúšali sami. Otvorte si Jupyter Notebook alebo svoj obľúbený editor, načítajte údaje a ponorte sa do sveta Pandas. Nech vás analýza baví!

Komentarze (0) - Nikt jeszcze nie komentował - bądź pierwszy!