MC, 2025
Ilustracja do artykułu: Pandas-opas esimerkeillä: Opi hyödyntämään pandas tehokkaasti

Pandas-opas esimerkeillä: Opi hyödyntämään pandas tehokkaasti

Pandas on yksi Pythonin suosituimmista kirjastoista, ja se on erinomainen työkalu datan käsittelyyn ja analysointiin. Pandas on erityisen hyödyllinen, kun työskentelet taulukkotyyppisten tietojen, kuten CSV-tiedostojen tai SQL-tietokantojen kanssa. Tässä artikkelissa tutustumme pandas-kirjastoon ja sen käyttöön esimerkkien avulla, jotka auttavat sinua ymmärtämään sen toiminnan ja käyttämään sitä tehokkaasti omassa datatieteellisessä työssäsi.

Mikä on Pandas?

Pandas on Pythonin avoimen lähdekoodin kirjasto, joka on suunniteltu helpottamaan datan manipulointia ja analysointia. Pandas tarjoaa kaksi tärkeintä tietorakennetta: Series ja DataFrame. Series on yksinkertainen, yhdestä ulottuvuudesta koostuva taulukko, kun taas DataFrame on taulukkomuotoinen tietorakenne, joka koostuu riveistä ja sarakkeista, aivan kuten taulukkolaskentaohjelmissa (esim. Excel).

Asennus ja aloitus

Ennen kuin pääsemme itse esimerkkeihin, varmista, että sinulla on pandas asennettuna. Voit asentaa sen helposti pip-komennolla:

pip install pandas

Kun pandas on asennettu, voit aloittaa sen käytön Pythonissa seuraavalla tavalla:

import pandas as pd

Pandas DataFrame - Esimerkki 1

Yksi pandas-kirjaston tärkeimmistä ominaisuuksista on DataFrame, joka on taulukkomuotoinen tietorakenne. Tässä on yksinkertainen esimerkki siitä, kuinka luoda DataFrame pandasilla:

import pandas as pd

# Luodaan DataFrame sanakirjasta
data = {
    'Nimi': ['Matti', 'Maija', 'Pekka'],
    'Ikä': [29, 34, 42],
    'Kaupunki': ['Helsinki', 'Tampere', 'Oulu']
}

df = pd.DataFrame(data)

# Näytetään DataFrame
print(df)

Yllä olevassa esimerkissä olemme luoneet DataFramen, joka sisältää kolme saraketta: 'Nimi', 'Ikä' ja 'Kaupunki'. Pandas automaattisesti nimeää rivit indekseillä 0, 1 ja 2.

Perustoimintoja Pandasilla

Kun olet luonut DataFramen, voit suorittaa monia perustoimintoja, kuten tietojen suodattamisen, ryhmittelyn ja lajittelun. Tässä muutamia esimerkkejä:

Suodattaminen

Voit suodattaa DataFramen rivejä tiettyjen ehtojen mukaan. Esimerkiksi, jos haluat suodattaa kaikki ihmiset, jotka ovat yli 30-vuotiaita:

# Suodatetaan ikä yli 30
suodatettu_df = df[df['Ikä'] > 30]
print(suodatettu_df)

Rivien lajittelu

Voit myös lajitella DataFrame-rivit jollain tietyllä sarakkeella. Esimerkiksi, jos haluat lajitella henkilöt iän mukaan nousevaan järjestykseen:

# Lajitellaan DataFrame iän mukaan
lajiteltu_df = df.sort_values('Ikä')
print(lajiteltu_df)

Ryhmien luominen

Jos sinulla on suuria tietomassoja, voit ryhmitellä ne pandasilla tietyn sarakkeen arvon mukaan. Esimerkiksi, jos haluat ryhmitellä henkilöt kaupungin mukaan ja laskea kunkin kaupungin keski-ikä:

# Ryhmitellään kaupungin mukaan ja lasketaan keski-ikä
ryhmittely = df.groupby('Kaupunki')['Ikä'].mean()
print(ryhmittely)

Puuttuvat tiedot

Yksi pandas-kirjaston hyveistä on sen kyky käsitellä puuttuvia tietoja. Jos DataFramessa on puuttuvia arvoja (esimerkiksi NaN-arvoja), voit helposti käsitellä niitä. Esimerkiksi, jos haluat täyttää kaikki puuttuvat arvot tietyllä arvolla:

# Täytetään puuttuvat tiedot arvolla 0
df.fillna(0, inplace=True)
print(df)

CSV-tiedostojen lukeminen ja kirjoittaminen

Pandas tekee myös tiedostojen lukemisen ja kirjoittamisen erittäin helpoksi. Voit lukea ja kirjoittaa CSV-tiedostoja seuraavasti:

# CSV-tiedoston lukeminen
data = pd.read_csv('tiedosto.csv')

# CSV-tiedoston kirjoittaminen
df.to_csv('tulos.csv', index=False)

Pandas DataFrame - Esimerkki 2: Reaaliaikainen analyysi

Katsotaanpa, kuinka voimme käyttää pandas-kirjastoa reaaliaikaisen datan analysointiin. Oletetaan, että meillä on CSV-tiedosto, joka sisältää myyntitietoja. Voimme lukea tiedot ja suorittaa analyysin nopeasti:

# Ladataan myyntidata CSV-tiedostosta
sales_data = pd.read_csv('sales_data.csv')

# Lasketaan keskimääräinen myynti
keskiarvo = sales_data['Myynti'].mean()
print(f'Keskimyynti: {keskiarvo}')

Tässä esimerkissä olemme lukeneet CSV-tiedoston, joka sisältää myyntilukuja, ja laskeneet keskimääräisen myynnin. Pandas tekee tällaisen analyysin todella helpoksi ja nopeaksi.

Data Visualisointi Pandasin kanssa

Pandas voi myös yhdistyä muihin kirjastoihin, kuten Matplotlib ja Seaborn, luodaksesi visuaalisia esityksiä datasta. Tässä on esimerkki siitä, kuinka luoda yksinkertainen pylväskaavio myyntidatasta:

import matplotlib.pyplot as plt

# Luodaan pylväskaavio myyntidatasta
sales_data['Myynti'].plot(kind='bar')
plt.title('Myyntitiedot')
plt.xlabel('Päivämäärä')
plt.ylabel('Myynti')
plt.show()

Pandas yhdistettynä Matplotlibiin tekee datan visualisoinnista erittäin yksinkertaista ja intuitiivista. Voit luoda kaavioita, joissa esitetään trendit, jakautumat ja muut analyysit visuaalisessa muodossa.

Yhteenveto

Pandas on todella voimakas työkalu datan analysointiin Pythonissa. Sen avulla voit helposti käsitellä ja analysoida suuria tietomassoja, suorittaa tilastollisia analyysejä, visualisoida dataa ja paljon muuta. Tämä pandas-opas on antanut sinulle hyvän käsityksen siitä, kuinka aloittaa pandas-kirjaston käyttö ja kuinka hyödyntää sen monia toimintoja. Muista, että pandas ei ole vain tehokas työkalu, vaan myös erittäin joustava ja käyttäjäystävällinen, joten voit soveltaa sitä monenlaisiin datan käsittelytarpeisiin!

Komentarze (0) - Nikt jeszcze nie komentował - bądź pierwszy!

Imię:
Treść: