🔄 データ分析の標準的な流れ
1
データ取得 ― SQLでDBからデータを取得。または CSV・Excel・APIから読み込む
2
データ確認 ― 件数・欠損値・データ型・外れ値を確認(EDA: 探索的データ分析)
3
データ前処理 ― 欠損値の補完・型変換・外れ値の除去・特徴量の変換
4
集計・分析 ― グループ別集計・KPI算出・トレンド分析
5
可視化・報告 ― グラフで視覚化してインサイトを伝える
🛠️ データ分析の主要ツール
| ツール | 用途 |
|---|---|
| SQL | DBからのデータ取得・集計 |
| pandas | Pythonでのデータ加工・集計 |
| matplotlib / seaborn | グラフ・可視化 |
| Jupyter Notebook | コードと結果を一緒に書けるインタラクティブ環境 |
# pandasでCSVを読んで集計する例
import pandas as pd
df = pd.read_csv("sales.csv")
# 基本確認
print(df.shape) # 行数・列数
print(df.head()) # 最初の5行
print(df.isnull().sum()) # 欠損値確認
# 集計
monthly = df.groupby("month")["amount"].sum()
print(monthly)
# 可視化
import matplotlib.pyplot as plt
monthly.plot(kind="bar")
plt.title("月別売上")
plt.show()