プログラミングの用語一覧へ
このページの目次
プログラミング中級図解あり

回帰とは?

最終更新:2026/08/18

3秒でわかる

数値そのものを予測する教師あり学習の手法。売上や価格、気温といった連続した量を、過去のデータから見積もるときに使います。

30秒図解

回帰は面積や築年数から家賃のような連続値を予測し、点の集まりに平均二乗誤差が最小の線を引く
回帰は、家賃や売上のような連続値を予測します。学習データへの当てはまりだけでなく、MAEやRMSEなどで未見データの誤差を確かめます。

もう少し詳しく

どういうものか

回帰は、入力となる特徴量から連続した数値を予測する教師あり学習の手法です。予測したい対象が「いくらか」「何度か」「何個か」という量であれば回帰、「どれか」というラベルであれば分類になります。最も基本的な線形回帰は、予測値と実測値の差の二乗の平均(平均二乗誤差)が最小になるよう直線の傾きと切片を決めます。

なぜ必要か

平均や前年比といった単純な集計では、複数の要因が絡む予測に対応できません。家賃を面積だけで見ると駅からの距離が説明できず、距離だけを見ると広さが説明できません。回帰は複数の特徴量それぞれの寄与を係数として同時に推定します。副産物として、どの特徴量が結果をどれだけ動かしているかが係数から読み取れます。

具体例

from sklearn.linear_model import LinearRegression from sklearn.metrics import mean_absolute_error, r2_score model = LinearRegression() model.fit(X_train, y_train) # X は面積や築年数、y は家賃 pred = model.predict(X_test) print(model.coef_) # 各特徴量の係数 print(mean_absolute_error(y_test, pred)) print(r2_score(y_test, pred))

線形回帰で足りない場合は、リッジ回帰やラッソ回帰で係数を抑えたり、勾配ブースティングで非線形な関係を捉えたりします。

つまずきやすいところ

  • 学習データの範囲外を予測させる。築 100 年のデータが無いのに外挿すると、線形式は平気で負の家賃を返す

  • 係数の大きさを重要度と読み違える。単位が揃っていない特徴量の係数は比較できないので、標準化してから見る

  • 相関を因果と取り違える。アイスの売上と水難事故は相関するが、片方を減らしても他方は減らない

  • 評価指標を精度で語ってしまう。回帰では MAE、RMSE、決定係数を使う

  • 外れ値 1 件が二乗誤差を通じて直線を大きく引っ張る
  • 似た用語との違い

    タスク予測するもの
    回帰連続値明日の売上金額
    分類ラベル解約するかしないか
    クラスタリング集団分け似た顧客のグループ


    ロジスティック回帰は名前に回帰と付きますが、確率を経由してラベルを当てる分類の手法です。

    覚え方

    「点の集まりに最もよく沿う線を引く」ことが回帰です。線が引ければ、まだ観測していない位置の値を線から読み取れます。

    次に学ぶ

    scikit-learnとは?

    知識のつながり

    サイドバーと同じ推奨ルート・関連語を、まとめて確認できます。

    現在地回帰プログラミング

    LEARN BY DOING

    この用語を、教材で使ってみる

    直接関連する編と、その編を含むコースです。用語だけで終わらず、ブラウザ上で実際に手を動かせます。

    この用語を扱うコース

    コース

    データ分析入門 Python(pandas)

    57レッスン
    コース

    Python中級 内包表記・高階関数・クラス入門

    58レッスン
    コース

    生成AI資格対策(生成AIパスポート+G検定)

    49レッスン
    データ分析コースの全編を見る