解説:機械学習
G検定 機械学習
このページでは、G検定で重要な「機械学習」の基礎を解説します。教師あり学習・教師なし学習・強化学習の違い、代表的なアルゴリズム、モデル評価、過学習、評価指標までを整理します。
機械学習はG検定の中心分野
機械学習は、G検定の中でも特に重要な分野です。AIの基礎で全体像を押さえたら、次に「データから学習する仕組み」を理解しましょう。ここが分かると、ディープラーニングや生成AIの理解にもつながります。
機械学習とは
機械学習とは、人間がすべてのルールを手作業で決めるのではなく、データから規則性や判断基準を学習する技術です。G検定では、機械学習の種類と代表的な手法を区別できることが重要です。
教師あり学習
入力データと正解ラベルを使って学習します。分類や回帰に使われます。
教師なし学習
正解ラベルなしで、データの構造やまとまりを見つけます。クラスタリングや次元削減が代表例です。
強化学習
エージェントが環境の中で行動し、報酬を最大化するように学習します。
教師あり学習
教師あり学習は、入力データと正解ラベルのペアを使って学習し、新しいデータに対して予測を行う手法です。代表的なタスクは、数値を予測する「回帰」と、カテゴリを予測する「分類」です。
線形回帰・単回帰分析
連続値を予測する基本的な手法です。売上予測、価格予測、需要予測などに使われます。
ロジスティック回帰
分類に使われる手法です。スパム判定や病気の有無の予測など、確率として出力する場面で使われます。
決定木
条件分岐を繰り返して分類や予測を行う手法です。判断の流れが見えやすく、解釈しやすい特徴があります。
ランダムフォレスト
複数の決定木を組み合わせて予測精度を高めるアンサンブル学習の一種です。
SVM
データを分ける境界と、境界からデータまでのマージンを考える分類手法です。サポートベクターマシンとも呼ばれます。
勾配ブースティング
弱いモデルを順番に組み合わせ、前のモデルの誤りを補うように精度を高める手法です。
教師なし学習
教師なし学習は、正解ラベルを使わずにデータの構造やパターンを見つける手法です。代表的なタスクは、データをグループに分ける「クラスタリング」と、特徴量を圧縮する「次元削減」です。
k-means法
データをk個のクラスターに分ける代表的なクラスタリング手法です。初期値の影響を受ける点に注意が必要です。
主成分分析(PCA)
高次元データを低次元に圧縮する次元削減手法です。データの可視化や特徴の整理に使われます。
t-SNE
高次元データを2次元や3次元に可視化する手法です。データのまとまりを視覚的に確認する場面で使われます。
LDA
文書の中にある隠れたトピックを推定するトピックモデルです。潜在的ディリクレ配分法とも呼ばれます。
SVD
行列を分解して隠れた構造を見つける手法です。次元削減やレコメンドシステムなどに使われます。
デンドログラム
階層型クラスタリングの結果を樹形図で表したものです。データ同士の近さを視覚的に確認できます。
強化学習
強化学習は、エージェントが環境の中で行動し、得られる報酬を最大化するように学習する手法です。ゲームAI、ロボット制御、推薦システムなどで使われます。
エージェント・環境
エージェントは行動する主体、環境はエージェントが行動する世界です。状態・行動・報酬の関係を理解しましょう。
マルコフ決定過程(MDP)
現在の状態と行動によって次の状態が決まるという考え方です。強化学習の基本的な枠組みです。
Q学習
行動価値であるQ値を学習し、よりよい行動を選べるようにする代表的な強化学習手法です。
SARSA
実際に選んだ行動に基づいて価値を更新する強化学習手法です。Q学習との違いを押さえましょう。
REINFORCE
方策を直接改善していく方策勾配法の代表的な手法です。
Actor-Critic・UCB
Actor-Criticは方策と価値推定を組み合わせる手法です。UCBは探索と活用のバランスを取る考え方です。
モデルの選択・評価
機械学習では、学習データで高い精度が出るだけでは不十分です。未知のデータでも正しく予測できるか、つまり汎化性能を確認する必要があります。
k分割交差検証
データをk個に分け、学習と検証を繰り返す方法です。モデルの汎化性能を確認するために使われます。
RMSE・MAE
回帰モデルの誤差を評価する指標です。RMSEは大きな誤差を重く見る特徴があり、MAEは絶対誤差の平均です。
正解率(Accuracy)
全体のうち正しく予測できた割合です。データの偏りが大きい場合は、正解率だけでは判断しにくいことがあります。
適合率・再現率・F1
適合率は陽性と予測した中で正しかった割合、再現率は実際の陽性をどれだけ見つけたか、F1はそのバランスを示す指標です。
AUC・ROC曲線
分類モデルの性能を、しきい値を変えながら評価する考え方です。AUCは1に近いほど性能が高いとされます。
混同行列
真陽性・真陰性・偽陽性・偽陰性の4つで分類結果を整理する表です。評価指標を理解する土台になります。
過学習
学習データに合わせすぎて、未知のデータで性能が落ちる状態です。交差検証や正則化などで対策します。
オッカムの剃刀
同じような性能なら、より単純なモデルを選ぶべきという考え方です。モデル選択の考え方として押さえましょう。
この分野の出題ポイント
機械学習分野では、用語の意味だけでなく、どの手法がどの学習方式に含まれるか、どの評価指標を使うかが問われやすいです。
機械学習を学んだ後の進め方
機械学習を押さえたら、ディープラーニング・数学・統計へ進みましょう。学んだ内容は練習問題や分野別問題集で確認すると定着しやすくなります。
次のステップへ
機械学習の基礎を押さえたら、ディープラーニングへ進みましょう。あわせて数学・統計や練習問題も確認すると、理解が定着しやすくなります。
