AIと機械学習|教師あり・教師なし・強化学習と過学習【基本情報技術者試験 科目A】

基本情報技術者試験

科目A 第1章 基礎理論1-9 AIと機械学習最終更新 2026-09-26

1-8 の最後で、機械学習は帰納推論の側にあると書きました。 個別のデータを大量に集めて、そこから一般の規則を作るからです。 帰納である以上、できた規則は「たぶん正しい」止まりです。 だから機械学習では、できた規則がどれくらい当たるのかを測る手続きが、 作り方と同じくらい大事になります。この回は、その作り方と測り方を扱います。

出典:基本情報技術者試験 シラバス Ver9.2 大分類1 基礎理論/中分類1 基礎理論/3. 情報に関する理論

(8)AI に関する技術 ① AI の基本的な考え方

AI のあらましを理解する。

② 機械学習

機械学習の基本的な仕組み,代表的な手法を理解する。

③ ディープラーニング(深層学習)

ディープラーニングの基本的な仕組みを理解する。

AI ── 規則を人が書くか、データから作るか

コンピュータに賢い判断をさせる方法は、大きく2つあります。 人が規則を書き下すか、データから規則を作らせるかです。

人が規則を書き下すやり方

エキスパートシステム … 専門家の判断を「もし〜なら〜」の形で集めた仕組み

知識ベース … その規則をためておく場所。規則は人が書いて人が直すので、対象が変わるたびに書き直しがいる

推論エンジン … 知識ベースの規則を順に当てはめて、結論を出す部分

このやり方は、規則が書ける分野では確実に動きます。 1-8 の言葉でいえば演繹推論です。前提として書いた規則が正しければ、結論も正しくなります。 弱点は、規則を書ききれない分野があることです。 「この写真は猫か」を「もし〜なら」で書き下すのは、人間にはほぼ不可能です。

そこで、大量のデータから規則のほうを作らせるのが機械学習です。 ねらいは、学習に使っていないデータでも当たる規則を作ることにあります。

機械学習の3つの学び方

先に、ひとつ予想してみましょう

ネットの記事を10万本読み込ませて、内容の似たものどうしを自動でまとめさせました。 どの記事が何の話題かは、いっさい教えていません。これはどれですか。

学び方は3つに分かれます。ただし、分かれ目は1つではありません。 2つの問いを、この順に聞きます。

2つの問いで、どの学び方かが決まる

問い1 動いた結果に点数が返ってくるか → 返ってくるなら 強化学習。点数が高くなる行動を探す

問い2(点数が返らないとき) 1件ずつに正解が付いているか

  付いている → 教師あり学習。正解つきの例をまねて、新しい入力の答えを出す

  付いていない → 教師なし学習。データの中にある構造そのものを見つける

正解が付いていないのは教師なし学習と強化学習の両方なので、先に点数のほうを聞きます。 強化学習の例は、ゲームの手を選ぶ仕組みです。1手ずつの正解は誰も知りませんが、 勝てば加点、負ければ減点という結果の点数が返ってきます。この点数が高くなる指し方を探します。 なお、一部にだけ正解が付いた中間の形(半教師あり学習)もありますが、問われるのは上の3つです。

教師あり学習は、最後に返したいものでさらに2つに分かれます。 返したいのが「いくら」「何度」のような数値そのものなら回帰、 「迷惑メールか、そうでないか」のような決まった区分のどれかなら分類です。

練習

過去に売れた中古車の走行距離・年式・車種と、その販売価格を学習させ、 これから売る1台の販売価格を予測させます。これはどれですか。

名前が出てくる代表的な手法(札はどの学び方か)

線形回帰 … 教師あり(回帰)。項目が1つなら1本の直線を当てはめる。項目が増えても、各項目に重みを掛けて足す同じ考え方

ロジスティック回帰 … 教師あり(分類)。名前は回帰だが、返すのは「どちらか」の区分

決定木 … 教師あり(分類にも回帰にも使える)。「もし〜なら」の枝分かれを、データから自動で作る

ランダムフォレスト … 教師あり。使うデータと項目をランダムに選んで少しずつ違う決定木を多数作り、結果をまとめて決める(分類なら多数決)

サポートベクトルマシン(SVM) … 教師あり(分類)。2つの区分の境目を、いちばん余裕をとる位置に引く

クラスタリング … 教師なし。似たものどうしを、いくつかのグループにまとめる

主成分分析 … 教師なし。項目どうしの重なりをまとめて少ない項目に置き換える。この置き換えを次元削減という

データを3つに分ける ── 過学習を見つけるため

学習に使ったデータで測れば、正解率はいくらでも上がります。 極端にいえば、データを丸暗記すれば100%です。 けれども丸暗記したモデルは、初めて見るデータでは当たりません。 これが過学習です。逆に、学習データにすら合っていない状態もあり、これは学習不足です。 見分けるには、2つの数字を並べます。

同じモデルを、2つのデータで測ってみる

  学習に使ったデータでの正解率は 98%
  学習に使っていないデータでの正解率は 61%
  → この差が大きいほど、学習データを丸暗記している

知りたいのは下の数字です。上の数字だけを見て「98% の精度が出た」と言っても、本番では役に立ちません。

そこで、手持ちのデータを役割ごとに分けて使います。

データの3つの役割

学習(訓練)データ … モデルを作るために使う

検証データ … どのモデルを選ぶか、どこまで複雑にするかを決めるために使う

テストデータ … 最後に一度だけ、本番での実力を測るために使う

検証データの数字を見てモデルを選んだ時点で、そのデータはもう「初めて見るデータ」ではありません。 だから、いっさい手を付けていないテストデータを別に取っておきます。 学習に使っていないデータでどれだけ当たるかを汎化性能といい、 機械学習が上げたいのは、この数字です。

分け方の2つのやり方

ホールドアウト検証 … データを学習用と検証用に1回だけ分ける。手軽だが、分け方の当たり外れが結果に出る

交差検証 … 10等分したら、1つを検証に回して9つで学習、を10回くり返して平均をとる。全部のデータが一度は検証側に回る

なお、分類の当たり具合を1枚の図で見る道具が ROC 曲線です。 縦軸に見つけるべきものを見つけられた割合、横軸に誤って拾ってしまった割合をとり、 その兼ね合いを1本の線で表します。

練習

同じデータから3つのモデルを作り、正解率を測りました。
モデルA 学習 98% 検証 61%
モデルB 学習 85% 検証 83%
モデルC 学習 62% 検証 60%
本番で使うなら、どれですか。

ディープラーニング ── 層を重ねて特徴をつかむ

ここからは学び方の種類ではなく、モデルそのものの作りの話です。 これから出てくるものは4つ目の学び方ではなく、教師ありでも教師なしでも強化学習でも使えます。

人の神経細胞のつながりをまねた仕組みがニューラルネットワークです。 入力層から中間層をいくつか通って出力層へ、という流れで値が伝わります。 つなぎ目には重みという数があり、学習とは、この重みを少しずつ直していく作業です。 中間層を何層も重ねたものを多層パーセプトロンといい、 層を深く重ねた学習がディープラーニング(深層学習)です。

誤差逆伝播(バックプロパゲーション)── 重みが直っていく流れ

1. 入力を流して、出力を出す

2. 正解とのずれ(誤差)を求める

3. そのずれを出力側から入力側へ逆向きに配り、各つなぎ目の重みを直す。この配り方が誤差逆伝播

途中の各層では、受け取った値をそのまま流さず活性化関数を通します。 これがないと、何層重ねても1層ぶんと同じ計算にしかならず、層を深くした意味がなくなります。

層を深くすると、誤差を逆向きに配るうちに、入力側へ届くころには値がほとんど 0 になってしまいます。 これが勾配消失問題で、深い層がなかなか学習できなかった原因です。

練習

勾配消失問題が起きています。抜け出すために変えるとよいのはどれですか。

土台をどこから持ってくるか(これも学び方の3分類とは別の軸)

転移学習 … 別の課題で学習ずみのモデルを土台にする。土台の重みは固定したまま、付け足した部分だけを学習する

ファインチューニング … 土台の重みも手元のデータで少し直しながら仕上げる。転移学習の中の一つのやり方

予想問題の選択肢にあった転移学習は、これです。 「どうやって学ぶか」ではなく「どこから始めるか」の話なので、教師あり・教師なし・強化学習とは並びません。

まとめ

この回で持ち帰ること

1. 人が規則を書くのがエキスパートシステム(知識ベース+推論エンジン)、データから作るのが機械学習

2. 学び方は2段で判定する。結果に点数が返る=強化学習。返らないなら、正解が付いている=教師あり/付いていない=教師なし

3. 教師ありは、返したいものが数値なら回帰、決まった区分なら分類

4. 過学習は学習データにだけ合う状態。学習に使っていないデータで測って見つける

5. 検証データは選ぶため、テストデータは最後に測るため。分け方がホールドアウト検証と交差検証

6. 誤差を逆向きに配るのが誤差逆伝播。奥まで届かなくなるのが勾配消失問題

次に読む

この記事で引用した資料

いずれも独立行政法人情報処理推進機構(IPA)が公表したものです。IPAは公表済みの試験問題について、教育目的での使用に許諾および使用料を不要としていますが、著作権は放棄していません。本記事では問題文を改変せずに引用しています。

本文の例(記事のグループ分け、ゲームの手、中古車の価格、3つのモデルの正解率)と練習問題は、すべて当サイトが説明のために作ったものです。

Copied title and URL