問1
5 個のデータ の平均値と分散を求めなさい。
答えを見る答えを閉じる
平均値 、分散 (偏差 の 2 乗の平均 )
目次 / データの分析と統計 / 数学I
—— すべての値を使って「散らばり」を測る ——
第2章の四分位範囲は、データの真ん中の半分だけを見て散らばりを測る方法でした。この章では、すべての値が平均値からどれだけ離れているかをもとにした散らばりの指標「分散」と「標準偏差」を学びます。分散の 2 通りの求め方、度数分布表からの求め方、変量を変換したときの変わり方を身につけ、最後に、ものさしの違うデータどうしを比べる「標準化」と「偏差値」まで進みます。
第2章では、散らばりの指標として範囲と四分位範囲を学びました。範囲は両端の 2 つの値しか見ず、四分位範囲は真ん中のおよそ半分しか見ません。どちらも手軽ですが、データの値を全部使っているわけではありません。そこでこの章では、すべての値を使って散らばりを表す方法を考えます。
手がかりは、第1章で学んだ平均値です。一つ一つの値が平均値からどれだけ離れているかを調べ、その離れ具合を平均すれば、データ全体の散らばりが 1 つの数で表せそうです。
変量 のデータ の平均値を とする。各値と平均値との差 を、その値の偏差という。
偏差の 2 乗の平均値を分散といい、 で表す。
分散が大きいほど、データは平均値のまわりに広く散らばっている。
偏差は、平均値より大きい値ではプラス、小さい値ではマイナスになります。ここで困るのは、偏差をそのまま足すと、どんなデータでも合計が必ず になってしまうことです(第1章の厳密定義ページ 定理1)。プラスとマイナスが打ち消し合うので、偏差の平均は散らばりの指標になりません。
そこで、偏差を 2 乗して符号を消してから平均します。 も も になるので、平均値から離れている値ほど、向きに関係なく大きく数えられます。
振り子時計の振り子を思い浮かべてください。振り子は右へ左へと揺れていますが、揺れの位置を平均すると真ん中になり、大きく揺れていても小さく揺れていても区別がつきません。揺れの大きさを知るには、「右か左か」という向きを消して、真ん中からの離れ具合だけを見る必要があります。偏差を 2 乗するのは、この「向きを消す」ための操作です。
分散は、偏差を 2 乗して符号を消してから平均したもので、データが平均値のまわりにどれくらい散らばっているかを、すべての値を使って表すということです。
A さんと B さんが、5 日間、毎日フリースローを 10 本ずつ投げました。成功した本数は次のとおりです。
| 1 日目 | 2 日目 | 3 日目 | 4 日目 | 5 日目 | |
|---|---|---|---|---|---|
| A | 4 | 6 | 5 | 7 | 3 |
| B | 1 | 9 | 5 | 8 | 2 |
(1) A、B それぞれの成功数の平均値と、各日の偏差を求めなさい。
(2) A、B それぞれの成功数の分散を求めなさい。
【解答】
(1) 平均値は、A が 、B も で、どちらも 本です。各日の値から を引いて、偏差は次のようになります。
| 1 日目 | 2 日目 | 3 日目 | 4 日目 | 5 日目 | |
|---|---|---|---|---|---|
| A の偏差 | −1 | 1 | 0 | 2 | −2 |
| B の偏差 | −4 | 4 | 0 | 3 | −3 |
どちらも、偏差の合計は になっています。
(2) 偏差を 2 乗して平均します。
平均値は同じでも、B の分散は A の 倍です。B は、調子のよい日と悪い日の差が大きいことが分かります(下の図)。
分散には、困った点が 1 つあります。偏差を 2 乗したので、単位まで 2 乗されてしまうのです。例題1の分散は「(本)」で、「本の 2 乗」と言われても、どれくらいの散らばりなのか実感がわきません。そこで、2 乗したものを平方根で元に戻します。
分散の正の平方根を標準偏差といい、 で表す。
根号の中の は、公式1の式で求めた分散である。
標準偏差の単位は、もとのデータの単位と同じになる。
偏差の 2 乗は、偏差を一辺とする正方形の面積と見ることができます。分散はそれらの面積の平均で、標準偏差は「その平均の面積をもつ正方形の一辺」です(下の図)。面積から長さに戻すことで、データと同じ単位で散らばりを語れるようになります。
部屋探しのとき、「広さ 」と書かれていても、どれくらいの部屋か想像しにくいものです。「一辺 m の正方形くらい」と言いかえると、ぐっとイメージがわきます。標準偏差は、分散という「面積」を、データと同じ単位の「長さ」に言いかえたものです。
標準偏差は分散の正の平方根で、散らばりの大きさを、もとのデータと同じ単位で表したものだということです。
5 人の握力(kg)を測ると、 でした。
(1) このデータの平均値と分散を求めなさい。
(2) このデータの標準偏差を求めなさい。
【解答】
(1) 平均値は kg です。偏差は順に なので
(2) kg です。
平均値 kg から標準偏差 kg ずつ離れた「 kg から kg まで」に、5 人のうち 3 人が入っています。標準偏差は、「平均値からだいたいどれくらい離れた値が多いか」の目安になります。
平均値が小数になると、偏差がすべて小数になり、2 乗の計算が面倒になります。そんなときに便利な式があります。
データの各値を 2 乗した の平均値を と書くと
すなわち、(分散)=(2 乗の平均値)−(平均値の 2 乗)である。
理由は、偏差の 2 乗を展開すると分かります。
これを について足して で割ると、第 1 項は 、第 2 項は 、第 3 項は になります。
(2 乗してから平均)と (平均してから 2 乗)は、順番が違うだけで別の値です。取りちがえないように注意しましょう。分散は 以上なので、いつでも が成り立ちます。
買い物で、1 品ずつ値引きシールを貼ってからレジに通すのと、全部の合計を出してから会計の最後にまとめて値引きするのとでは、結果は同じでも手間がまるで違います。公式1は、すべての値から平均値を引く「1 品ずつの値引き」です。公式3は、2 乗の平均を先に出しておき、最後に平均値の 2 乗を 1 回だけ引く「まとめて値引き」にあたります。
分散は、2 乗の平均値から平均値の 2 乗を引いても求められ、平均値が小数のときは、この求め方のほうが計算が楽になるということです。
あるゲームを 4 回遊んで、手に入れたコインの枚数は でした。
(1) 公式1を使って、このデータの分散を求めなさい。
(2) 公式3を使って、このデータの分散を求めなさい。
【解答】
平均値は 枚です。
(1) 偏差は なので
(2) 2 乗の平均値は
なので、 です。
どちらの方法でも同じ値になります。(2) では小数の計算が最後の 1 回だけで済んでいます。
度数分布表で、階級値を 、度数を 、度数の合計を とすると
公式3と同じ考え方で、次の式でも求められる。
同じ値が 個あるなら、その偏差の 2 乗を 回足すかわりに、 倍すればよいということです。第1章で度数分布表から平均値を求めたときと同じように、階級に入った値はすべて階級値に等しいとみなします。そのため、もとのデータから求めた分散とは少しずれることがあります。値そのものと度数が並んだ表なら、ずれはありません。
大きな劇場で、観客が舞台の中心からどれくらい離れて座っているかを調べるとします。一人一人の座席を測るのは大変なので、客席をブロックに分け、同じブロックの人はブロックの中央の席に座っているとみなします。あとは「中央の席までの距離の 2 乗 × そのブロックの人数」を足し合わせれば済みます。ブロックが階級、中央の席が階級値にあたります。
度数分布表では、階級値の偏差の 2 乗に度数をかけて足し、度数の合計で割れば分散が求められるということです。
次の度数分布表は、10 人の 1 か月のボランティア活動の時間をまとめたものです。
| 時間(時間) | 度数(人) |
|---|---|
| 0 以上 10 未満 | 1 |
| 10 以上 20 未満 | 1 |
| 20 以上 30 未満 | 6 |
| 30 以上 40 未満 | 1 |
| 40 以上 50 未満 | 1 |
| 計 | 10 |
このデータの平均値、分散、標準偏差を求めなさい。
【解答】
階級値は です。(階級値)×(度数)の合計は
なので、平均値は
偏差の 2 乗に度数をかけて表にまとめます。
| 階級値 | 度数 | 偏差 | (偏差) × 度数 |
|---|---|---|---|
| 5 | 1 | −20 | 400 |
| 15 | 1 | −10 | 100 |
| 25 | 6 | 0 | 0 |
| 35 | 1 | 10 | 100 |
| 45 | 1 | 20 | 400 |
| 計 | 10 | 1000 |
第1章では、変量 を と変換すると、平均値も と変わることを学びました。第2章では、範囲や四分位範囲が 倍になることを見ました。分散と標準偏差はどうなるでしょうか。
, を定数とし、変量 を と変換すると
が成り立つ。ただし , はそれぞれ , の標準偏差である。とくに、 と正の数 を決めて とおくと、, となる。
の偏差を計算すると、 が消えます。
偏差が 倍になるので、その 2 乗は 倍になり、分散も 倍です。標準偏差は平方根をとって 倍になります。 はデータ全体を平行移動するだけなので、散らばりには関係しません。
写真を 2 倍に拡大コピーすると、写っているものの長さは 2 倍になりますが、面積は 倍になります。標準偏差は「長さ」、分散は「面積」の仲間なので、 倍の変換で標準偏差は 倍、分散は 倍になります。写真を机の上で横にずらしても大きさが変わらないのが、 を足しても散らばりが変わらないことにあたります。
の変換で、分散は 倍、標準偏差は 倍になり、足した は散らばりに影響しないということです。
5 個のジャムの瓶の中身の重さ(g)は でした。
(1) とおいて、このデータの平均値、分散、標準偏差を求めなさい。
(2) どの瓶も、空の瓶の重さは g です。瓶ごと量った全体の重さのデータについて、平均値、分散、標準偏差を求めなさい。
【解答】
(1) の値は です。 で、分散は
なので
はおよそ です。
(2) 全体の重さは です。平均値は g、分散と標準偏差は に影響されないので、 と g のままです。
数学のテストで 80 点、英語のテストで 75 点をとったとします。どちらのほうが「よくできた」といえるでしょうか。テストが違えば、平均点も散らばりも違うので、点数をそのまま比べることはできません。そこで、平均値と標準偏差を使って、ものさしをそろえます。
平均値 、標準偏差 のデータの各値 に対して
とおくことを、変量 の標準化という。 のデータの平均値は 、標準偏差は になる。さらに
を偏差値という。偏差値のデータの平均値は 、標準偏差は になる。
は、「その値が平均値より標準偏差何個分だけ上にあるか」を表しています。 なら標準偏差 2 個分上、 なら 1 個分下です。平均値と標準偏差がそれぞれ と になることは、公式5で確かめられます。 なので、平均値は 、標準偏差は です。偏差値は、この を 10 倍して 50 を足し、平均 ・標準偏差 の見なれた数にしたものです。
日本円で 1000 円の品物と、アメリカで 8 ドルの品物、どちらが高いかは、同じ通貨に両替してみないと分かりません。標準化は、どのデータの値も「標準偏差 1 つ分」という共通の通貨に両替する作業です。両替したあとなら、違うテストの点数どうしでも比べられます。
標準化は、値と平均値との差を標準偏差で割り、「平均値から標準偏差何個分離れているか」に直す操作で、ものさしの違うデータどうしを比べられるようにするということです。
ある生徒が、数学のテストで 80 点、英語のテストで 75 点をとりました。数学のテストの平均値は 60 点、標準偏差は 10 点、英語のテストの平均値は 55 点、標準偏差は 8 点でした。
(1) 数学と英語の得点を、それぞれ標準化した値を求めなさい。
(2) 数学と英語の偏差値をそれぞれ求め、どちらの教科の得点のほうが、受けた人全体の中で相対的に高いといえるか求めなさい。
【解答】
(1) 数学は 、英語は です。
(2) 偏差値は、数学が 、英語が です。点数は数学のほうが高くても、平均値からの離れ方を標準偏差で測ると、 のほうが相対的に高い位置にあります。
まずは公式をそのまま使う、ごく簡単な問題で確認しましょう。
問1
5 個のデータ の平均値と分散を求めなさい。
平均値 、分散 (偏差 の 2 乗の平均 )
問2
分散が であるデータの標準偏差を求めなさい。
問3
あるデータの値の 2 乗の平均値が 、平均値が である。このデータの分散を求めなさい。
問4
変量 のデータの標準偏差が である。変量 を で定めるとき、 のデータの標準偏差と分散を求めなさい。
標準偏差 、分散
問5
平均値が 60 点、標準偏差が 12 点のテストで、54 点をとった人の偏差値を求めなさい。
難易度マークは ★=基礎、★★=標準、★★★=入試レベルです。★から順に取り組みましょう。
問1 ★
あるサッカー選手が 5 試合で打ったシュートの本数は次のとおりでした。
このデータの平均値、分散、標準偏差を求めなさい。
平均値 本、分散 、標準偏差 本
平均値は 本です。偏差は順に なので
標準偏差は 本です。
問2 ★
A さんと B さんが、英単語テスト(20 点満点)を 5 回ずつ受けました。得点は次のとおりです。
A、B それぞれの得点の平均値と標準偏差を求めなさい。
A:平均値 点、標準偏差 点 B:平均値 点、標準偏差 点
平均値は、A が 、B も で、どちらも 点です。
A 偏差は なので、分散は 、標準偏差は 点です。
B 偏差は なので、分散は 、標準偏差は 点です。
平均値は同じでも、B の得点は A の 2 倍の散らばりがあります。
問3 ★
4 日間に釣れた魚の数は でした。このデータの分散を求めなさい。
平均値は で小数なので、公式3(2 乗の平均値 − 平均値の 2 乗)を使います。
問4 ★
次の表は、10 人の家族の人数を調べた結果です。
| 家族の人数(人) | 2 | 3 | 4 | 5 | 6 | 計 |
|---|---|---|---|---|---|---|
| 度数(人) | 1 | 2 | 4 | 2 | 1 | 10 |
このデータの平均値と分散を求めなさい。
平均値 人、分散
(値)×(度数)の合計は
なので、平均値は
偏差は なので、偏差の 2 乗に度数をかけて足すと
これを で割って
問5 ★
変量 のデータの平均値が 、分散が である。変量 を で定めるとき、 のデータの平均値、分散、標準偏差を求めなさい。
平均値 、分散 、標準偏差
平均値は です。
分散は 倍になるので 、標準偏差は です( の標準偏差 の 倍になっています)。 は散らばりに影響しません。
問6 ★
5 袋の小麦粉の重さ(g)は次のとおりでした。
とおいて、このデータの平均値と分散を求めなさい。
平均値 g、分散
の値は です。 なので、 g です。
で、足した は分散に影響しないので、 です。
問7 ★
ある生徒の体力テストの記録は、立ち幅とびが 220 cm、上体起こしが 31 回でした。学年全体では、立ち幅とびの平均値が 190 cm、標準偏差が 15 cm、上体起こしの平均値が 25 回、標準偏差が 4 回でした。この生徒の 2 種目の偏差値をそれぞれ求め、学年全体の中で相対的に高い位置にあるのはどちらの種目か求めなさい。
立ち幅とび 、上体起こし 。相対的に高いのは立ち幅とび
標準化すると
偏差値は、立ち幅とびが 、上体起こしが です。相対的に高い位置にあるのは です。
単位が cm と回で違っても、標準化すれば比べられます。
問8 ★
大きさ のデータについて、値の総和が 、値の 2 乗の総和が である。このデータの平均値、分散、標準偏差を求めなさい。
平均値 、分散 、標準偏差
平均値は 、2 乗の平均値は です。
問9 ★★
次の度数分布表は、10 人が 1 か月に自転車で走った距離をまとめたものです。
| 距離(km) | 度数(人) |
|---|---|
| 0 以上 10 未満 | 2 |
| 10 以上 20 未満 | 3 |
| 20 以上 30 未満 | 3 |
| 30 以上 40 未満 | 1 |
| 40 以上 50 未満 | 1 |
| 計 | 10 |
このデータの平均値、分散、標準偏差を、階級値を用いて求めなさい。
平均値 km、分散 、標準偏差 km
階級値は です。(階級値)×(度数)の合計は
なので
平均値が階級値の途中の値なので、公式4の 2 つ目の式(2 乗の平均値 − 平均値の 2 乗)を使います。(階級値の 2 乗)×(度数)の合計は
なので、2 乗の平均値は
問10 ★★
5 個のデータ の平均値が 、分散が である。 のとき、, の値を求めなさい。
,
平均値が なので、 より です。
偏差は です。偏差の和は なので、 とおくと です。分散が なので
で、 より です。よって です。
問11 ★★
A 班 6 人と B 班 4 人の数学の小テストの得点について、A 班の平均値は 5 点、分散は 4、B 班の平均値は 10 点、分散は 9 であった。2 つの班を合わせた 10 人の得点の平均値と分散を求めなさい。
平均値 点、分散
分散は平均値のまわりの散らばりなので、2 つの班の分散をそのまま平均しても全体の分散にはなりません。値の総和と 2 乗の総和に戻して考えます。
より、2 乗の平均値は A 班が 、B 班が です。
| 人数 | 値の総和 | 2 乗の総和 | |
|---|---|---|---|
| A 班 | 6 | 30 | 174 |
| B 班 | 4 | 40 | 436 |
| 全体 | 10 | 70 | 610 |
全体の平均値は 点、2 乗の平均値は なので
2 つの班の分散( と )のどちらよりも大きくなりました。班の平均値どうしが離れているぶん、合わせると散らばりが大きくなるのです。
問12 ★★
大きさ のデータの平均値が 、分散が である。このデータに 2 つの値 , を加えた大きさ のデータの平均値と分散を求めなさい。
平均値 、分散
もとのデータの総和は で、加えた後の総和は なので、平均値は のままです。
平均値が変わらないので、もとの 8 個の偏差もそのままです。もとの偏差の 2 乗の和は で、加えた , の偏差は , なので
問13 ★★
大きさ のデータについて、平均値 、分散 と計算した。ところが、値の 1 つを とすべきところを と記録していたことが分かった。正しいデータの平均値と分散を求めなさい。
平均値 、分散
誤ったデータの総和は 、2 乗の総和は より です。
を に直すと
正しい平均値は 、分散は です。
離れた値 が 1 つあっただけで、分散は から へと 4 倍以上にふくらんでいました。
問14 ★★
変量 のデータの平均値が 、標準偏差が である。変量 を で定める。
(1) のデータの平均値と標準偏差 (2) である値について、 を標準化した値と、それに対応する の値を標準化した値
上の (1)、(2) をそれぞれ求めなさい。
(1) 平均値 、標準偏差 (2) を標準化した値 、 を標準化した値
(1) 、 です。 が負でも、標準偏差は 倍なので正の値になります。
(2) を標準化すると です。対応する の値は で、標準化すると
負の数をかける変換では大小が逆転するので、 で平均より標準偏差 1 個分上にあった値は、 では平均より 1 個分下に移ります。
問15 ★★
次の表は、10 人が 4 問のクイズに答えたときの正解数をまとめたものです。
| 正解数(問) | 0 | 1 | 2 | 3 | 4 | 計 |
|---|---|---|---|---|---|---|
| 度数(人) | 1 | 4 | 2 | 10 |
正解数の平均値は 問でした。, の値と、このデータの分散を求めなさい。
,、分散
度数の合計から 、すなわち です。平均値が なので、(値)×(度数)の合計は です。
より です。
2 式から です。
平均値が小数なので、2 乗の平均値から求めます。(値の 2 乗)×(度数)の合計は
なので
問16 ★★
を実数とする。4 個のデータ の分散が最小になる の値と、そのときの分散を求めなさい。
、分散
総和は 、2 乗の総和は なので、分散を の式で表すと
平方完成すると なので
これは のとき最小で、最小値は です。答えは 、分散 です。
は、残りの 3 個 の平均値です。加える値が、残りのデータの真ん中(平均値)にあるとき、散らばりがいちばん小さくなります。
問17 ★★★
男子 6 人と女子 4 人のクラブで、1 週間の練習日数を調べた。男子 6 人の平均値は 7 日、分散は 3 であり、10 人全体の平均値は 6 日、分散は 4.5 であった。女子 4 人の練習日数の平均値と分散を求めなさい。
平均値 日、分散
総和と 2 乗の総和で考えます。 を使います。
男子 総和 、2 乗の総和
全体 総和 、2 乗の総和
女子 4 人の総和は 、2 乗の総和は です。
問18 ★★★
5 個の整数からなるデータがあり、平均値は 、分散は である。このデータの 5 個の値を小さい順に求めなさい。
各値の偏差を とすると、どれも整数で
です。2 乗の和が なので、どの も 以下です。
のものがあるとき 残り 4 個の 2 乗の和は なので、残りは が 1 個と が 3 個です。偏差の和は となり になりません。よって です。
のとき が 個、 が 個あるとすると , です。 では で個数が 5 を超えるので、, で、残りの 1 個は です。
の 2 個が同じ符号だと、和は で、 の 2 個では打ち消せません。よって と が 1 個ずつで、 の 2 個の和も 、つまり と です。
偏差は に限られ、データは です。
問19 ★★★
40 人のテストの得点の平均値は 60 点、標準偏差は 10 点である。得点が 40 点以下または 80 点以上の人は、多くとも何人か求めなさい。
人
分散は なので、40 人の偏差の 2 乗の和は です。
得点が 40 点以下または 80 点以上の人は、偏差の絶対値が 以上なので、偏差の 2 乗は 以上です。そのような人が 人いるとすると、ほかの人の偏差の 2 乗は 以上なので
実際に 人になる例があります。40 点が 5 人、80 点が 5 人、60 点が 30 人なら、平均値は 60 点で、偏差の 2 乗の和は 、分散 、標準偏差 点です。
よって、多くとも 人です。一般に、平均値から標準偏差の 倍以上離れた値は、全体の 以下しかありません(厳密定義 定理3)。この問題は の場合で、 です。
問20 ★★★
大きさ のデータ の平均値を 、分散を とし、 を定数とする。
(1) 次の等式
(2) (1) を利用した、5 個のデータ の平均値と分散
上の (1) を示し、(2) を求めなさい。
(1) 略(解説参照) (2) 平均値 、分散
(1) と分けて 2 乗すると
について足して で割ります。第 1 項の平均は です。第 2 項は と偏差の和の積で、偏差の和は なので になります。第 3 項は によらないので のままです。よって
が成り立ちます。( とおくと公式3 になります。)
(2) とすると、 は です。その平均は なので です。2 乗の平均は なので、(1) より
仮平均 は平均値と同じでなくてもよく、切りのよい値を選べば計算が楽になります。
「標準偏差(standard deviation)」という言葉を作ったのは、イギリスの統計学者カール・ピアソン(1857〜1936)です。1893 年の講演で使い始め、翌 1894 年の論文で活字にしました。それまでも同じような量は天文学などで使われていましたが、「平均誤差」「平均平方誤差」など、人によって呼び名も定義もまちまちでした。ピアソンが名前と記号を決めたことで、世界中の研究者が同じ言葉で散らばりを語れるようになったのです。
ピアソンは、統計学を独立した学問にした立役者でもあります。1901 年に統計学の専門誌『バイオメトリカ』を仲間と創刊し、1911 年にはロンドン大学に、世界で初めてといわれる大学の統計学科を開きました。第4章で学ぶ「相関係数」にも、彼の名前が残っています。
一方、「分散(variance)」という名前は少し遅れて、1918 年にイギリスのロナルド・フィッシャーが論文の中で使ったのが始まりとされています。
豆知識
標準偏差を表す記号として、ピアソンはギリシャ文字の (シグマ)を使いました。 は、和の記号 の小文字です。電卓の統計機能で「」と書かれたボタンがあれば、それは標準偏差を計算するボタンです。
日本で「偏差値」を進路指導に使い始めたのは、東京の公立中学校で理科を教えていた桑田昭三という先生だといわれています。1950 年代の後半、高校受験の合否の予想は、先生の経験と勘に頼るところが大きく、テストの点数だけでは、問題の難しさによって結果が大きくぶれていました。そこで桑田先生は、テストの点数を平均 50・標準偏差 10 に直した値を使えば、難しいテストとやさしいテストの結果を同じものさしで比べられると考えたそうです(※年や経緯には諸説あり)。
この方法は、1960 年代に業者が行う模擬試験に取り入れられて全国に広まり、「偏差値」は受験の世界で欠かせない言葉になりました。
もっとも、 という形そのものは日本の発明ではありません。アメリカの心理学者マッコールが 1920 年代に、学力テストの結果を表すために提案した「T スコア」がもとになっています。
豆知識
得点の分布が左右対称の山の形(第8章で学ぶ正規分布)に近ければ、偏差値 60 以上はおよそ上位 16%、偏差値 70 以上はおよそ上位 2.3% です。ただし、偏差値は分布の形を問わず計算できるので、得点が極端に偏ったテストでは、偏差値が 100 を超えたり、マイナスになったりすることもあります。
工場で作る製品には、決められた寸法の許容範囲(規格)があります。たとえば長さ 50 mm のねじなら、「49.9 mm 以上 50.1 mm 以下なら合格」といった具合です。どんなに精密な機械でも、仕上がりには必ず散らばりが出るので、その標準偏差を小さくして、規格から外れる製品を減らすことが品質管理の要になります。
1980 年代にアメリカの電機メーカー・モトローラが掲げた目標が「シックスシグマ」です。平均値から規格の端までの間に、標準偏差()が 6 つ入るくらいまで散らばりを小さくしよう、というものです。そこまで散らばりを抑えれば、工程の平均が少しずれることを見込んでも、不良品は 100 万個あたり 3.4 個ほどに抑えられるとされています。この考え方は、1990 年代にアメリカの大企業に次々と取り入れられ、今では製造業だけでなく、事務の仕事のミスを減らす活動などにも使われています。
豆知識
投資の世界で「リスクが大きい」というとき、多くの場合、それは「損をしやすい」という意味ではなく、「値動きの標準偏差が大きい」という意味です。大きく値上がりすることも、大きく値下がりすることもある、ぶれの大きさを表す数として、標準偏差が使われているのです。
※ここは発展ページです。高校の範囲では「偏差の 2 乗の平均が分散、その平方根が標準偏差」と、公式3・公式5の使い方が分かれば十分ですが、「分散はどんなときに 0 になるの?」「標準偏差からどんなことが言えるの?」が気になる人のために、少し厳密な見方を紹介します。記号は第1章の厳密定義ページにそろえます。
大きさ のデータ の平均値を とする。
を の分散、その正の平方根 ( のときは )を標準偏差という。また、 と書く。
第1章の定理3で考えた を使うと、分散は です。つまり分散は、「2 乗した距離の合計」をいちばん小さくする点(平均値)で測った、その最小値の平均だといえます。
(1)
(2) であり、 となるのは のときに限る。
証明 (1) を使って展開すると
両辺を で割ればよい。
(2) は 2 乗の和を で割ったものなので 以上である。 ならば、 以上の数 の和が なので、すべての で 、すなわち である。逆に、すべての値が等しければ、偏差はすべて で である。(証明終)
(2) から、 が分かります。「2 乗してから平均」は「平均してから 2 乗」より小さくならず、等しくなるのは全部の値が同じときだけです。 を定数として、(1) をもう少し一般にした も成り立ちます(実践 問20)。第1章の定理3 (1) の証明で出てきた式 を で割ったものです。
, を定数とし、 とする。
(1) ,
(2) のとき、 とおくと、 の平均値は 、分散と標準偏差は である。
証明 (1) 第1章の定理2より なので、 である。よって
両辺は 以上なので、正の平方根をとって である。
(2) は , の変換である。第1章の定理2より 、(1) より で、 である。(証明終)
第2章の定理2では、範囲と四分位範囲も 倍になることを見ました。標準偏差・範囲・四分位範囲はどれも「長さ」の仲間で、変換に対して同じ動きをします。分散だけが「面積」の仲間で、 倍になります。
とし、 を正の数とする。データのうち、 を満たす値の個数を とすると
が成り立つ。すなわち、平均値から標準偏差の 倍以上離れた値は、全体の 以下である。
証明 を満たす値については である。偏差の 2 乗の和から、それ以外の値の分( 以上)を除くと
で両辺を割ると である。(証明終)
とすれば、「平均値から標準偏差の 2 倍以上離れた値は、全体の 以下」、 とすれば「 以下」です。この定理のすごいところは、どんな形の分布にも成り立つことです。第8章で学ぶ正規分布なら、実際には標準偏差の 2 倍以上離れた値はおよそ 5%、3 倍以上はおよそ 0.3% しかありません。チェビシェフの不等式は、分布の形が分からないときの「最悪の場合でもこれ以下」という保証です。 のときは となり、何も言っていないのと同じになります。
最後に、分散の定義のゆれについて触れておきます。表計算ソフトには、分散を求める関数が 2 種類あります。VAR.P 関数は、この章と同じく で割ります。VAR.S 関数は で割ります。関数電卓の「」と「」も同じ区別です。 で割るのは、手元のデータを「もっと大きな集団から一部を取り出したもの」とみなし、もとの集団の分散を見積もりたいときです。なぜ がよいのかは、第9章の推定で扱います。
また、偏差の 2 乗ではなく絶対値の平均 を散らばりの指標にすることもでき、これを平均偏差といいます。直感的には分かりやすいのですが、絶対値は場合分けが必要で式の変形がしにくいため、統計学では 2 乗を使う分散と標準偏差が主役になりました。第1章の定理3で見たように、2 乗の世界の中心は平均値、絶対値の世界の中心は中央値です。
この章の学習が終わったら
学習完了テストを受ける