目次 / データの分析と統計 / 数学B

第8章 正規分布

—— 確率を「面積」で表し、釣り鐘形の曲線 1 本で多くのばらつきを言い表す ——

第6・7章の確率変数は、人数や回数のように「とびとびの値」をとるものでした。この章では、身長や重さのように切れ目なく値が変わる量を確率変数として扱い、確率を曲線の下の**面積**(定積分)で表します。その代表が、左右対称な釣り鐘形の**正規分布**です。標準化と正規分布表を使って確率を求める方法を身につけ、テストの得点や製品の重さのようなデータに当てはめます。最後に、第7章の二項分布が、回数が多いと正規分布でよく近似できることを確かめます。定積分(微分積分の分野 第8章)を使います。

問題マップ記録を読み込み中…
未回答 25× 0○ 01か月定着 0

とびとびの値から、切れ目のない値へ

第6・7章で扱った確率変数は、さいころの目、芽が出た粒の数、表が出た回数のように、0,0, 1,\ 1, 2,\ 2, …\ \ldots ととびとびの値をとるものでした。このような確率変数を離散型といいます。確率分布は表で書け、確率は表の値を足して求めました。

一方、身長・重さ・時間のような量は、165.3165.3 cm、165.31165.31 cm、…と、いくらでも細かい値をとりえます。この章では、こうした切れ目なく変わる値をとる確率変数を扱います。表の値を「足す」代わりに、曲線の下の面積、つまり定積分で確率を表すのが新しい点です(定積分は微分積分の分野 第8章・第9章)。

連続型確率変数と確率密度関数

第1章のヒストグラムを思い出してください。縦軸を「相対度数 ÷ 階級の幅」にしておくと、柱の面積がちょうど相対度数になり、柱の面積の合計は 11 になります。データを増やしながら階級の幅を細かくしていくと、柱の上の端はなめらかな曲線に近づきます。

階級の幅 0.5 0 1 2 0.25 0.5 0.75 階級の幅 0.25 0 1 2 0.25 0.5 0.75 赤い曲線:y = f(x) 柱の高さ=区間の確率 ÷ 幅
公式1:連続型確率変数と確率密度関数

確率変数 XX のとる値が、ある区間のすべての実数で、次の性質をもつ関数 f(x)f(x) があるとき、XX を連続型確率変数、f(x)f(x) を XX の確率密度関数という。

  1. つねに f(x)f(x)≧0{}\geqq 0
  2. XX が aa 以上 bb 以下の値をとる確率は、曲線 yy=f(x){}= f(x) と xx 軸、2 直線 xx=a{}= a,xx=b{}= b で囲まれた部分の面積
P(a≦X≦b)\displaystyle P(a \leqq X \leqq b)=∫abf(x) dx\displaystyle {}= \int_a^b f(x)\,dx
  1. XX のとる値の範囲が α\alpha≦x{}\leqq x≦β{}\leqq \beta のとき、全体の面積は 11
∫αβf(x) dx\displaystyle \int_\alpha^\beta f(x)\,dx=1\displaystyle {}= 1

曲線 yy=f(x){}= f(x) を XX の分布曲線という。

連続型では、ちょうど 11 つの値をとる確率は 00 です。P(X=a)=∫aaf(x) dx=0P(X = a) = \displaystyle\int_a^a f(x)\,dx = 0 だからです。そのため P(a≦X≦b)P(a \leqq X \leqq b) と P(a<X<b)P(a < X < b) は同じ値になり、「以上」と「より大きい」を区別しなくてかまいません。f(a)f(a) の値そのものは確率ではなく、「aa のあたりに値がどれだけ集まっているか」を表す密度です。

人口密度の地図にたとえると分かりやすくなります。地図の上の 1 点を指さして「ここに何人住んでいるか」と聞かれても、点には広さがないので答えは 00 人です。けれども「この区域には何人か」なら、区域の広さに人口密度をかけて足し合わせれば求まります。確率密度関数も同じで、1 点の確率は 00 でも、区間を決めればその上の面積として確率が決まります。密度が高い場所ほど、同じ幅の区間に多くの確率が集まっています。

連続型確率変数では、確率は確率密度関数 f(x)f(x) のグラフの下の面積 ∫abf(x) dx\displaystyle\int_a^b f(x)\,dx で表され、全体の面積は 11、1 点の確率は 00 になるということです。

例題1:確率密度関数と確率

確率変数 XX のとる値の範囲が 00≦X{}\leqq X≦2{}\leqq 2 で、確率密度関数が f(x)f(x)=ax(2−x){}= ax(2 - x)(aa は正の定数)です。定数 aa の値と、確率 P(0≦X≦12)P\left(0 \leqq X \leqq \dfrac{1}{2}\right) を求めなさい。


【解答】

全体の面積が 11 なので

∫02ax(2−x) dx\displaystyle \int_0^2 ax(2 - x)\,dx=a[ x2−x33 ]02\displaystyle {}= a\Big[\,x^2 - \frac{x^3}{3}\,\Big]_0^2=a(4−83)\displaystyle {}= a\left(4 - \frac{8}{3}\right)=43a\displaystyle {}= \frac{4}{3}a=1\displaystyle {}= 1

より a=34‾\underline{a = \dfrac{3}{4}} です。00≦x{}\leqq x≦2{}\leqq 2 で f(x)f(x)≧0{}\geqq 0 も満たしています。

P(0≦X≦12)\displaystyle P\left(0 \leqq X \leqq \frac{1}{2}\right)=34∫012(2x−x2) dx\displaystyle {}= \frac{3}{4}\int_0^{\frac{1}{2}} (2x - x^2)\,dx=34[ x2−x33 ]012\displaystyle {}= \frac{3}{4}\Big[\,x^2 - \frac{x^3}{3}\,\Big]_0^{\frac{1}{2}}=34(14−124)\displaystyle {}= \frac{3}{4}\left(\frac{1}{4} - \frac{1}{24}\right)=34×524\displaystyle {}= \frac{3}{4} \times \frac{5}{24}=532‾\displaystyle {}= \underline{\frac{5}{32}}

連続型確率変数の期待値と分散

離散型の期待値は「値 × 確率」の和 ∑xkpk\sum x_k p_k でした。連続型では、幅 dxdx の小さな区間の確率が f(x) dxf(x)\,dx なので、和を積分に置きかえます。

公式2:連続型確率変数の期待値・分散・標準偏差

値の範囲が α\alpha≦X{}\leqq X≦β{}\leqq \beta、確率密度関数が f(x)f(x) の確率変数 XX について、期待値 mm=E(X){}= E(X) と分散 V(X)V(X) を

E(X)\displaystyle E(X)=∫αβxf(x) dx,\displaystyle {}= \int_\alpha^\beta x f(x)\,dx,V(X)\displaystyle V(X)=∫αβ(x−m)2f(x) dx\displaystyle {}= \int_\alpha^\beta (x - m)^2 f(x)\,dx

で定める。標準偏差は σ(X)\sigma(X)=V(X){}= \sqrt{V(X)} である。離散型と同じく

V(X)\displaystyle V(X)=E(X2)\displaystyle {}= E(X^2)−m2\displaystyle {}- m^2=∫αβx2f(x) dx\displaystyle {}= \int_\alpha^\beta x^2 f(x)\,dx−m2\displaystyle {}- m^2

が成り立ち、aXaX+b{}+ b の期待値・分散(第6章 公式4)もそのまま使える。

V(X)V(X)=E(X2){}= E(X^2)−m2{}- m^2 は、(x−m)2(x - m)^2=x2{}= x^2−2mx{}- 2mx+m2{}+ m^2 を展開して積分すると

∫αβx2f(x) dx\displaystyle \int_\alpha^\beta x^2 f(x)\,dx−2m∫αβxf(x) dx\displaystyle {}- 2m \int_\alpha^\beta x f(x)\,dx+m2∫αβf(x) dx\displaystyle {}+ m^2 \int_\alpha^\beta f(x)\,dx=E(X2)\displaystyle {}= E(X^2)−2m⋅m\displaystyle {}- 2m \cdot m+m2⋅1\displaystyle {}+ m^2 \cdot 1

となることから分かります。離散型のときの式変形の ∑\sum が ∫\int に替わっただけです。

離散型と連続型の関係は、次のように対応させると覚えやすくなります。

離散型連続型
分布の表し方確率分布の表 P(X=xk)=pkP(X = x_k) = p_k確率密度関数 f(x)f(x)
確率pkp_k を足すf(x)f(x) を積分する
合計∑pk=1\sum p_k = 1∫f(x) dx=1\int f(x)\,dx = 1
期待値∑xkpk\sum x_k p_k∫xf(x) dx\int x f(x)\,dx

連続型の期待値・分散は、離散型の ∑(値)×(確率)\sum (\text{値}) \times (\text{確率}) を ∫xf(x) dx\int x f(x)\,dx のように積分に置きかえて求め、VV=E(X2){}= E(X^2)−m2{}- m^2 などの性質はそのまま使えるということです。

例題2:期待値と分散

例題1 の確率変数 XX(確率密度関数 f(x)f(x)=34x(2−x){}= \dfrac{3}{4}x(2 - x),00≦X{}\leqq X≦2{}\leqq 2)の期待値、分散、標準偏差をそれぞれ求めなさい。


【解答】

E(X)\displaystyle E(X)=34∫02(2x2−x3) dx\displaystyle {}= \frac{3}{4}\int_0^2 (2x^2 - x^3)\,dx=34[ 2x33−x44 ]02\displaystyle {}= \frac{3}{4}\Big[\,\frac{2x^3}{3} - \frac{x^4}{4}\,\Big]_0^2=34(163−4)\displaystyle {}= \frac{3}{4}\left(\frac{16}{3} - 4\right)=1‾\displaystyle {}= \underline{1}

分布曲線は直線 xx=1{}= 1 について対称なので、期待値が 11 になるのは納得できます。

E(X2)\displaystyle E(X^2)=34∫02(2x3−x4) dx\displaystyle {}= \frac{3}{4}\int_0^2 (2x^3 - x^4)\,dx=34[ x42−x55 ]02\displaystyle {}= \frac{3}{4}\Big[\,\frac{x^4}{2} - \frac{x^5}{5}\,\Big]_0^2=34(8−325)\displaystyle {}= \frac{3}{4}\left(8 - \frac{32}{5}\right)=65\displaystyle {}= \frac{6}{5}

より

V(X)\displaystyle V(X)=65\displaystyle {}= \frac{6}{5}−12\displaystyle {}- 1^2=15‾,\displaystyle {}= \underline{\frac{1}{5}},σ(X)\displaystyle \sigma(X)=15\displaystyle {}= \sqrt{\frac{1}{5}}=55‾\displaystyle {}= \underline{\frac{\sqrt{5}}{5}}

正規分布

連続型の確率分布の中で最も大切なのが、次の正規分布です。第6章の小話で、さいころの個数を増やすと目の和の分布が釣り鐘形になることを紹介しました。その釣り鐘形を式で表したものです。

公式3:正規分布

mm を実数、σ\sigma を正の数とする。確率密度関数が

f(x)\displaystyle f(x)=12π σ e−(x−m)22σ2\displaystyle {}= \frac{1}{\sqrt{2\pi}\,\sigma}\, e^{-\frac{(x - m)^2}{2\sigma^2}}

である連続型確率変数 XX の分布を、平均 mm、標準偏差 σ\sigma の正規分布といい、N(m, σ2)N(m,\ \sigma^2) で表す。XX はすべての実数値をとりうる。ee は 2.71828⋯2.71828\cdots という無理数である。XX が N(m, σ2)N(m,\ \sigma^2) に従うとき

E(X)\displaystyle E(X)=m,\displaystyle {}= m,σ(X)\displaystyle \sigma(X)=σ\displaystyle {}= \sigma

で、分布曲線は次の性質をもつ。

  1. 直線 xx=m{}= m について対称で、xx=m{}= m のとき最大になる
  2. xx 軸を漸近線とし、mm から離れるほど xx 軸に近づく
  3. σ\sigma が大きいほど山は低く横に広がり、小さいほど高く mm のまわりに集まる
  4. XX が mm−kσ{}- k\sigma 以上 mm+kσ{}+ k\sigma 以下の値をとる確率は、mm,σ\sigma によらず
範囲m±σm \pm \sigmam±2σm \pm 2\sigmam±3σm \pm 3\sigma
確率約 0.6830.683約 0.9540.954約 0.9970.997

NN は正規分布を表す英語 normal distribution の頭文字で、N(m, σ2)N(m,\ \sigma^2) の 2 つ目には標準偏差の 2 乗、つまり分散を書きます。N(50, 102)N(50,\ 10^2) なら平均 5050、標準偏差 1010 です。E(X)E(X)=m{}= m,V(X)V(X)=σ2{}= \sigma^2 となることの証明には高校の範囲を少し超える積分が必要なので、厳密定義のページで扱います。ee は微分積分の分野 第11章で学ぶ数で、ここでは式の形よりもグラフの性質を使えれば十分です。

-5 -4 -3 -2 -1 0 1 2 3 4 5 6 N(0, 1) N(3, 1) N(0, 2²)

服の型紙にたとえると、正規分布の曲線はたった 1 枚の型紙です。平均 mm は型紙を布のどこに置くかを、標準偏差 σ\sigma は型紙を何倍に拡大するかを決めます。拡大すると横に広がる分だけ高さは低くなり、面積はいつも 11 に保たれます。どの正規分布も同じ型紙から作られているので、「mm から σ\sigma の何倍以内か」だけで確率が決まる、というのが性質 4 の意味です。

m−3σ m−2σ m−σ m m+σ m+2σ m+3σ 約 68.3% 約 95.4% 約 99.7%

正規分布 N(m, σ2)N(m,\ \sigma^2) は平均 mm を中心に左右対称な釣り鐘形で、mm が位置を、σ\sigma が広がりを決め、mm±σ{}\pm \sigma,mm±2σ{}\pm 2\sigma,mm±3σ{}\pm 3\sigma に入る確率は約 0.6830.683,0.9540.954,0.9970.997 だということです。

例題3:σ の何倍かで確率を読む

ある地域の高校 3 年生の男子の身長 XX cm は、正規分布 N(170, 62)N(170,\ 6^2) に従うものとします。公式3 の表の値を使って、次の確率を求めなさい。

(1) P(158≦X≦182)P(158 \leqq X \leqq 182)

(2) P(X≧176)P(X \geqq 176)

上の (1)、(2) の値をそれぞれ求めなさい。


【解答】

(1) 158158=170{}= 170−2×6{}- 2 \times 6,182182=170{}= 170+2×6{}+ 2 \times 6 なので、mm±2σ{}\pm 2\sigma の範囲です。P(158≦X≦182)≒0.954‾\underline{P(158 \leqq X \leqq 182) \fallingdotseq 0.954}

(2) 176176=170{}= 170+6{}+ 6 は mm+σ{}+ \sigma です。mm±σ{}\pm \sigma の外側の確率は 11−0.683{}- 0.683=0.317{}= 0.317 で、分布は左右対称なので、その半分が 176176 以上の側にあります。

P(X≧176)\displaystyle P(X \geqq 176)≒0.3172\displaystyle {}\fallingdotseq \frac{0.317}{2}≒0.16‾\displaystyle {}\fallingdotseq \underline{0.16}

第3章の小話で「正規分布なら偏差値 6060 以上は上位約 1616%」と紹介したのは、この計算です(偏差値 6060 は平均 +1+ 1 標準偏差)。

標準化と正規分布表

mm±σ{}\pm \sigma のようなきりのよい範囲以外の確率は、積分を手で計算することができません(e−x2e^{-x^2} の不定積分は、知っている関数では書けないことが分かっています)。そこで、1 つの正規分布についてだけ数値の表を作っておき、どの正規分布もその表に直して読みます。

公式4:標準化と正規分布表

XX が正規分布 N(m, σ2)N(m,\ \sigma^2) に従うとき

Z\displaystyle Z=X−mσ\displaystyle {}= \frac{X - m}{\sigma}

は正規分布 N(0, 1)N(0,\ 1) に従う。N(0, 1)N(0,\ 1) を標準正規分布といい、その確率密度関数は f(z)f(z)=12π e−z22{}= \dfrac{1}{\sqrt{2\pi}}\, e^{-\frac{z^2}{2}} である。uu≧0{}\geqq 0 に対して

p(u)\displaystyle p(u)=P(0≦Z≦u)\displaystyle {}= P(0 \leqq Z \leqq u)

の値をまとめた表を正規分布表という。この章で使う値は次のとおりである。

uup(u)p(u)
0.50.1915
1.00.3413
1.20.3849
1.50.4332
1.960.4750
2.00.4772
2.50.4938
3.00.4987

一般に、XX が N(m, σ2)N(m,\ \sigma^2) に従うとき、aXaX+b{}+ b(aa≠0{}\neq 0)は N(am+b, a2σ2)N(am + b,\ a^2\sigma^2) に従う。

ZZ は第3章 公式6、第6章で学んだ標準化そのものです。E(Z)E(Z)=m−mσ{}= \dfrac{m - m}{\sigma}=0{}= 0,σ(Z)\sigma(Z)=σσ{}= \dfrac{\sigma}{\sigma}=1{}= 1 となり、さらに正規分布の形も保たれます(最後の一文の aa=1σ{}= \dfrac{1}{\sigma},bb=−mσ{}= -\dfrac{m}{\sigma} の場合)。

正規分布表は 00 から uu までの面積だけを載せています。それ以外の範囲は、分布が zz=0{}= 0 について対称であることと、右半分の面積が 0.50.5 であることを組み合わせて求めます。

-3 -2 -1 1 2 3 0 u p(u) p(u) = P(0 ≦ Z ≦ u) 右半分の面積は 0.5

**世界共通の時刻(協定世界時)**を思い浮かべてください。東京・ロンドン・ニューヨークの時刻表をそれぞれ用意しなくても、どの都市の時刻も協定世界時に直してしまえば、1 枚の表で比べられます。標準化も同じで、平均も標準偏差もばらばらな正規分布を、すべて「平均 00・標準偏差 11」の ZZ に直すことで、たった 1 枚の正規分布表で確率が読めるようになります。

正規分布の確率は、ZZ=X−mσ{}= \dfrac{X - m}{\sigma} で標準正規分布 N(0, 1)N(0,\ 1) に直し、対称性と右半分の面積 0.50.5 を使って正規分布表 p(u)p(u) を読めば求まるということです。

例題4:正規分布表を使う

確率変数 XX が正規分布 N(50, 102)N(50,\ 10^2) に従うとき、公式4 の正規分布表を使って、次の確率を求めなさい。

(1) P(X≧62)P(X \geqq 62)

(2) P(38≦X≦55)P(38 \leqq X \leqq 55)

上の (1)、(2) の値をそれぞれ求めなさい。


【解答】

ZZ=X−5010{}= \dfrac{X - 50}{10} とおくと、ZZ は N(0, 1)N(0,\ 1) に従います。

(1) XX=62{}= 62 のとき ZZ=62−5010{}= \dfrac{62 - 50}{10}=1.2{}= 1.2 なので

P(X≧62)\displaystyle P(X \geqq 62)=P(Z≧1.2)\displaystyle {}= P(Z \geqq 1.2)=0.5\displaystyle {}= 0.5−p(1.2)\displaystyle {}- p(1.2)=0.5\displaystyle {}= 0.5−0.3849\displaystyle {}- 0.3849=0.1151‾\displaystyle {}= \underline{0.1151}

(2) XX=38{}= 38 のとき ZZ=−1.2{}= -1.2、XX=55{}= 55 のとき ZZ=0.5{}= 0.5 なので

P(38≦X≦55)\displaystyle P(38 \leqq X \leqq 55)=P(−1.2≦Z≦0.5)\displaystyle {}= P(-1.2 \leqq Z \leqq 0.5)=p(1.2)\displaystyle {}= p(1.2)+p(0.5)\displaystyle {}+ p(0.5)=0.3849\displaystyle {}= 0.3849+0.1915\displaystyle {}+ 0.1915=0.5764‾\displaystyle {}= \underline{0.5764}

データの分布に正規分布を当てはめる

テストの得点、同じ機械で作った製品の重さ、測定の誤差などのヒストグラムは、釣り鐘形に近くなることがよくあります。そのようなデータでは、平均値 x‾\overline{x} と標準偏差 ss をもつ正規分布 N(x‾, s2)N(\overline{x},\ s^2) で分布を近似し、ある範囲に入る人数や、上位何%の境目を見積もることができます。

公式5:正規分布によるデータの見積もり

大きさ NN のデータの分布が正規分布 N(m, σ2)N(m,\ \sigma^2) で近似できるとき

  1. 範囲に入る人数:値が aa 以上 bb 以下の個数は、およそ N×P(a≦X≦b)N \times P(a \leqq X \leqq b)
  2. 上位の境目:上位 rr の割合に入る値の境目 cc は、P(Z≧u)P(Z \geqq u)=r{}= r、つまり p(u)p(u)=0.5{}= 0.5−r{}- r となる uu を表から読み、cc=m{}= m+uσ{}+ u\sigma

2 は、1 と逆の向きに表を使う読み方です。確率から uu を探し、XX=m{}= m+σZ{}+ \sigma Z で元の値に戻します。

実際のデータがぴったり正規分布になることはありません。得点には満点があり、身長がマイナスになることもありません。それでも、分布が左右対称な山形に近ければ、正規分布は手軽で見積もりのよい模型になります。縮尺つきの地図で、道の長さを定規で測れば実際の距離がおよそ分かるのと同じです。地図は道の細かい曲がりまでは描いていませんが、「だいたい何 km か」を知るには十分に役立ちます。

釣り鐘形のデータは正規分布 N(x‾, s2)N(\overline{x},\ s^2) で近似でき、「範囲に入る人数=全体 × 確率」「上位 rr の境目=表で p(u)p(u)=0.5{}= 0.5−r{}- r となる uu を読んで mm+uσ{}+ u\sigma」と見積もれるということです。

例題5:テストの得点の見積もり

ある試験を 500500 人が受け、得点の分布は正規分布 N(58, 122)N(58,\ 12^2) で近似できるとします。公式4 の正規分布表を使って、次の値を見積もりなさい。

(1) 7070 点以上の人数(小数第1位を四捨五入して整数で)

(2) 上位 2.52.5% に入るための得点の境目(小数第1位を四捨五入して整数で)

上の (1)、(2) の値をそれぞれ求めなさい。


【解答】

得点を XX、ZZ=X−5812{}= \dfrac{X - 58}{12} とします。

(1) XX=70{}= 70 のとき ZZ=1{}= 1 なので

P(X≧70)\displaystyle P(X \geqq 70)=0.5\displaystyle {}= 0.5−p(1.0)\displaystyle {}- p(1.0)=0.5\displaystyle {}= 0.5−0.3413\displaystyle {}- 0.3413=0.1587\displaystyle {}= 0.1587

500×0.1587500 \times 0.1587=79.35{}= 79.35 より、およそ 79 人‾\underline{79 \text{ 人}} です。

(2) P(Z≧u)P(Z \geqq u)=0.025{}= 0.025、つまり p(u)p(u)=0.5{}= 0.5−0.025{}- 0.025=0.475{}= 0.475 となる uu は、表から uu=1.96{}= 1.96 です。

c\displaystyle c=58\displaystyle {}= 58+1.96×12\displaystyle {}+ 1.96 \times 12=58\displaystyle {}= 58+23.52\displaystyle {}+ 23.52=81.52\displaystyle {}= 81.52

より、上位 2.52.5% の境目はおよそ 82 点‾\underline{82 \text{ 点}} です。

二項分布の正規分布による近似

第7章の二項分布 B(n, p)B(n,\ p) は、nn が大きくなると確率の計算が大変になります。ところが nn が大きいとき、二項分布のグラフは釣り鐘形になり、同じ平均・標準偏差をもつ正規分布の曲線にぴったり重なってきます。

公式6:二項分布の正規分布による近似

XX が二項分布 B(n, p)B(n,\ p) に従うとき、qq=1{}= 1−p{}- p とすると、nn が大きければ XX は近似的に正規分布 N(np, npq)N(np,\ npq) に従う。したがって

Z\displaystyle Z=X−npnpq\displaystyle {}= \frac{X - np}{\sqrt{npq}}

は近似的に標準正規分布 N(0, 1)N(0,\ 1) に従う。

npnp,npqnpq は第7章 公式2 の期待値と分散です。「同じ期待値・同じ分散の正規分布で置きかえる」と覚えれば十分です。

0 2 4 6 8 10 12 14 16 18 20 B(20, 1/2) N(10, 5)

点描画の絵を思い出してください。スーラの絵のように小さな色の点を並べた絵は、近くで見ると点の集まりですが、離れて見るとなめらかな色の広がりに見えます。二項分布の確率も、回数ごとの「とびとびの点」ですが、nn が大きいと点が細かく密に並び、全体としてなめらかな正規分布の曲線に見えてくるのです。

第7章の厳密定義のページで、B(20, 12)B\left(20,\ \dfrac{1}{2}\right) で期待値から標準偏差の 22 倍以内(66≦X{}\leqq X≦14{}\leqq 14)に入る確率は約 0.9590.959 だと計算しました。正規分布なら公式3 の約 0.9540.954 で、nn=20{}= 20 でもかなり近い値です。

回数 nn が大きい二項分布 B(n, p)B(n,\ p) は、期待値 npnp・分散 npqnpq が同じ正規分布 N(np, npq)N(np,\ npq) で近似でき、ZZ=X−npnpq{}= \dfrac{X - np}{\sqrt{npq}} として正規分布表で確率が求まるということです。

例題6:硬貨 400 回の表の回数

硬貨を 400400 回投げるとき、表が出る回数を XX とします。正規分布で近似して、公式4 の正規分布表を使い、次の確率を求めなさい。

(1) P(X≧220)P(X \geqq 220)

(2) P(190≦X≦215)P(190 \leqq X \leqq 215)

上の (1)、(2) の値をそれぞれ求めなさい。


【解答】

XX は B(400, 12)B\left(400,\ \dfrac{1}{2}\right) に従うので

np\displaystyle np=400×12\displaystyle {}= 400 \times \frac{1}{2}=200,\displaystyle {}= 200,npq\displaystyle \sqrt{npq}=400×12×12\displaystyle {}= \sqrt{400 \times \frac{1}{2} \times \frac{1}{2}}=10\displaystyle {}= 10

nn=400{}= 400 は大きいので、ZZ=X−20010{}= \dfrac{X - 200}{10} は近似的に N(0, 1)N(0,\ 1) に従います。

(1) XX=220{}= 220 のとき ZZ=2{}= 2 なので

P(X≧220)\displaystyle P(X \geqq 220)≒P(Z≧2)\displaystyle {}\fallingdotseq P(Z \geqq 2)=0.5\displaystyle {}= 0.5−0.4772\displaystyle {}- 0.4772=0.0228‾\displaystyle {}= \underline{0.0228}

(2) XX=190{}= 190 のとき ZZ=−1{}= -1、XX=215{}= 215 のとき ZZ=1.5{}= 1.5 なので

P(190≦X≦215)\displaystyle P(190 \leqq X \leqq 215)≒p(1.0)\displaystyle {}\fallingdotseq p(1.0)+p(1.5)\displaystyle {}+ p(1.5)=0.3413\displaystyle {}= 0.3413+0.4332\displaystyle {}+ 0.4332=0.7745‾\displaystyle {}= \underline{0.7745}

二項分布のまま計算した正確な値は、(1) が約 0.02550.0255、(2) が約 0.7930.793 です。とびとびの値を曲線で置きかえた分の小さなずれがあり、それを小さくする工夫(半整数補正)を厳密定義のページで紹介します。

基礎確認問題(全5問)

まずは公式をそのまま使う、ごく簡単な問題で確認しましょう。

問1

確率変数 XX のとる値の範囲が 00≦X{}\leqq X≦2{}\leqq 2 で、確率密度関数が f(x)f(x)=ax{}= ax(aa は定数)です。定数 aa の値を求めなさい。

答えを見る
答え

∫02ax dx\displaystyle \int_0^2 ax\,dx=2a\displaystyle {}= 2a=1\displaystyle {}= 1 より a=12‾\underline{a = \dfrac{1}{2}}

自己採点:
記録を読み込み中…

問2

確率変数 XX のとる値の範囲が 00≦X{}\leqq X≦2{}\leqq 2 で、確率密度関数が f(x)f(x)=x2{}= \dfrac{x}{2} です。確率 P(1≦X≦2)P(1 \leqq X \leqq 2) を求めなさい。

つまずいたときは:
答えを見る
答え

∫12x2 dx\displaystyle \int_1^2 \frac{x}{2}\,dx=[ x24 ]12\displaystyle {}= \Big[\,\frac{x^2}{4}\,\Big]_1^2=1\displaystyle {}= 1−14\displaystyle {}- \frac{1}{4}=34‾\displaystyle {}= \underline{\frac{3}{4}}

自己採点:
記録を読み込み中…

問3

確率変数 XX が正規分布 N(50, 102)N(50,\ 10^2) に従うとき、XX=65{}= 65 を標準化した値 ZZ=X−5010{}= \dfrac{X - 50}{10} を求めなさい。

答えを見る
答え

ZZ=65−5010{}= \dfrac{65 - 50}{10}=1.5‾{}= \underline{1.5}

自己採点:
記録を読み込み中…

問4

確率変数 ZZ が標準正規分布 N(0, 1)N(0,\ 1) に従います。P(0≦Z≦1.5)P(0 \leqq Z \leqq 1.5)=0.4332{}= 0.4332 を使って、P(Z≧1.5)P(Z \geqq 1.5) を求めなさい。

つまずいたときは:
答えを見る
答え

右半分の面積は 0.50.5 なので 0.50.5−0.4332{}- 0.4332=0.0668‾{}= \underline{0.0668}

自己採点:
記録を読み込み中…

問5

確率変数 XX が二項分布 B(400, 12)B\left(400,\ \dfrac{1}{2}\right) に従います。XX を近似する正規分布を N(m, σ2)N(m,\ \sigma^2) とするとき、mm と σ\sigma の値をそれぞれ求めなさい。

つまずいたときは:
答えを見る
答え

mm=np{}= np=200‾{}= \underline{200},σ\sigma=400×12×12{}= \sqrt{400 \times \dfrac{1}{2} \times \dfrac{1}{2}}=10‾{}= \underline{10}

自己採点:
記録を読み込み中…

実践問題(全20問)

難易度マークは ★=基礎、★★=標準、★★★=入試レベルです。★から順に取り組みましょう。

問1 ★

確率変数 XX のとる値の範囲が 00≦X{}\leqq X≦3{}\leqq 3 で、確率密度関数が f(x)f(x)=ax2{}= ax^2(aa は正の定数)です。定数 aa の値と、確率 P(1≦X≦2)P(1 \leqq X \leqq 2) を求めなさい。

つまずいたときは:
答えを見る
答え

aa=19{}= \dfrac{1}{9},P(1≦X≦2)P(1 \leqq X \leqq 2)=727{}= \dfrac{7}{27}

解説

全体の面積が 11 なので

∫03ax2 dx\displaystyle \int_0^3 ax^2\,dx=a[ x33 ]03\displaystyle {}= a\Big[\,\frac{x^3}{3}\,\Big]_0^3=9a\displaystyle {}= 9a=1\displaystyle {}= 1

より a=19‾\underline{a = \dfrac{1}{9}} です。

P(1≦X≦2)\displaystyle P(1 \leqq X \leqq 2)=19∫12x2 dx\displaystyle {}= \frac{1}{9}\int_1^2 x^2\,dx=19[ x33 ]12\displaystyle {}= \frac{1}{9}\Big[\,\frac{x^3}{3}\,\Big]_1^2=19×8−13\displaystyle {}= \frac{1}{9} \times \frac{8 - 1}{3}=727‾\displaystyle {}= \underline{\frac{7}{27}}
自己採点:
記録を読み込み中…

問2 ★

確率変数 XX のとる値の範囲が 00≦X{}\leqq X≦1{}\leqq 1 で、確率密度関数が f(x)f(x)=2x{}= 2x です。XX の期待値と分散をそれぞれ求めなさい。

つまずいたときは:
答えを見る
答え

期待値 23\dfrac{2}{3},分散 118\dfrac{1}{18}

解説

公式2 より

E(X)\displaystyle E(X)=∫01x⋅2x dx\displaystyle {}= \int_0^1 x \cdot 2x\,dx=[ 2x33 ]01\displaystyle {}= \Big[\,\frac{2x^3}{3}\,\Big]_0^1=23‾\displaystyle {}= \underline{\frac{2}{3}} E(X2)\displaystyle E(X^2)=∫01x2⋅2x dx\displaystyle {}= \int_0^1 x^2 \cdot 2x\,dx=[ x42 ]01\displaystyle {}= \Big[\,\frac{x^4}{2}\,\Big]_0^1=12\displaystyle {}= \frac{1}{2} V(X)\displaystyle V(X)=E(X2)\displaystyle {}= E(X^2)−{E(X)}2\displaystyle {}- \{E(X)\}^2=12\displaystyle {}= \frac{1}{2}−49\displaystyle {}- \frac{4}{9}=118‾\displaystyle {}= \underline{\frac{1}{18}}

f(x)f(x)=2x{}= 2x は xx が大きいほど密度が高いので、期待値は区間の真ん中 12\dfrac{1}{2} より大きくなっています。

自己採点:
記録を読み込み中…

問3 ★

確率変数 ZZ が標準正規分布 N(0, 1)N(0,\ 1) に従い、p(u)p(u)=P(0≦Z≦u){}= P(0 \leqq Z \leqq u) とします。p(1.0)p(1.0)=0.3413{}= 0.3413,p(2.0)p(2.0)=0.4772{}= 0.4772 を使って、確率 P(−1≦Z≦2)P(-1 \leqq Z \leqq 2) を求めなさい。

つまずいたときは:
答えを見る
答え

0.81850.8185

解説

分布は zz=0{}= 0 について対称なので、P(−1≦Z≦0)P(-1 \leqq Z \leqq 0)=P(0≦Z≦1){}= P(0 \leqq Z \leqq 1)=p(1.0){}= p(1.0) です。

P(−1≦Z≦2)\displaystyle P(-1 \leqq Z \leqq 2)=p(1.0)\displaystyle {}= p(1.0)+p(2.0)\displaystyle {}+ p(2.0)=0.3413\displaystyle {}= 0.3413+0.4772\displaystyle {}+ 0.4772=0.8185‾\displaystyle {}= \underline{0.8185}
自己採点:
記録を読み込み中…

問4 ★

確率変数 XX が正規分布 N(60, 52)N(60,\ 5^2) に従います。ZZ が標準正規分布に従うとき P(0≦Z≦2)P(0 \leqq Z \leqq 2)=0.4772{}= 0.4772 であることを使って、確率 P(X≧70)P(X \geqq 70) を求めなさい。

つまずいたときは:
答えを見る
答え

0.02280.0228

解説

ZZ=X−605{}= \dfrac{X - 60}{5} とおくと、ZZ は N(0, 1)N(0,\ 1) に従います。XX=70{}= 70 のとき ZZ=70−605{}= \dfrac{70 - 60}{5}=2{}= 2 なので

P(X≧70)\displaystyle P(X \geqq 70)=P(Z≧2)\displaystyle {}= P(Z \geqq 2)=0.5\displaystyle {}= 0.5−0.4772\displaystyle {}- 0.4772=0.0228‾\displaystyle {}= \underline{0.0228}
自己採点:
記録を読み込み中…

問5 ★

確率変数 XX が正規分布 N(20, 42)N(20,\ 4^2) に従います。正規分布表の値 p(0.5)p(0.5)=0.1915{}= 0.1915,p(1.5)p(1.5)=0.4332{}= 0.4332 を使って、確率 P(14≦X≦22)P(14 \leqq X \leqq 22) を求めなさい。

つまずいたときは:
答えを見る
答え

0.62470.6247

解説

ZZ=X−204{}= \dfrac{X - 20}{4} とおくと、ZZ は N(0, 1)N(0,\ 1) に従います。

X\displaystyle X=14 のとき Z\displaystyle {}= 14 \text{ のとき } Z=14−204\displaystyle {}= \frac{14 - 20}{4}=−1.5,\displaystyle {}= -1.5,X\displaystyle X=22 のとき Z\displaystyle {}= 22 \text{ のとき } Z=22−204\displaystyle {}= \frac{22 - 20}{4}=0.5\displaystyle {}= 0.5

00 をはさむ範囲なので、左右の面積を足します。

P(14≦X≦22)\displaystyle P(14 \leqq X \leqq 22)=P(−1.5≦Z≦0.5)\displaystyle {}= P(-1.5 \leqq Z \leqq 0.5)=p(1.5)\displaystyle {}= p(1.5)+p(0.5)\displaystyle {}+ p(0.5)=0.4332\displaystyle {}= 0.4332+0.1915\displaystyle {}+ 0.1915=0.6247‾\displaystyle {}= \underline{0.6247}
自己採点:
記録を読み込み中…

問6 ★

ある学年の男子 10001000 人の身長の分布は、平均 170.0170.0 cm、標準偏差 5.05.0 cm の正規分布で近似できるとします。正規分布表の値 p(1.5)p(1.5)=0.4332{}= 0.4332 を使って、身長が 162.5162.5 cm 以下の人のおよその人数(小数第1位を四捨五入)を求めなさい。

つまずいたときは:
答えを見る
答え

およそ 6767 人

解説

身長を XX cm とすると、XX は N(170, 52)N(170,\ 5^2) に従うとみなせます。ZZ=X−1705{}= \dfrac{X - 170}{5} とすると、XX=162.5{}= 162.5 のとき ZZ=−7.55{}= \dfrac{-7.5}{5}=−1.5{}= -1.5 です。対称性より

P(X≦162.5)\displaystyle P(X \leqq 162.5)=P(Z≦−1.5)\displaystyle {}= P(Z \leqq -1.5)=P(Z≧1.5)\displaystyle {}= P(Z \geqq 1.5)=0.5\displaystyle {}= 0.5−0.4332\displaystyle {}- 0.4332=0.0668\displaystyle {}= 0.0668

1000×0.06681000 \times 0.0668=66.8{}= 66.8 なので、およそ 67 人‾\underline{67 \text{ 人}} です。

自己採点:
記録を読み込み中…

問7 ★

確率変数 XX が正規分布 N(10, 32)N(10,\ 3^2) に従います。正規分布表の値 p(2.0)p(2.0)=0.4772{}= 0.4772 を使って、YY=2X{}= 2X+3{}+ 3 が従う正規分布と、確率 P(Y≧35)P(Y \geqq 35) を求めなさい。

つまずいたときは:
答えを見る
答え

YY は N(23, 62)N(23,\ 6^2) に従い、P(Y≧35)P(Y \geqq 35)=0.0228{}= 0.0228

解説

公式4 の最後の性質より、YY=2X{}= 2X+3{}+ 3 は正規分布に従い

E(Y)\displaystyle E(Y)=2×10\displaystyle {}= 2 \times 10+3\displaystyle {}+ 3=23,\displaystyle {}= 23,σ(Y)\displaystyle \sigma(Y)=2×3\displaystyle {}= 2 \times 3=6\displaystyle {}= 6

なので、YY は N(23, 62)‾\underline{N(23,\ 6^2)} に従います。YY=35{}= 35 のとき ZZ=35−236{}= \dfrac{35 - 23}{6}=2{}= 2 なので

P(Y≧35)\displaystyle P(Y \geqq 35)=0.5\displaystyle {}= 0.5−p(2.0)\displaystyle {}- p(2.0)=0.0228‾\displaystyle {}= \underline{0.0228}

YY≧35{}\geqq 35 は XX≧16{}\geqq 16 と同じことで、XX で標準化しても ZZ=16−103{}= \dfrac{16 - 10}{3}=2{}= 2 と同じ値になります。

自己採点:
記録を読み込み中…

問8 ★

11 回の成功率が 15\dfrac{1}{5} の試行を 16001600 回くり返し、成功する回数を XX とします。正規分布で近似し、正規分布表の値 p(1.25)p(1.25)=0.3944{}= 0.3944 を使って、確率 P(X≦300)P(X \leqq 300) を求めなさい。

つまずいたときは:
答えを見る
答え

0.10560.1056

解説

XX は B(1600, 15)B\left(1600,\ \dfrac{1}{5}\right) に従うので

E(X)\displaystyle E(X)=1600×15\displaystyle {}= 1600 \times \frac{1}{5}=320,\displaystyle {}= 320,σ(X)\displaystyle \sigma(X)=1600×15×45\displaystyle {}= \sqrt{1600 \times \frac{1}{5} \times \frac{4}{5}}=256\displaystyle {}= \sqrt{256}=16\displaystyle {}= 16

nn=1600{}= 1600 は大きいので、ZZ=X−32016{}= \dfrac{X - 320}{16} は近似的に N(0, 1)N(0,\ 1) に従います。XX=300{}= 300 のとき ZZ=−2016{}= \dfrac{-20}{16}=−1.25{}= -1.25 なので

P(X≦300)\displaystyle P(X \leqq 300)≒P(Z≦−1.25)\displaystyle {}\fallingdotseq P(Z \leqq -1.25)=0.5\displaystyle {}= 0.5−p(1.25)\displaystyle {}- p(1.25)=0.5\displaystyle {}= 0.5−0.3944\displaystyle {}- 0.3944=0.1056‾\displaystyle {}= \underline{0.1056}
自己採点:
記録を読み込み中…

問9 ★★

確率変数 XX のとる値の範囲が 00≦X{}\leqq X≦1{}\leqq 1 で、確率密度関数が f(x)f(x)=a(1−x)2{}= a(1 - x)^2(aa は正の定数)です。定数 aa の値と、XX の期待値・分散をそれぞれ求めなさい。

つまずいたときは:
答えを見る
答え

aa=3{}= 3,期待値 14\dfrac{1}{4},分散 380\dfrac{3}{80}

解説
∫01a(1−x)2 dx\displaystyle \int_0^1 a(1 - x)^2\,dx=a[ −(1−x)33 ]01\displaystyle {}= a\Big[\,-\frac{(1 - x)^3}{3}\,\Big]_0^1=a3\displaystyle {}= \frac{a}{3}=1\displaystyle {}= 1

より a=3‾\underline{a = 3} です。次に、x(1−x)2x(1 - x)^2=x{}= x−2x2{}- 2x^2+x3{}+ x^3,x2(1−x)2x^2(1 - x)^2=x2{}= x^2−2x3{}- 2x^3+x4{}+ x^4 なので

E(X)\displaystyle E(X)=3∫01(x−2x2+x3) dx\displaystyle {}= 3\int_0^1 (x - 2x^2 + x^3)\,dx=3(12−23+14)\displaystyle {}= 3\left(\frac{1}{2} - \frac{2}{3} + \frac{1}{4}\right)=3×112\displaystyle {}= 3 \times \frac{1}{12}=14‾\displaystyle {}= \underline{\frac{1}{4}} E(X2)\displaystyle E(X^2)=3∫01(x2−2x3+x4) dx\displaystyle {}= 3\int_0^1 (x^2 - 2x^3 + x^4)\,dx=3(13−12+15)\displaystyle {}= 3\left(\frac{1}{3} - \frac{1}{2} + \frac{1}{5}\right)=3×130\displaystyle {}= 3 \times \frac{1}{30}=110\displaystyle {}= \frac{1}{10} V(X)\displaystyle V(X)=110\displaystyle {}= \frac{1}{10}−(14)2\displaystyle {}- \left(\frac{1}{4}\right)^2=8−580\displaystyle {}= \frac{8 - 5}{80}=380‾\displaystyle {}= \underline{\frac{3}{80}}
自己採点:
記録を読み込み中…

問10 ★★

確率変数 XX のとる値の範囲が 00≦X{}\leqq X≦2{}\leqq 2 で、確率密度関数が

f(x)\displaystyle f(x)={x(0≦x≦1)2−x(1≦x≦2)\displaystyle {}= \begin{cases} x & (0 \leqq x \leqq 1) \\ 2 - x & (1 \leqq x \leqq 2) \end{cases}

です。

(1) 確率 P(12≦X≦32)P\left(\dfrac{1}{2} \leqq X \leqq \dfrac{3}{2}\right)

(2) P(X≧a)P(X \geqq a)=18{}= \dfrac{1}{8} となる定数 aa

上の (1)、(2) の値をそれぞれ求めなさい。

つまずいたときは:
答えを見る
答え

(1) 34\dfrac{3}{4} (2) aa=32{}= \dfrac{3}{2}

解説

yy=f(x){}= f(x) のグラフは、底辺 22、高さ 11 の三角形で、面積は 11 です。

(1) 左右の端の小さな三角形を除けばよいです。00≦x{}\leqq x≦12{}\leqq \dfrac{1}{2} の部分の面積は 12×12×12\dfrac{1}{2} \times \dfrac{1}{2} \times \dfrac{1}{2}=18{}= \dfrac{1}{8} で、対称性より右端も 18\dfrac{1}{8} です。

P(12≦X≦32)\displaystyle P\left(\frac{1}{2} \leqq X \leqq \frac{3}{2}\right)=1\displaystyle {}= 1−18×2\displaystyle {}- \frac{1}{8} \times 2=34‾\displaystyle {}= \underline{\frac{3}{4}}

(2) P(X≧1)P(X \geqq 1)=12{}= \dfrac{1}{2}>18{}> \dfrac{1}{8} なので、11<a{}< a≦2{}\leqq 2 です。このとき

P(X≧a)\displaystyle P(X \geqq a)=∫a2(2−x) dx\displaystyle {}= \int_a^2 (2 - x)\,dx=[ −(2−x)22 ]a2\displaystyle {}= \Big[\,-\frac{(2 - x)^2}{2}\,\Big]_a^2=(2−a)22\displaystyle {}= \frac{(2 - a)^2}{2}

(2−a)22\dfrac{(2 - a)^2}{2}=18{}= \dfrac{1}{8} より (2−a)2(2 - a)^2=14{}= \dfrac{1}{4}、22−a{}- a>0{}> 0 なので 22−a{}- a=12{}= \dfrac{1}{2}、a=32‾\underline{a = \dfrac{3}{2}} です。

(1) の結果とも合っています(右端 32\dfrac{3}{2}≦X{}\leqq X≦2{}\leqq 2 の確率が 18\dfrac{1}{8})。

自己採点:
記録を読み込み中…

問11 ★★

ある試験の得点の分布は、正規分布 N(62, 102)N(62,\ 10^2) で近似できるとします。正規分布表の値 p(1.28)p(1.28)=0.3997{}= 0.3997,p(1.29)p(1.29)=0.4015{}= 0.4015 のうち、必要な確率に近いほうを使って、得点が上位 1010% に入るための境目の得点を小数第1位まで求めなさい。

つまずいたときは:
答えを見る
答え

74.874.8 点

解説

得点を XX、ZZ=X−6210{}= \dfrac{X - 62}{10} とします。上位 1010% の境目 cc は

P(X≧c)\displaystyle P(X \geqq c)=0.10\displaystyle {}= 0.10  ⟺  P(Z≧c−6210)\displaystyle {}\iff P\left(Z \geqq \frac{c - 62}{10}\right)=0.10\displaystyle {}= 0.10

を満たします。uu=c−6210{}= \dfrac{c - 62}{10} とおくと p(u)p(u)=0.5{}= 0.5−0.10{}- 0.10=0.40{}= 0.40 です。0.39970.3997 と 0.40150.4015 では 0.39970.3997 のほうが 0.400.40 に近いので uu=1.28{}= 1.28 とします。

c\displaystyle c=62\displaystyle {}= 62+1.28×10\displaystyle {}+ 1.28 \times 10=74.8‾\displaystyle {}= \underline{74.8}

より、境目はおよそ 74.874.8 点です。

自己採点:
記録を読み込み中…

問12 ★★

確率変数 XX が正規分布 N(m, σ2)N(m,\ \sigma^2) に従い、P(X≧80)P(X \geqq 80)=0.0228{}= 0.0228,P(X≦50)P(X \leqq 50)=0.1587{}= 0.1587 です。正規分布表の値 p(1.0)p(1.0)=0.3413{}= 0.3413,p(2.0)p(2.0)=0.4772{}= 0.4772 を使って、mm と σ\sigma の値をそれぞれ求めなさい。

つまずいたときは:
答えを見る
答え

mm=60{}= 60,σ\sigma=10{}= 10

解説

ZZ=X−mσ{}= \dfrac{X - m}{\sigma} とします。

P(Z≧2)P(Z \geqq 2)=0.5{}= 0.5−0.4772{}- 0.4772=0.0228{}= 0.0228 なので、P(X≧80)P(X \geqq 80)=0.0228{}= 0.0228 より 80−mσ\dfrac{80 - m}{\sigma}=2{}= 2 です。

P(Z≦−1)P(Z \leqq -1)=0.5{}= 0.5−0.3413{}- 0.3413=0.1587{}= 0.1587 なので、P(X≦50)P(X \leqq 50)=0.1587{}= 0.1587 より 50−mσ\dfrac{50 - m}{\sigma}=−1{}= -1 です。

80\displaystyle 80−m\displaystyle {}- m=2σ,\displaystyle {}= 2\sigma,50\displaystyle 50−m\displaystyle {}- m=−σ\displaystyle {}= -\sigma

辺々引くと 3030=3σ{}= 3\sigma なので σ=10‾\underline{\sigma = 10}、2 つ目の式から m=60‾\underline{m = 60} です。

自己採点:
記録を読み込み中…

問13 ★★

ある機械で作る製品の重さは、正規分布 N(200, 42)N(200,\ 4^2) に従うとします(単位は g)。重さが 194194 g 以上 206206 g 以下の製品を合格とし、それ以外を不良品とします。

(1) 不良品ができる確率

(2) 平均を 200200 g に保ったまま標準偏差 σ\sigma だけを小さくして、不良品ができる確率を 0.050.05 以下にするときの σ\sigma の最大値(小数第3位を四捨五入)

正規分布表の値 p(1.5)p(1.5)=0.4332{}= 0.4332,p(1.96)p(1.96)=0.4750{}= 0.4750 を使って、上の (1)、(2) の値をそれぞれ求めなさい。

つまずいたときは:
答えを見る
答え

(1) 0.13360.1336 (2) 約 3.063.06 g

解説

(1) ZZ=X−2004{}= \dfrac{X - 200}{4} とすると、194194 と 206206 はそれぞれ ZZ=−1.5{}= -1.5,1.51.5 です。

P(194≦X≦206)\displaystyle P(194 \leqq X \leqq 206)=2p(1.5)\displaystyle {}= 2p(1.5)=0.8664\displaystyle {}= 0.8664

よって、不良品の確率は 11−0.8664{}- 0.8664=0.1336‾{}= \underline{0.1336} です。

(2) 標準偏差を σ\sigma とすると、合格の範囲は ZZ で −6σ-\dfrac{6}{\sigma}≦Z{}\leqq Z≦6σ{}\leqq \dfrac{6}{\sigma} です。不良品の確率が 0.050.05 以下 ⇔ 合格の確率が 0.950.95 以上 ⇔ 2p(6σ)2p\left(\dfrac{6}{\sigma}\right)≧0.95{}\geqq 0.95 ⇔ p(6σ)p\left(\dfrac{6}{\sigma}\right)≧0.475{}\geqq 0.475 です。p(u)p(u) は uu について増加し、p(1.96)p(1.96)=0.475{}= 0.475 なので

6σ\displaystyle \frac{6}{\sigma}≧1.96\displaystyle {}\geqq 1.96  ⟺  σ\displaystyle {}\iff \sigma≦61.96\displaystyle {}\leqq \frac{6}{1.96}=3.061⋯\displaystyle {}= 3.061\cdots

よって σ\sigma の最大値は約 3.06 g‾\underline{3.06 \text{ g}} です。ばらつきを 44 g から約 3.063.06 g まで抑える必要があります。

自己採点:
記録を読み込み中…

問14 ★★

11 個のさいころを 720720 回投げ、11 の目が出る回数を XX とします。正規分布で近似し、正規分布表の値 p(0.5)p(0.5)=0.1915{}= 0.1915,p(2.0)p(2.0)=0.4772{}= 0.4772 を使って、確率 P(100≦X≦125)P(100 \leqq X \leqq 125) を求めなさい。

つまずいたときは:
答えを見る
答え

0.66870.6687

解説

XX は B(720, 16)B\left(720,\ \dfrac{1}{6}\right) に従うので

E(X)\displaystyle E(X)=720×16\displaystyle {}= 720 \times \frac{1}{6}=120,\displaystyle {}= 120,σ(X)\displaystyle \sigma(X)=720×16×56\displaystyle {}= \sqrt{720 \times \frac{1}{6} \times \frac{5}{6}}=100\displaystyle {}= \sqrt{100}=10\displaystyle {}= 10

ZZ=X−12010{}= \dfrac{X - 120}{10} は近似的に N(0, 1)N(0,\ 1) に従い、XX=100{}= 100,125125 はそれぞれ ZZ=−2{}= -2,0.50.5 です。

P(100≦X≦125)\displaystyle P(100 \leqq X \leqq 125)≒p(2.0)\displaystyle {}\fallingdotseq p(2.0)+p(0.5)\displaystyle {}+ p(0.5)=0.4772\displaystyle {}= 0.4772+0.1915\displaystyle {}+ 0.1915=0.6687‾\displaystyle {}= \underline{0.6687}
自己採点:
記録を読み込み中…

問15 ★★

確率変数 XX が正規分布 N(50, 82)N(50,\ 8^2) に従います。正規分布表の値 p(1.96)p(1.96)=0.4750{}= 0.4750 を使って、P(50−c≦X≦50+c)P(50 - c \leqq X \leqq 50 + c)=0.95{}= 0.95 となる正の数 cc の値を求めなさい。

つまずいたときは:
答えを見る
答え

cc=15.68{}= 15.68

解説

ZZ=X−508{}= \dfrac{X - 50}{8} とすると、範囲は −c8-\dfrac{c}{8}≦Z{}\leqq Z≦c8{}\leqq \dfrac{c}{8} です。対称性より

P(−c8≦Z≦c8)\displaystyle P\left(-\frac{c}{8} \leqq Z \leqq \frac{c}{8}\right)=2p(c8)\displaystyle {}= 2p\left(\frac{c}{8}\right)=0.95\displaystyle {}= 0.95

なので p(c8)p\left(\dfrac{c}{8}\right)=0.475{}= 0.475、よって c8\dfrac{c}{8}=1.96{}= 1.96 です。

c\displaystyle c=1.96×8\displaystyle {}= 1.96 \times 8=15.68‾\displaystyle {}= \underline{15.68}

「平均から標準偏差の 1.961.96 倍以内に 9595% が入る」という関係は、第9章の推定で何度も使います。

自己採点:
記録を読み込み中…

問16 ★★

硬貨を 25002500 回投げ、表が出た割合を RR とします。正規分布で近似し、正規分布表の値 p(2.0)p(2.0)=0.4772{}= 0.4772 を使って、確率 P(0.48≦R≦0.52)P(0.48 \leqq R \leqq 0.52) を求めなさい。

つまずいたときは:
答えを見る
答え

0.95440.9544

解説

表の回数を XX とすると、XX は B(2500, 12)B\left(2500,\ \dfrac{1}{2}\right) に従い、近似的に正規分布 N(1250, 252)N(1250,\ 25^2) に従います(2500×12×12\sqrt{2500 \times \frac{1}{2} \times \frac{1}{2}}=25{}= 25)。RR=X2500{}= \dfrac{X}{2500} は XX の 1 次式なので、公式4 の最後の性質より近似的に正規分布に従い

E(R)\displaystyle E(R)=12,\displaystyle {}= \frac{1}{2},σ(R)\displaystyle \sigma(R)=252500\displaystyle {}= \frac{25}{2500}=0.01\displaystyle {}= 0.01

です(第7章 公式4 の pqn\sqrt{\frac{pq}{n}}=110000{}= \sqrt{\frac{1}{10000}} とも一致)。ZZ=R−0.50.01{}= \dfrac{R - 0.5}{0.01} とすると、RR=0.48{}= 0.48,0.520.52 は ZZ=−2{}= -2,22 なので

P(0.48≦R≦0.52)\displaystyle P(0.48 \leqq R \leqq 0.52)≒2p(2.0)\displaystyle {}\fallingdotseq 2p(2.0)=0.9544‾\displaystyle {}= \underline{0.9544}
自己採点:
記録を読み込み中…

問17 ★★★

確率変数 XX のとる値の範囲が 00≦X{}\leqq X≦1{}\leqq 1 で、確率密度関数が f(x)f(x)=ax{}= ax+b{}+ b(aa,bb は定数)です。XX の期待値が 712\dfrac{7}{12} であるとき、aa,bb の値と、XX の分散を求めなさい。

つまずいたときは:
答えを見る
答え

aa=1{}= 1,bb=12{}= \dfrac{1}{2},分散 11144\dfrac{11}{144}

解説

全体の面積が 11、期待値が 712\dfrac{7}{12} なので

∫01(ax+b) dx\displaystyle \int_0^1 (ax + b)\,dx=a2\displaystyle {}= \frac{a}{2}+b\displaystyle {}+ b=1,\displaystyle {}= 1,∫01x(ax+b) dx\displaystyle \int_0^1 x(ax + b)\,dx=a3\displaystyle {}= \frac{a}{3}+b2\displaystyle {}+ \frac{b}{2}=712\displaystyle {}= \frac{7}{12}

1 つ目より bb=1{}= 1−a2{}- \dfrac{a}{2}。2 つ目に代入すると

a3\displaystyle \frac{a}{3}+12\displaystyle {}+ \frac{1}{2}−a4\displaystyle {}- \frac{a}{4}=712\displaystyle {}= \frac{7}{12}  ⟺  a12\displaystyle {}\iff \frac{a}{12}=112\displaystyle {}= \frac{1}{12}  ⟺  a\displaystyle {}\iff a=1\displaystyle {}= 1

よって a=1‾\underline{a = 1},b=12‾\underline{b = \dfrac{1}{2}} です。f(x)f(x)=x{}= x+12{}+ \dfrac{1}{2} は 00≦x{}\leqq x≦1{}\leqq 1 で正なので、確率密度関数の条件を満たします。

E(X2)\displaystyle E(X^2)=∫01x2(x+12)dx\displaystyle {}= \int_0^1 x^2\left(x + \frac{1}{2}\right)dx=14\displaystyle {}= \frac{1}{4}+16\displaystyle {}+ \frac{1}{6}=512\displaystyle {}= \frac{5}{12} V(X)\displaystyle V(X)=512\displaystyle {}= \frac{5}{12}−(712)2\displaystyle {}- \left(\frac{7}{12}\right)^2=60−49144\displaystyle {}= \frac{60 - 49}{144}=11144‾\displaystyle {}= \underline{\frac{11}{144}}
自己採点:
記録を読み込み中…

問18 ★★★

硬貨を nn 回投げ、表が出た割合を RR とします。RR を正規分布で近似し、正規分布表の値 p(1.96)p(1.96)=0.4750{}= 0.4750 を使って、P(0.49≦R≦0.51)P(0.49 \leqq R \leqq 0.51)≧0.95{}\geqq 0.95 となる最小の nn を求めなさい。

つまずいたときは:
答えを見る
答え

nn=9604{}= 9604

解説

RR は近似的に正規分布に従い、第7章 公式4 より

E(R)\displaystyle E(R)=12,\displaystyle {}= \frac{1}{2},σ(R)\displaystyle \sigma(R)=12×12n\displaystyle {}= \sqrt{\frac{\frac{1}{2} \times \frac{1}{2}}{n}}=12n\displaystyle {}= \frac{1}{2\sqrt{n}}

です。ZZ=R−0.5σ(R){}= \dfrac{R - 0.5}{\sigma(R)} とすると、0.490.49≦R{}\leqq R≦0.51{}\leqq 0.51 は ∣Z∣|Z|≦0.01σ(R){}\leqq \dfrac{0.01}{\sigma(R)}=0.02n{}= 0.02\sqrt{n} です。

P(∣Z∣≦0.02n)\displaystyle P(|Z| \leqq 0.02\sqrt{n})=2p(0.02n)\displaystyle {}= 2p(0.02\sqrt{n})≧0.95\displaystyle {}\geqq 0.95  ⟺  p(0.02n)\displaystyle {}\iff p(0.02\sqrt{n})≧0.475\displaystyle {}\geqq 0.475

p(u)p(u) は uu について増加し、p(1.96)p(1.96)=0.475{}= 0.475 なので

0.02n\displaystyle 0.02\sqrt{n}≧1.96\displaystyle {}\geqq 1.96  ⟺  n\displaystyle {}\iff \sqrt{n}≧98\displaystyle {}\geqq 98  ⟺  n\displaystyle {}\iff n≧9604\displaystyle {}\geqq 9604

よって最小の nn は 9604‾\underline{9604} です。割合のぶれを ±0.01\pm 0.01 に収めるには、約 11 万回も投げる必要があります。

自己採点:
記録を読み込み中…

問19 ★★★

確率変数 ZZ が標準正規分布 N(0, 1)N(0,\ 1) に従い、その確率密度関数を φ(z)\varphi(z)=12π e−z22{}= \dfrac{1}{\sqrt{2\pi}}\, e^{-\frac{z^2}{2}} とします。∣Z∣|Z| の期待値は、分布曲線の対称性から

E(∣Z∣)\displaystyle E(|Z|)=2lim⁡t→∞∫0tz φ(z) dz\displaystyle {}= 2\lim_{t \to \infty} \int_0^t z\,\varphi(z)\,dz

で与えられます。E(∣Z∣)E(|Z|) の値を求めなさい。

つまずいたときは:
答えを見る
答え

E(∣Z∣)E(|Z|)=2π{}= \sqrt{\dfrac{2}{\pi}}(約 0.7980.798)

解説

(e−z22)′\left(e^{-\frac{z^2}{2}}\right)'=−z e−z22{}= -z\,e^{-\frac{z^2}{2}} なので、z e−z22z\,e^{-\frac{z^2}{2}} の不定積分の 1 つは −e−z22-e^{-\frac{z^2}{2}} です(ss=z22{}= \frac{z^2}{2} と置換してもよい。微分積分の分野 第14章)。

∫0tz φ(z) dz\displaystyle \int_0^t z\,\varphi(z)\,dz=12π[ −e−z22 ]0t\displaystyle {}= \frac{1}{\sqrt{2\pi}}\Big[\,-e^{-\frac{z^2}{2}}\,\Big]_0^t=12π(1−e−t22)\displaystyle {}= \frac{1}{\sqrt{2\pi}}\left(1 - e^{-\frac{t^2}{2}}\right)

tt→∞{}\to \infty のとき e−t22e^{-\frac{t^2}{2}}→0{}\to 0 なので、極限は 12π\dfrac{1}{\sqrt{2\pi}} です。

E(∣Z∣)\displaystyle E(|Z|)=22π\displaystyle {}= \frac{2}{\sqrt{2\pi}}=2π‾\displaystyle {}= \underline{\sqrt{\frac{2}{\pi}}}≒0.798\displaystyle {}\fallingdotseq 0.798

∣Z∣|Z| は「平均からの離れ方」の平均(第3章 厳密定義の平均偏差)で、標準偏差 11 の約 0.80.8 倍になっています。

自己採点:
記録を読み込み中…

問20 ★★★

あるレストランでは、コース料理の予約を 400400 件受けています。予約した人は、それぞれ確率 0.80.8 で来店し、互いに影響しないものとします。料理を ss 人分用意するとき、来店した人数が ss 人を超える確率を 0.0250.025 以下にしたいと考えます。来店人数を正規分布で近似し、正規分布表の値 p(1.96)p(1.96)=0.4750{}= 0.4750 を使って、ss の最小値(整数)を求めなさい。

つまずいたときは:
答えを見る
答え

ss=336{}= 336

解説

来店人数を XX とすると、XX は B(400, 0.8)B(400,\ 0.8) に従います。

E(X)\displaystyle E(X)=400×0.8\displaystyle {}= 400 \times 0.8=320,\displaystyle {}= 320,σ(X)\displaystyle \sigma(X)=400×0.8×0.2\displaystyle {}= \sqrt{400 \times 0.8 \times 0.2}=64\displaystyle {}= \sqrt{64}=8\displaystyle {}= 8

ZZ=X−3208{}= \dfrac{X - 320}{8} は近似的に N(0, 1)N(0,\ 1) に従います。

P(X>s)\displaystyle P(X > s)≒P(Z>s−3208)\displaystyle {}\fallingdotseq P\left(Z > \frac{s - 320}{8}\right)=0.5\displaystyle {}= 0.5−p(s−3208)\displaystyle {}- p\left(\frac{s - 320}{8}\right)

これが 0.0250.025 以下 ⇔ p(s−3208)p\left(\dfrac{s - 320}{8}\right)≧0.475{}\geqq 0.475 ⇔ s−3208\dfrac{s - 320}{8}≧1.96{}\geqq 1.96 です(p(u)p(u) は増加)。

s\displaystyle s≧320\displaystyle {}\geqq 320+1.96×8\displaystyle {}+ 1.96 \times 8=335.68\displaystyle {}= 335.68

ss は整数なので、最小値は s=336‾\underline{s = 336} です。期待値の 320320 人分だけ用意すると、足りなくなる確率は約 0.50.5 にもなります。

自己採点:
記録を読み込み中…

数学小話コーナー

お札に印刷された釣り鐘形の曲線

ドイツがユーロに切りかえる前に使っていた 10 マルク紙幣(1990 年代に発行されたもの)には、数学者カール・フリードリヒ・ガウスの肖像と並んで、この章の正規分布の曲線と、その式が印刷されていました。数式とグラフがのったお札は、世界的にも珍しいものです。

ガウスがこの曲線にたどり着いたのは、天体観測の「誤差」を調べる中でした。同じ星の位置を何度測っても、値は少しずつばらつきます。ガウスは 1809 年の天体力学の本で、「何度も測った値の平均値が、最ももっともらしい値になる」という前提を置くと、誤差の分布は e−kx2e^{-kx^2} の形の曲線になるはずだ、と論じました(二次関数の分野の小話で紹介した小惑星の軌道計算も、この本にまとめられています)。

このため、正規分布はいまでもガウス分布と呼ばれ、分布曲線は「誤差曲線」とも呼ばれてきました。小さな誤差ほど起こりやすく、大きな誤差ほど起こりにくく、プラスとマイナスの誤差は同じように起こる。公式3 の「左右対称で、中心から離れるほど低くなる」という性質は、まさに測定の誤差の性質そのものです。その直後に、フランスのラプラスが「小さな独立な誤差がたくさん足し合わさると、この形になる」ことを示し、曲線は誤差以外の多くの場面で使われるようになりました(厳密定義のページの中心極限定理)。

豆知識

「正規(normal)」という名前は、19 世紀の後半に何人かの研究者が使い始めたもので、「ふつうの・標準の」という意味です(最初に使った人には諸説あり)。広めた一人のカール・ピアソンは後に、この名前のせいで、ほかの分布が「異常(abnormal)」だと誤解されかねない、と書いています。英語では形から bell curve(釣り鐘の曲線)とも呼ばれます。

パンの重さを 1 年間量り続けた数学者

フランスの数学者アンリ・ポアンカレには、こんな逸話が伝わっています(※実話かどうかは確かめられておらず、作り話ともいわれます)。

ポアンカレは、行きつけのパン屋で「1 kg」として売られているパンを、毎日買って重さを量り、記録していました。1 年たって記録をまとめると、重さはきれいな釣り鐘形に分布していましたが、その中心は 10001000 g ではなく 950950 g のあたりでした。パンの重さは焼き方で多少ばらつくものの、パン屋が最初から軽めに作っていたわけです。ポアンカレはこれを警察に届け出て、パン屋は注意を受けました。

話には続きがあります。その後もポアンカレは量り続けました。するとパンは 10001000 g を超えるものが多くなりましたが、今度は分布の形がおかしかったのです。釣り鐘形の左側が切り取られたように、軽いパンがほとんどありません。パン屋は相変わらず軽めのパンを焼き続け、ポアンカレが来たときだけ、店にある中からいちばん重いパンを選んで渡していた、というのがポアンカレの見立てでした。

平均値だけを見ていたら、2 回目の不正は見抜けません。ヒストグラムの形が正規分布の左右対称からずれていることが、決め手になったのです。第4章の小話の「まず絵を見よ」と同じ教訓が、ここにもあります。

豆知識

日本では、袋に入った食パンの「1 斤」は、業界の公正競争規約で「340 g 以上」と決められています。1 個ずつの重さにはどうしてもばらつきが出るので、作る側は、ばらつきを見込んで少し重めを狙う必要があります。例えば重さの標準偏差が 55 g なら、平均を 350350 g にしておくと、340340 g を下回るのは平均から 2σ2\sigma 以上軽いパンで、公式3 からおよそ 2.32.3% の見込みです。

工場の見張り役「管理図」と 3σ

工場で同じ製品を作り続けていると、重さや寸法は少しずつばらつきます。このばらつきの中には、材料や温度のわずかな違いによる「いつものばらつき」と、機械の故障や部品の摩耗のような「異常による変化」が混ざっています。この 2 つを見分けるために考えられたのが管理図です。

考案したのは、アメリカのベル研究所の技術者ウォルター・シューハートです。1924 年、彼は上司にあてたメモの中で、最初の管理図を示したといわれています。やり方はシンプルで、毎日の測定値をグラフに点として打っていき、平均の線と、平均から標準偏差の 33 倍離れた上下の線(管理限界)を引いておくだけです。

測定値が正規分布に従っているなら、公式3 より mm±3σ{}\pm 3\sigma の外に出る確率は約 0.0030.003、つまりおよそ 370370 回に 1 回しかありません。点が管理限界の外に出たら、「いつものばらつき」ではなく何か異常が起きたと考えて、機械を止めて原因を調べます。線を 2σ2\sigma にすると、正常なのに約 2020 回に 1 回も機械を止めることになり、無駄な点検が増えます。3σ3\sigma は、見逃しと空振りのバランスをとった経験的な選択でした。

豆知識

シューハートの考え方を学んだ統計学者エドワーズ・デミングは、1950 年に日本科学技術連盟に招かれて、日本の技術者や経営者に統計的な品質管理を講義しました。翌 1951 年には、その功績をたたえてデミング賞が設けられ、いまも品質管理に優れた企業や個人に贈られています。

厳密定義(発展)

※ここは発展ページです。離散型の確率変数の期待値・分散・独立は第6章の厳密定義、二項分布は第7章の厳密定義で扱いました。ここでは、値が切れ目なく変わる確率変数を定積分で定め、正規分布の確率密度関数の全体の面積が 11 になること(ガウス積分)、期待値が mm・分散が σ2\sigma^2 になることを証明します。最後に、二項分布を正規分布で近似する定理と、その近似をよくする工夫を紹介します。積分の計算は微分積分の分野 第8・14章の範囲を使います。

広義積分

正規分布はすべての実数値をとるので、無限に広い範囲での積分が必要です。

定義1:広義積分

関数 f(x)f(x) が xx≧a{}\geqq a で連続であり、極限 lim⁡t→∞∫atf(x) dx\displaystyle\lim_{t \to \infty} \int_a^t f(x)\,dx が有限の値として存在するとき、その値を

∫a∞f(x) dx\int_a^{\infty} f(x)\,dx

と書く。∫−∞af(x) dx\displaystyle\int_{-\infty}^{a} f(x)\,dx も同様に定める。両方が存在するとき ∫−∞∞f(x) dx\displaystyle \int_{-\infty}^{\infty} f(x)\,dx=∫−∞af(x) dx\displaystyle {}= \int_{-\infty}^{a} f(x)\,dx+∫a∞f(x) dx\displaystyle {}+ \int_{a}^{\infty} f(x)\,dx と定める(aa の選び方によらない)。

実践 問19 の lim⁡t→∞∫0tz φ(z) dz\displaystyle\lim_{t \to \infty}\int_0^t z\,\varphi(z)\,dz は、この記号で ∫0∞z φ(z) dz\displaystyle\int_0^{\infty} z\,\varphi(z)\,dz と書けます。

連続型確率変数

定義2:確率密度関数と分布関数

区間 II(実数全体でもよい)で連続な関数 f(x)f(x) が

f(x)\displaystyle f(x)≧0\displaystyle {}\geqq 0(x∈I),\displaystyle (x \in I),∫If(x) dx\displaystyle \int_I f(x)\,dx=1\displaystyle {}= 1

を満たすとき、ff を II 上の確率密度関数という。確率変数 XX が、II に含まれるすべての aa≦b{}\leqq b について

P(a≦X≦b)\displaystyle P(a \leqq X \leqq b)=∫abf(x) dx\displaystyle {}= \int_a^b f(x)\,dx

を満たすとき、XX を確率密度関数 ff をもつ連続型確率変数という。また、F(x)F(x)=P(X≦x){}= P(X \leqq x) を XX の分布関数(累積分布関数)という。

確率変数を「標本空間の上の関数」として厳密に定めるには、無限個の結果を扱う確率論(測度論)が必要になるので、ここでは上の性質をもつものとして話を進めます。

定理1:分布関数の性質

XX が II=[α, β]{}= [\alpha,\ \beta] 上の確率密度関数 ff をもつとき、次が成り立つ。

(1) すべての aa∈I{}\in I で P(X=a)P(X = a)=0{}= 0。したがって P(a≦X≦b)P(a \leqq X \leqq b)=P(a<X<b){}= P(a < X < b)

(2) II 上で F(x)=∫αxf(t) dtF(x) = \displaystyle\int_\alpha^x f(t)\,dt であり、FF は増加関数(広い意味)で、F′(x)F'(x)=f(x){}= f(x)

証明 (1) 幅が 00 の区間を考えると

P(X=a)\displaystyle P(X = a)=P(a≦X≦a)\displaystyle {}= P(a \leqq X \leqq a)=∫aaf(x) dx\displaystyle {}= \int_a^a f(x)\,dx=0\displaystyle {}= 0

である。P(a≦X≦b)P(a \leqq X \leqq b)=P(X=a){}= P(X = a)+P(a<X<b){}+ P(a < X < b)+P(X=b){}+ P(X = b) から後半が従う。

(2) XX は II の外の値をとらないので

F(x)\displaystyle F(x)=P(α≦X≦x)\displaystyle {}= P(\alpha \leqq X \leqq x)=∫αxf(t) dt\displaystyle {}= \int_\alpha^x f(t)\,dt

である。xx<y{}< y なら F(y)−F(x)=∫xyf(t) dt≧0F(y) - F(x) = \displaystyle\int_x^y f(t)\,dt \geqq 0。F′(x)F'(x)=f(x){}= f(x) は、微分積分の分野 第8章の「定積分で表された関数の微分」そのものである。(証明終)

(2) から、確率密度関数は分布関数の導関数、つまり「確率が xx のまわりでどれだけの速さで増えるか」だと分かります。本文の「密度」という言葉は、この意味です。

期待値と分散

定義3:連続型確率変数の期待値と分散

XX が II 上の確率密度関数 ff をもつとき

E(X)\displaystyle E(X)=∫Ixf(x) dx,\displaystyle {}= \int_I x f(x)\,dx,V(X)\displaystyle V(X)=∫I(x−m)2f(x) dx\displaystyle {}= \int_I (x - m)^2 f(x)\,dx(m=E(X))\displaystyle (m = E(X))

と定める(II が無限に広いときは、広義積分が存在する場合に限る)。一般に、連続関数 gg について E(g(X))=∫Ig(x)f(x) dxE(g(X)) = \displaystyle\int_I g(x) f(x)\,dx とする。

定理2:1 次式の変換

XX が II 上の確率密度関数 ff をもち、aa≠0{}\neq 0,bb を定数、YY=aX{}= aX+b{}+ b とする。

(1) E(Y)E(Y)=aE(X){}= aE(X)+b{}+ b,V(Y)V(Y)=a2V(X){}= a^2 V(X),V(X)V(X)=E(X2){}= E(X^2)−{E(X)}2{}- \{E(X)\}^2

(2) YY は連続型確率変数で、その確率密度関数は g(y)g(y)=1∣a∣ f ⁣(y−ba){}= \dfrac{1}{|a|}\, f\!\left(\dfrac{y - b}{a}\right) である

証明 (1) 積分の線形性と ∫If(x) dx\displaystyle \int_I f(x)\,dx=1\displaystyle {}= 1 から、第6章 定理1・定理2 の証明の ∑\sum を ∫\int に置きかえて同じ計算で得られる。

(2) aa>0{}> 0 のとき、cc≦d{}\leqq d に対して、yy=ax{}= ax+b{}+ b と置換すると

P(c≦Y≦d)\displaystyle P(c \leqq Y \leqq d)=P(c−ba≦X≦d−ba)\displaystyle {}= P\left(\frac{c - b}{a} \leqq X \leqq \frac{d - b}{a}\right)=∫c−bad−baf(x) dx\displaystyle {}= \int_{\frac{c-b}{a}}^{\frac{d-b}{a}} f(x)\,dx=∫cdf ⁣(y−ba)1a dy\displaystyle {}= \int_c^d f\!\left(\frac{y - b}{a}\right)\frac{1}{a}\,dy

aa<0{}< 0 のときは不等号の向きが入れかわり、置換で積分の上端と下端が逆になるので、1a\dfrac{1}{a} が 1∣a∣\dfrac{1}{|a|} に替わる。(証明終)

ガウス積分

正規分布の確率密度関数の全体の面積が 11 になることは、次の定理にもとづきます。

定理3:ガウス積分
∫0∞e−x2 dx\displaystyle \int_0^{\infty} e^{-x^2}\,dx=π2,\displaystyle {}= \frac{\sqrt{\pi}}{2},∫−∞∞e−x22 dx\displaystyle \int_{-\infty}^{\infty} e^{-\frac{x^2}{2}}\,dx=2π\displaystyle {}= \sqrt{2\pi}

証明 e−x2e^{-x^2} の不定積分は知っている関数で書けないので、不等式ではさみうちにする。

① 2 つの不等式 すべての実数 tt で ete^{t}≧1{}\geqq 1+t{}+ t である(h(t)h(t)=et{}= e^t−1{}- 1−t{}- t は tt=0{}= 0 で最小値 00)。tt=−s{}= -s として e−se^{-s}≧1{}\geqq 1−s{}- s、また tt=s{}= s として e−se^{-s}≦11+s{}\leqq \dfrac{1}{1 + s}(ss>−1{}> -1)。nn を 22 以上の整数とし、ss=x2n{}= \dfrac{x^2}{n} を代入して nn 乗すると

(1−x2n)n\displaystyle \left(1 - \frac{x^2}{n}\right)^n≦e−x2\displaystyle {}\leqq e^{-x^2}(0≦x≦n),\displaystyle (0 \leqq x \leqq \sqrt{n}),e−x2\displaystyle e^{-x^2}≦(1+x2n)−n\displaystyle {}\leqq \left(1 + \frac{x^2}{n}\right)^{-n}(x≧0)\displaystyle (x \geqq 0)

(左の不等式は両辺が 00 以上の範囲で nn 乗している)。e−x2e^{-x^2}>0{}> 0 なので

∫0n(1−x2n)ndx\displaystyle \int_0^{\sqrt{n}} \left(1 - \frac{x^2}{n}\right)^n dx≦∫0∞e−x2 dx\displaystyle {}\leqq \int_0^{\infty} e^{-x^2}\,dx≦∫0∞(1+x2n)−ndx\displaystyle {}\leqq \int_0^{\infty} \left(1 + \frac{x^2}{n}\right)^{-n} dx

(右の 2 つの広義積分が存在することは、00<e−x2{}< e^{-x^2}≦(1+x2n)−n{}\leqq \left(1 + \frac{x^2}{n}\right)^{-n}≦11+x2{}\leqq \frac{1}{1 + x^2} と、∫0t\int_0^t が tt について増加し上に有界であることから分かる)。

② 置換 Jk=∫0π2cos⁡kθ dθJ_k = \displaystyle\int_0^{\frac{\pi}{2}} \cos^k\theta\,d\theta とおく。左の積分で xx=nsin⁡θ{}= \sqrt{n}\sin\theta とおくと 11−x2n{}- \frac{x^2}{n}=cos⁡2θ{}= \cos^2\theta,dxdx=ncos⁡θ dθ{}= \sqrt{n}\cos\theta\,d\theta なので、左辺は n J2n+1\sqrt{n}\,J_{2n+1}。右の積分で xx=ntan⁡θ{}= \sqrt{n}\tan\theta とおくと 11+x2n{}+ \frac{x^2}{n}=1cos⁡2θ{}= \frac{1}{\cos^2\theta},dxdx=ncos⁡2θ dθ{}= \frac{\sqrt{n}}{\cos^2\theta}\,d\theta なので、右辺は n J2n−2\sqrt{n}\,J_{2n-2}(tt→∞{}\to \infty は θ\theta→π2{}\to \frac{\pi}{2} に対応)。

③ ワリスの積分 θ\theta を π2\frac{\pi}{2}−θ{}- \theta に置換すると、JkJ_k は微分積分の分野 第14章 実践 問20 の Ik=∫0π2sin⁡kx dxI_k = \displaystyle\int_0^{\frac{\pi}{2}} \sin^k x\,dx と等しく、JkJ_k=k−1kJk−2{}= \dfrac{k-1}{k}J_{k-2} を満たす。すると kJkJk−1kJ_kJ_{k-1}=(k−1)Jk−1Jk−2{}= (k-1)J_{k-1}J_{k-2} なので、kJkJk−1kJ_kJ_{k-1} は kk によらず 1⋅J1J01 \cdot J_1 J_0=π2{}= \dfrac{\pi}{2} に等しい。00≦cos⁡θ{}\leqq \cos\theta≦1{}\leqq 1 より JkJ_k は kk について減少するので

π2\displaystyle \frac{\pi}{2}=kJkJk−1\displaystyle {}= kJ_kJ_{k-1}≧kJk2,\displaystyle {}\geqq kJ_k^2,π2\displaystyle \frac{\pi}{2}=(k+1)Jk+1Jk\displaystyle {}= (k+1)J_{k+1}J_k≦(k+1)Jk2\displaystyle {}\leqq (k+1)J_k^2

よって kk+1⋅π2\dfrac{k}{k+1}\cdot\dfrac{\pi}{2}≦kJk2{}\leqq kJ_k^2≦π2{}\leqq \dfrac{\pi}{2} となり、はさみうちの原理より kJk2kJ_k^2→π2{}\to \dfrac{\pi}{2}(kk→∞{}\to \infty)。したがって

(n J2n+1)2\displaystyle \left(\sqrt{n}\,J_{2n+1}\right)^2=n2n+1(2n+1)J2n+12\displaystyle {}= \frac{n}{2n+1}(2n+1)J_{2n+1}^2→12⋅π2,\displaystyle {}\to \frac{1}{2}\cdot\frac{\pi}{2},(n J2n−2)2\displaystyle \left(\sqrt{n}\,J_{2n-2}\right)^2=n2n−2(2n−2)J2n−22\displaystyle {}= \frac{n}{2n-2}(2n-2)J_{2n-2}^2→12⋅π2\displaystyle {}\to \frac{1}{2}\cdot\frac{\pi}{2}

①の両端はどちらも π2\dfrac{\sqrt{\pi}}{2} に収束するので、はさみうちの原理より前半の式を得る。

後半は、e−x22e^{-\frac{x^2}{2}} が偶関数であることと、xx=2 u{}= \sqrt{2}\,u の置換により 2×2×π22 \times \sqrt{2} \times \dfrac{\sqrt{\pi}}{2}=2π{}= \sqrt{2\pi}。(証明終)

大学では、2 重積分と極座標を使って、(∫e−x2dx)2\left(\int e^{-x^2}dx\right)^2 を平面全体の積分に直す数行の証明を学びます。正規分布の式に π\pi が現れるのは、この「円」が隠れているからです。

正規分布の性質

定義4:正規分布

mm∈R{}\in \mathbb{R},σ\sigma>0{}> 0 とする。実数全体の上の確率密度関数

f(x)\displaystyle f(x)=12π σ e−(x−m)22σ2\displaystyle {}= \frac{1}{\sqrt{2\pi}\,\sigma}\, e^{-\frac{(x - m)^2}{2\sigma^2}}

をもつ連続型確率変数の分布を正規分布 N(m, σ2)N(m,\ \sigma^2) という。N(0, 1)N(0,\ 1) を標準正規分布、その確率密度関数を φ(z)\varphi(z)=12πe−z22{}= \dfrac{1}{\sqrt{2\pi}}e^{-\frac{z^2}{2}} と書く。

f(x)f(x)>0{}> 0 は明らかで、xx=m{}= m+σz{}+ \sigma z と置換すると ∫−∞∞f(x) dx\displaystyle \int_{-\infty}^{\infty} f(x)\,dx=∫−∞∞φ(z) dz\displaystyle {}= \int_{-\infty}^{\infty} \varphi(z)\,dz=1\displaystyle {}= 1 となります(定理3)。したがって定義4 の ff は確かに確率密度関数です。

定理4:正規分布の期待値と分散

XX が N(m, σ2)N(m,\ \sigma^2) に従うとき、E(X)E(X)=m{}= m,V(X)V(X)=σ2{}= \sigma^2 である。また、ZZ=X−mσ{}= \dfrac{X - m}{\sigma} は N(0, 1)N(0,\ 1) に従い、一般に aXaX+b{}+ b(aa≠0{}\neq 0)は N(am+b, a2σ2)N(am + b,\ a^2\sigma^2) に従う。

証明 まず ZZ について。定理2 (2) で aa=1σ{}= \frac{1}{\sigma},bb=−mσ{}= -\frac{m}{\sigma} とすると、ZZ の確率密度関数は σf(m+σz)\sigma f(m + \sigma z)=φ(z){}= \varphi(z) となる。aXaX+b{}+ b についても同様に、確率密度関数は

1∣a∣⋅12π σ e−(y−ba−m)22σ2\displaystyle \frac{1}{|a|}\cdot\frac{1}{\sqrt{2\pi}\,\sigma}\, e^{-\frac{\left(\frac{y-b}{a} - m\right)^2}{2\sigma^2}}=12π ∣a∣σ e−(y−(am+b))22a2σ2\displaystyle {}= \frac{1}{\sqrt{2\pi}\,|a|\sigma}\, e^{-\frac{(y - (am + b))^2}{2a^2\sigma^2}}

で、これは N(am+b, a2σ2)N(am + b,\ a^2\sigma^2) の確率密度関数である。

次に E(Z)E(Z)=0{}= 0,V(Z)V(Z)=1{}= 1 を示す。実践 問19 と同じ計算で ∫0∞zφ(z) dz\displaystyle \int_0^{\infty} z\varphi(z)\,dz=12π\displaystyle {}= \frac{1}{\sqrt{2\pi}} が存在し、zφ(z)z\varphi(z) は奇関数なので ∫−∞0zφ(z) dz\displaystyle \int_{-\infty}^0 z\varphi(z)\,dz=−12π\displaystyle {}= -\frac{1}{\sqrt{2\pi}}。よって E(Z)E(Z)=0{}= 0。

E(Z2)E(Z^2) は、z2φ(z)z^2\varphi(z)=z⋅zφ(z){}= z \cdot z\varphi(z),{−φ(z)}′\{-\varphi(z)\}'=zφ(z){}= z\varphi(z) として部分積分すると

∫0tz2φ(z) dz\displaystyle \int_0^t z^2\varphi(z)\,dz=[ −zφ(z) ]0t\displaystyle {}= \Big[\,-z\varphi(z)\,\Big]_0^t+∫0tφ(z) dz\displaystyle {}+ \int_0^t \varphi(z)\,dz=−tφ(t)\displaystyle {}= -t\varphi(t)+∫0tφ(z) dz\displaystyle {}+ \int_0^t \varphi(z)\,dz

tt→∞{}\to \infty で tφ(t)t\varphi(t)=12π⋅tet2/2{}= \dfrac{1}{\sqrt{2\pi}}\cdot\dfrac{t}{e^{t^2/2}}→0{}\to 0(微分積分の分野 第12章の大切な極限)、∫0tφ\displaystyle \int_0^t \varphi→12\displaystyle {}\to \frac{1}{2} なので、∫0∞z2φ(z) dz\displaystyle \int_0^\infty z^2\varphi(z)\,dz=12\displaystyle {}= \frac{1}{2}。偶関数なので E(Z2)E(Z^2)=1{}= 1、V(Z)V(Z)=1{}= 1−02{}- 0^2=1{}= 1。

最後に XX=m{}= m+σZ{}+ \sigma Z なので、定理2 (1) より E(X)E(X)=m{}= m,V(X)V(X)=σ2{}= \sigma^2。(証明終)

定理5:分布曲線の形

N(m, σ2)N(m,\ \sigma^2) の確率密度関数 f(x)f(x) について

(1) f(m+h)f(m + h)=f(m−h){}= f(m - h)(直線 xx=m{}= m について対称)

(2) ff は xx<m{}< m で増加、xx>m{}> m で減少し、xx=m{}= m で最大値 12π σ\dfrac{1}{\sqrt{2\pi}\,\sigma} をとる

(3) 変曲点は xx=m{}= m±σ{}\pm \sigma の 2 点

(4) lim⁡x→±∞f(x)\displaystyle \lim_{x \to \pm\infty} f(x)=0\displaystyle {}= 0

証明 uu=x−mσ{}= \dfrac{x - m}{\sigma},CC=12π σ{}= \dfrac{1}{\sqrt{2\pi}\,\sigma} とおくと ff=Ce−u2/2{}= Ce^{-u^2/2}。(1)(4) は明らか。

f′(x)\displaystyle f'(x)=−Cσ u e−u22,\displaystyle {}= -\frac{C}{\sigma}\,u\,e^{-\frac{u^2}{2}},f′′(x)\displaystyle f''(x)=Cσ2 (u2−1) e−u22\displaystyle {}= \frac{C}{\sigma^2}\,(u^2 - 1)\,e^{-\frac{u^2}{2}}

f′f' の符号は −u-u の符号なので (2) が成り立つ。f′′f'' の符号は u2u^2−1{}- 1 の符号で、uu=±1{}= \pm 1 の前後で変わるので (3) が成り立つ。(証明終)

(3) から、標準偏差 σ\sigma は「山の中心から、カーブの曲がり方が切りかわる点までの距離」として、グラフの上で見ることができます。本文の fig02 で σ\sigma が大きいほど山がなだらかに見えるのはこのためです。

本文の「mm±σ{}\pm \sigma で約 0.6830.683」などの値は、2∫0kφ(z) dz2\displaystyle\int_0^k \varphi(z)\,dz(kk=1,{}= 1, 2,\ 2, 3\ 3)を数値計算した 0.68270.6827,0.95450.9545,0.99730.9973 を丸めたものです。第6章 定理6(チェビシェフの不等式)は、どんな分布でも「2σ2\sigma 以上離れる確率は 14\frac{1}{4} 以下」としか言えませんでしたが、正規分布と分かっていれば約 0.0460.046 と、ずっと鋭く言えます。

二項分布の近似と半整数補正

定理6:ド・モアブル=ラプラスの定理

00<p{}< p<1{}< 1 を固定し、XnX_n が二項分布 B(n, p)B(n,\ p) に従うとする。qq=1{}= 1−p{}- p とすると、すべての実数 aa<b{}< b について

lim⁡n→∞P(a≦Xn−npnpq≦b)\displaystyle \lim_{n \to \infty} P\left(a \leqq \frac{X_n - np}{\sqrt{npq}} \leqq b\right)=∫abφ(z) dz\displaystyle {}= \int_a^b \varphi(z)\,dz

が成り立つ。

証明には、nCk{}_n\mathrm{C}_k の大きさを n!n! の近似式(スターリングの公式。微分積分の分野 第15章の小話)で評価する計算が必要で、この本では省略します。本文の公式6 は、この定理を「nn が大きいとき」の近似として使ったものです。

XnX_n は整数値しかとらないので、P(X=k)P(X = k) を「kk−12{}- \frac{1}{2} から kk+12{}+ \frac{1}{2} までの幅 11 の柱」の面積と見ると(本文 fig05)、曲線で置きかえるときは柱の端までを積分するほうが自然です。aa,bb を整数とすると

P(a≦X≦b)\displaystyle P(a \leqq X \leqq b)≒P(a−12−npnpq≦Z\displaystyle {}\fallingdotseq P\biggl(\frac{a - \frac{1}{2} - np}{\sqrt{npq}} \leqq Z≦b+12−npnpq)\displaystyle {}\qquad\quad \leqq \frac{b + \frac{1}{2} - np}{\sqrt{npq}}\biggr)

これを半整数補正(連続修正)といいます。本文の例で比べると、次のようになります。

二項分布と範囲正確な値補正なし半整数補正
B(20, 12)B(20,\ \frac{1}{2}),6≦X≦146 \leqq X \leqq 140.95860.95860.92640.92640.95580.9558
B(400, 12)B(400,\ \frac{1}{2}),X≧220X \geqq 220(例題6)0.02550.02550.02280.02280.02560.0256
B(400, 12)B(400,\ \frac{1}{2}),190≦X≦215190 \leqq X \leqq 215(例題6)0.79260.79260.77450.77450.79260.7926

(「補正なし」は端の値 aa,bb をそのまま標準化したもの。値は小数第5位を四捨五入。)

nn=20{}= 20 では補正なしのずれが目立ちますが、補正を入れると nn=20{}= 20 でも小数第2位まで合います。nn が大きくなるほど柱の幅 11 は npq\sqrt{npq} にくらべて小さくなるので、補正の有無の差は小さくなります。高校の教科書では補正なしで計算するのがふつうで、この章の問題も補正なしで答えています。

中心極限定理と次の章へ

定理6 は、XnX_n が「00 か 11 をとる独立な確率変数 nn 個の和」(第7章 定義1)であることから、次の大きな定理の特別な場合になっています。

定理7:中心極限定理(証明は省略)

X1,X_1, X2,\ X_2, …\ \ldots が互いに独立で、どれも同じ分布に従い、期待値 mm,分散 σ2\sigma^2(>0> 0)をもつとする。SnS_n=X1{}= X_1+⋯{}+ \cdots+Xn{}+ X_n とすると、すべての aa<b{}< b について

lim⁡n→∞P(a≦Sn−nmσn≦b)\displaystyle \lim_{n \to \infty} P\left(a \leqq \frac{S_n - nm}{\sigma\sqrt{n}} \leqq b\right)=∫abφ(z) dz\displaystyle {}= \int_a^b \varphi(z)\,dz

が成り立つ。

もとの分布がさいころの目でも、第6章のバスの所要時間でも、独立にたくさん足し合わせると、標準化した和は標準正規分布に近づきます。第6章の小話で見た「さいころの個数を増やすと和の分布が釣り鐘形になる」現象の正体で、小話 kb1 のラプラスが示したのもこの定理の原型です。

SnS_n を nn で割った X‾\overline{X}=Snn{}= \dfrac{S_n}{n} で書き直すと、X‾−mσ/n\dfrac{\overline{X} - m}{\sigma/\sqrt{n}} が近似的に N(0, 1)N(0,\ 1) に従う、ということになります(E(X‾)E(\overline{X})=m{}= m,σ(X‾)\sigma(\overline{X})=σn{}= \frac{\sigma}{\sqrt{n}} は第6章 定理5)。また、もとの分布が正規分布なら、nn によらず X‾\overline{X} はちょうど正規分布 N(m, σ2n)N\left(m,\ \frac{\sigma^2}{n}\right) に従うことが知られています(独立な正規分布の和は正規分布になる、という再生性。証明は大学で学びます)。

第9章では、この X‾\overline{X} を「標本平均」と呼び、実践 問15 の「1.961.96 倍以内に 9595%」を使って、一部のデータから全体の平均を推定する方法を学びます。

この章の学習が終わったら

学習完了テストを受ける