M5.0 15 分鐘閱讀 2026年9月

M5.0 保險為什麼存在:Convex Function 與 Jensen 不等式

本篇重用M1.1從鞋子猜身高:Conditional Expectation·M0.2導航的三十秒:Taylor 展開與「假設直線」

一筆穩賠的交易

你一年付 6,000 元的機車險。保險公司的資料說:像你這樣的騎士,一年裡有 2% 的機率出一次事故、平均賠 20 萬,其他 98% 什麼事也沒有。算一下期望損失:0.02×200,000=4,0000.02\times200{,}000=4{,}000 元。你付 6,000,拿回的期望值是 4,000——平均而言你每年虧 2,000,保險公司每年賺 2,000。

這筆交易對雙方都是自願的,而且幾百年來一直存在。請先用直覺回答:一筆平均讓你虧錢的交易,你為什麼還是買?寫下你有多確定、依據是什麼。

課堂上的回答大致是「因為我怕」「因為 20 萬我付不出來」「因為安心」。這些都對,但它們說不出為什麼「怕」可以值 2,000 元、而不是 200 元或 20,000 元——也說不出保險公司為什麼不怕。這一篇要把「怕」寫成一條曲線的形狀,然後那個 2,000 元就會有一個數學位置。

課堂提問Q1

翻成數學。這裡的隨機變數是什麼?「你在意的東西」是它的哪個函數?「平均虧 2,000」比較的是哪兩個量——而它漏掉了哪個量?

先想一想,再展開看整理後的答案

隨機變數是你的年度損失 XX:以 0.98 的機率是 0,以 0.02 的機率是 200,000。E[X]=4,000\mathbb E[X]=4{,}000

「平均虧 2,000」比較的是保費 6,000 與 E[X]\mathbb E[X]。這個比較假設你在意的是金額本身。但你在意的其實是金額對你生活的影響——損失 20 萬對一個存款 30 萬的人,不是損失 2 萬的十倍那麼糟,而是糟得不成比例:要借錢、要賣東西、可能失去工作。把「有多糟」寫成一個函數 φ(x)\varphi(x):損失 xx 元帶來的痛苦。這個函數的特徵是越虧越痛、而且痛得越來越快——每多虧一萬元,增加的痛苦比前一萬元更多。

所以你真正比較的不是 6,0006{,}000E[X]\mathbb E[X],而是兩種痛苦:確定付 6,000 的痛苦 φ(6,000)\varphi(6{,}000),對上不買保險時的期望痛苦 E[φ(X)]=0.98φ(0)+0.02φ(200,000)\mathbb E[\varphi(X)]=0.98\,\varphi(0)+0.02\,\varphi(200{,}000)

漏掉的量就是 E[φ(X)]\mathbb E[\varphi(X)]φ(E[X])\varphi(\mathbb E[X]) 的差。「平均虧 2,000」只算了 φ(E[X])\varphi(\mathbb E[X]) 附近的事——它把痛苦當成線性的。

先抓住這個畫面:弦在曲線上方

φ\varphi 的圖:橫軸是損失,縱軸是痛苦。「越虧越痛、痛得越來越快」讓這條曲線往上彎,像一個碗。

在曲線上取兩個點:(0,φ(0))(0,\varphi(0))(200,000,φ(200,000))(200{,}000,\varphi(200{,}000)),用一條直線(弦)連起來。弦上橫座標 4,0004{,}000 的那個點——也就是從左端點往右走 2% 的位置——高度正是 0.98φ(0)+0.02φ(200,000)=E[φ(X)]0.98\,\varphi(0)+0.02\,\varphi(200{,}000)=\mathbb E[\varphi(X)]。而曲線上橫座標 4,0004{,}000 的點是 φ(4,000)=φ(E[X])\varphi(4{,}000)=\varphi(\mathbb E[X])

碗往上彎,所以弦在曲線上方E[φ(X)]φ(E[X])\mathbb E[\varphi(X)]\ge\varphi(\mathbb E[X])。「不買保險的期望痛苦」比「確定損失 4,000 的痛苦」高。高出多少,就是弦與曲線在 x=4,000x=4{,}000 處的垂直距離——曲線彎得越厲害、兩個端點拉得越開,這段距離越長。

你願意多付的那 2,000 元,就是把這段垂直距離換成錢:只要 φ(6,000)E[φ(X)]\varphi(6{,}000)\le\mathbb E[\varphi(X)],買保險就是理性的。保險公司呢?它同時承保十萬個人,它的 XX 是十萬個獨立損失的平均,散佈小到幾乎是一個定點——弦與曲線的距離趨近零,它的曲線在這個尺度上幾乎是直的。它不怕,因為它的 XX 幾乎不隨機。

寫成數學:Convex 與 Jensen

定義。 函數 φ\varphiconvex(往上彎)的,若對任意兩點 a,ba,b 與任意 λ[0,1]\lambda\in[0,1]

φ(λa+(1λ)b)    λφ(a)+(1λ)φ(b).\varphi\big(\lambda a+(1-\lambda)b\big)\;\le\;\lambda\,\varphi(a)+(1-\lambda)\,\varphi(b).

左邊是曲線在 a,ba,b 之間某點的高度,右邊是弦在同一點的高度——「弦在曲線上方」的逐字翻譯。若 φ\varphi 二次可微,等價的判準是 φ0\varphi''\ge0M0.2 的二階項永遠往上)。x2x^2exe^xlogx-\log xx>0x>0)都是 convex;logx\log xx\sqrt xconcave(往下彎,φ-\varphi 是 convex)。

Jensen 不等式。φ\varphi convex 且 E[X]\mathbb E[X]E[φ(X)]\mathbb E[\varphi(X)] 存在,則

  φ(E[X])    E[φ(X)].  \boxed{\;\varphi\big(\mathbb E[X]\big)\;\le\;\mathbb E\big[\varphi(X)\big].\;}

證明(五行)。m=E[X]m=\mathbb E[X] 處畫一條支撐線:convex 函數在任何一點都有一條直線 (x)=φ(m)+c(xm)\ell(x)=\varphi(m)+c\,(x-m),整條曲線都在它上方,φ(x)(x)\varphi(x)\ge\ell(x) 對所有 xx 成立(可微時 c=φ(m)c=\varphi'(m),就是切線)。對這個不等式兩邊取期望:

E[φ(X)]    E[(X)]=φ(m)+c(E[X]m)=φ(m).\mathbb E[\varphi(X)]\;\ge\;\mathbb E[\ell(X)]=\varphi(m)+c\,\big(\mathbb E[X]-m\big)=\varphi(m).\qquad\square

整個證明只用了兩件事:曲線在切線上方,以及期望是線性的(M1.1)。兩點的 convex 定義是 Jensen 的特例(XX 只取兩個值),Jensen 是它對任意分佈的推廣。

等號何時成立。 E[φ(X)]E[(X)]=E[φ(X)(X)]\mathbb E[\varphi(X)]-\mathbb E[\ell(X)]=\mathbb E[\varphi(X)-\ell(X)],被積函數 0\ge0,期望為零只能是它幾乎處處為零:XX 落在的每一個點上曲線都貼著切線。若 φ\varphi strictly convex(弦嚴格在上方、沒有平的段),這只在 XX 是常數時發生。Jensen 的等號成立 ⟺ XX 不隨機(strictly convex 時)。這就是保險公司不怕的數學版本。

差距有多大。φ\varphimm 附近二階展開(M0.2):φ(X)φ(m)+φ(m)(Xm)+12φ(m)(Xm)2\varphi(X)\approx\varphi(m)+\varphi'(m)(X-m)+\tfrac12\varphi''(m)(X-m)^2,取期望,一階項消失:

E[φ(X)]φ(E[X])    12φ(m)Var(X).\mathbb E[\varphi(X)]-\varphi(\mathbb E[X])\;\approx\;\tfrac12\,\varphi''(m)\,\mathrm{Var}(X).

Jensen gap ≈ 彎度 × 散佈。 彎度是你「怕」的程度,散佈是風險的大小;兩者相乘就是保費裡合理的那部分溢價。

展開細節把 Jensen 用在 concave 函數與 conditional expectation 上

concave 的 φ(例如 log、√)把不等式反過來:φ(E[X]) ≥ E[φ(X)]。最常見的例子是 E[log X] ≤ log E[X]——「先取 log 再平均」小於「先平均再取 log」;一筆投資如果每年 +50% 或 −50% 各半,算術平均報酬是 0,但 E[log(1+r)] = ½(log 1.5 + log 0.5) ≈ −0.144 < 0,長期複利下財富會趨近零。這是「分散投資降低波動本身就有價值」的來源,也是 Jensen gap 的另一個生活版本。

條件版本:對任何 σ-代數(任何「已知資訊」)Y,φ(E[X|Y]) ≤ E[φ(X)|Y] 逐點成立——證明一字不改,只要把期望換成 conditional expectation,支撐線的斜率 c 可以依 Y 而變。對兩邊再取期望就回到原式。這個版本在後面比較「先平均再算」與「先算再平均」的各種情境時都會用到。

回到保險:直覺對了,數字現在有了

回答起點問題。你買保險不是因為算錯,而是因為你比較的是 φ(6,000)\varphi(6{,}000)E[φ(X)]\mathbb E[\varphi(X)],不是 6,000 與 4,000。只要你的痛苦函數夠彎——12φ(4,000)Var(X)\tfrac12\varphi''(4{,}000)\cdot\mathrm{Var}(X) 大於 φ(6,000)φ(4,000)\varphi(6{,}000)-\varphi(4{,}000)——多付 2,000 就是理性的。Var(X)=0.02×0.98×200,00027.8×108\mathrm{Var}(X)=0.02\times0.98\times200{,}000^2\approx7.8\times10^8,很大;一個存款 30 萬的人在 20 萬那一端的 φ\varphi'' 也很大。

保險公司站在同一條不等式的另一邊:它的 XX 是十萬個獨立損失的平均,Var\mathrm{Var} 被除以十萬,gap 趨近零,它可以幾乎照 E[X]\mathbb E[X] 定價、再加一點利潤。同一個 Jensen,兩邊的 Var(X)\mathrm{Var}(X) 不同,就是保險存在的理由。

這個判斷依賴的假設:

  • φ\varphi 真的 convex。 如果一個人的痛苦函數在某段是 concave 的——例如「反正欠債超過 50 萬就宣告破產,再多欠也一樣」——那在那一段 Jensen 反向,這個人對大額損失反而不在意,保險對他沒有吸引力。這不是理論錯,是假設不成立。
  • 期望存在。 若損失分佈的尾巴太厚(例如 E[X]=\mathbb E[X]=\infty 的分佈),兩邊都沒有定義,「平均」這個詞本身失去意義。

回到保險:跑一次,再把 φ 翻成 concave

import numpy as np
rng = np.random.default_rng(0)
loss = np.where(rng.random(200_000) < 0.02, 200_000.0, 0.0)      # 你的年度損失 X
phi  = lambda x: -np.log1p(-x / 250_000)                           # 一條 convex 的「痛苦」:損失越接近 25 萬的上限越痛
print(loss.mean())                                                 # ≈ 4000:E[X]
print(phi(np.array([6000.])).item(), phi(loss).mean())             # φ(6000) vs E[φ(X)]:後者更大 → 買保險划算
# 保險公司:十萬人的平均損失
pool = loss.reshape(2, 100_000).mean(1)                            # 兩個「公司年度」的平均損失,幾乎都 ≈ 4000
print(pool, phi(pool).mean() - phi(np.array([pool.mean()])).item())  # Jensen gap ≈ 0
# 破壞假設:把 φ 換成 concave(破產後不在意)
phi_c = lambda x: np.sqrt(x)
print(phi_c(np.array([4000.])).item(), phi_c(loss).mean())         # φ(E[X]) > E[φ(X)]:不等式反向,保險不吸引人

前三行:E[X]4,000\mathbb E[X]\approx4{,}000φ(6,000)\varphi(6{,}000) 小於 E[φ(X)]\mathbb E[\varphi(X)],確定付 6,000 比冒險舒服。保險公司那兩個「年度」的平均損失都在 4,000 附近,Jensen gap 幾乎是零。最後把 φ\varphi 換成 concave 的 x\sqrt xφ(E[X])=63.2\varphi(\mathbb E[X])=63.2E[φ(X)]=0.02×447=8.9\mathbb E[\varphi(X)]=0.02\times447=8.9——不等式整個反過來,這樣的人寧願賭。理論預告了方向,數字確認了大小。

先消化一下

想一想

你有 100 萬要投資,兩個選擇:全部押一支股票(一年後翻倍或歸零各半),或分散到 100 支互相獨立、每支同樣「翻倍或歸零各半」的股票。兩者的期望財富都是 100 萬。若你的滿足感是財富的 log\log,哪個選擇的期望滿足感高?

想一想

Jensen 的等號 φ(E[X])=E[φ(X)]\varphi(\mathbb E[X])=\mathbb E[\varphi(X)],在 φ\varphi strictly convex 時成立的條件是:

想一想

一家餐廳每天的客人數 NN 隨機,廚房的等待時間是客人數的函數 T(N)T(N),而且客人越多、每多一人增加的等待時間越長(TT convex)。老闆用「平均客人數」算出的等待時間 T(E[N])T(\mathbb E[N]),和顧客實際體驗的平均等待 E[T(N)]\mathbb E[T(N)] 比:

參考文獻

  1. Boyd, S., Vandenberghe, L. Convex Optimization. Cambridge University Press, 2004.(第 3.1 節 convex function 的定義與二階判準;第 3.1.8 節 Jensen 不等式與其推廣。)
  2. Jensen, J. L. W. V. Sur les fonctions convexes et les inégalités entre les valeurs moyennes. Acta Mathematica 30, 1906.(不等式的原始出處。)
  3. Cover, T. M., Thomas, J. A. Elements of Information Theory. Wiley, 2nd ed., 2006.(第 2.6 節:Jensen 不等式與等號條件,作為資訊量非負性的工具。)
  4. Grimmett, G., Stirzaker, D. Probability and Random Processes. Oxford University Press, 3rd ed., 2001.(第 3.6 與 7.9 節:期望的不等式、conditional Jensen。)