If you can’t solve a problem, then there is an easier problem you can solve: find it. -George Polya
2/08/2026
[Claude] 國小數學加減乘除法計算小遊戲:數學怪獸大亂鬥
2/05/2026
[機器學習] 關於 Tokenization
Example 1: $\Sigma := \{0,1\}$ 收集了兩個符元 $0$ 與 $1$,可用在表達二進制的世界。
- Associativity: 對任何字串 $x,y,z$而言,我們有 $ (xy)z = x(yz). $
- Identity: 存在一個字串 $\varepsilon$ 使得 $ x \varepsilon = \varepsilon x = x. $
- 當 $k=1:$ $1\leq 2$,則 $z_1= x_1 = \texttt{n}$
- 當 $k=2:$ $2\leq 2$,則 $z_2= x_2 = \texttt{o}$
- 當 $k=3:$ $3 > 2$,則 $z_3= y_{3-2} = y_1 = \texttt{w}$
- 當 $k=4:$ $4 > 2$,則 $z_4= y_{4-2} = y_2 = \texttt{a}$
- 當 $k=5:$ $5 > 2$,則 $z_5= y_{5-2} = y_3=\texttt{y}$
- $\Sigma^0 =\{\varepsilon\}$。亦即包含空字串的集合
- $\Sigma^1 = \Sigma$
- 對任意 $n \geq 1$而言,定義 $\Sigma^{n+1} :=\{w x: w \in \Sigma^n, x \in \Sigma\}$
12/17/2025
[機率論] 三角陣列
在機率論中,我們常看到的是單一指標序列:$ \{X_n\}_{n=1}^\infty := (X_1, X_2, \dots,) $ 比如說 iid 序列或者至少定義在同一個機率空間 $(\Omega, \mathcal{F}, P)$上的序列。 此時只有一個指標 $n$,而 $X_n$ 指涉的是該序列第 $n$ 個隨機變數。
標準的大數法則(Law of Large Numbers, LLN) 與經典形式的中央極限定理(Central Limit Theorem, CLT) 常處理的就是這種單一指標序列 $X_1, X_2, \ldots$,其中每個 $X_i$ 的分佈固定。但許多重要情形下,隨著樣本數增加,個別隨機變數的分布可能隨 $n$ 改變,隨機變數序列的聯合分佈本身也會有所變化。三角陣列(triangular array)提供了處理這類問題的框架。
現在我們考慮以下情況,固定整數 $n$,考慮第 $n$ 列的 $n$ 個 Bernoulli 隨機變數: $$ X_{n,1},\dots, X_{n,n} $$ 但是如果我們允許 $n$ 改變,也就是每個 $n$ 都有一整列新的隨機變數序列,則整個聯合分佈也可能跟著改變。比如說 $n=10$,我們有 $$X_{10,1}, X_{10,2}, \dots, X_{10,10}$$ 共 10個 Bernoulli 隨機變數,他們具有一個聯合分佈 (joint distribution)。但是若 $n = 100$,我們有 $$X_{100,1}, X_{100,2}, \dots, X_{100,100}$$ 共 100 個 Bernoulli 隨機變數,其聯合分佈一般不同於前一組 $X_{10,1}, ,X_{10,2}, \dots, X_{10,10}$ 的 joint distribution。這時,如果我們指涉的對象為「第一個 Bernoulli 變數」在 $n=10$ 是 $X_{10,1}$ 與 $n=100$ 是 $X_{100,1}$ 是不同物件,此時這種結構無法再用單一序列來描述,為此我們可以引入三角陣列 (triangular array)
Definition (Triangular Array): 一個三角陣列(triangular array)是指一族以兩個指標標記的隨機變數 $\{X_{n,i}\}_{n\geq 1, 1\leq i \leq n}$,其中第 $n$ 列包含 $X_{n,1}, \dots, X_{n,n}$
Remark. 若將其排列起來可得 $$ \begin{matrix} n=1: & X_{1,1} \\ n=2: &X_{2,1} & X_{2,2} \\ n=3: &X_{3,1} & X_{3,2} & X_{3,3} \\ \vdots & \vdots & \vdots & \ddots \end{matrix} $$ 第 $n$ 列有 $n$ 個變數,因此看起來是「三角形」,這只是視覺上的名字。注意到上述定義不要求不同 $n$ 列之間有任何獨立性或相容性,通常只在每一列之內做假設。
三角陣列在許多機率論有重要結果,比如以下的 Lindeberg-Feller 中央極限定理:
Lindeberg-Feller CLT: 對每個 $n \ge 1$,令 $\{X_{n,i}\}_{i=1}^{n}$ 為一族隨機變數,其整體族 $\{X_{n,i}\}_{n \ge 1, \, 1 \le i \le n}$ 構成一個三角陣列,對每個 $n$ 而言,$X_{n,1}, \dots, X_{n,n}$ 相互獨立,且滿足 $\mathbb{E}[X_{n,i}] = 0$。定義 $$ S_n := \sum_{i=1}^{n} X_{n,i} $$ 且 $$ \sigma_n^2 := \text{var}(S_n) > 0 $$ 若 Lindeberg 條件成立,亦即對 $\varepsilon > 0$,我們有 $$ \lim_{n \to \infty} \frac{1}{\sigma_n^2} \sum_{i=1}^{n} \mathbb{E}[X_{n,i}^2 \mathbf{1}_{|X_{n,i}| > \varepsilon \sigma_n}] = 0 $$ 則 $\frac{S_n}{\sigma_n} \xrightarrow{D} \mathcal{N}(0,1)$。
上述 Lindeberg-Feller CLT 推廣經典 CLT:
Proof: 取 $X_{n,i} := \frac{Y_i - \mu}{\sqrt{n}}$ 其中 $Y_i$ 為 iid 且均值為 $\mu$ 變異為 $\sigma^2$。則不難發現 $$ S_n := \sum_{i=1}^{n} X_{n,i} = \sum_{i=1}^{n} \frac{Y_i - \mu}{\sqrt{n}} = {\sqrt{n}}(\bar{Y}_n - \mu) $$ 其中 $\bar{Y}_n := \frac{1}{n} \sum_{i=1}^{n} Y_i$。現在我們檢驗 Lindeberg 條件:固定 $\varepsilon > 0$,我們觀察 \begin{align*} \frac{1}{\sigma_n^2} \sum_{i=1}^{n} \mathbb{E}[X_{n,i}^2 \mathbf{1}_{|X_{n,i}| > \varepsilon \sigma_n}] &= \frac{1}{\sigma^2} \sum_{i=1}^{n} \mathbb{E}[ (\frac{Y_i - \mu}{\sqrt{n}})^2 \mathbf{1}_{|\frac{Y_i - \mu}{\sqrt{n}}| > \varepsilon \sigma}] \\ &= \frac{1}{\sigma^2} \sum_{i=1}^{n} \mathbb{E}[ (\frac{(Y_i - \mu)^2}{{n}}) \mathbf{1}_{|{Y_i - \mu}| > \varepsilon \sigma \sqrt{n}}] \\ &= \frac{1}{\sigma^2 n} \sum_{i=1}^{n} \mathbb{E}[ (Y_i - \mu)^2 \mathbf{1}_{|{Y_i - \mu}| > \varepsilon \sigma \sqrt{n}}] \\ &= \frac{1}{\sigma^2 n} \sum_{i=1}^{n} \mathbb{E}[ (Y_1 - \mu)^2 \mathbf{1}_{|{Y_1 - \mu}| > \varepsilon \sigma \sqrt{n}}] &&\text{$Y_i$ are iid}\\ &= \frac{1}{\sigma^2 n} n \mathbb{E}[ (Y_1 - \mu)^2 \mathbf{1}_{|{Y_1 - \mu}| > \varepsilon \sigma \sqrt{n}}] \\ &= \frac{1}{\sigma^2} \mathbb{E}[ (Y_1 - \mu)^2 \mathbf{1}_{|{Y_1 - \mu}| > \varepsilon \sigma \sqrt{n}}] \\ \end{align*} 注意到 $(Y_1 - \mu)^2 \mathbf{1}_{|{Y_1 - \mu}| > \varepsilon \sigma \sqrt{n}} \xrightarrow{a.s.} 0$ 且 $(Y_1 - \mu)^2 \mathbf{1}_{|{Y_1 - \mu}| > \varepsilon \sigma \sqrt{n}} \leq (Y_1 - \mu)^2 $,因為 ${\rm var}(Y_1)= \sigma^2<\infty$故 $(Y_1-\mu)^2$可積,由 Dominated Convergence Theorem (DCT) 可知 \begin{align*} \lim_{n\to\infty} \frac{1}{\sigma_n^2} \sum_{i=1}^{n} \mathbb{E}[X_{n,i}^2 \mathbf{1}_{|X_{n,i}| > \varepsilon \sigma_n}] &= \lim_{n\to\infty} \frac{1}{\sigma^2} \mathbb{E}[ (Y_1 - \mu)^2 \mathbf{1}_{|{Y_1 - \mu}| > \varepsilon \sigma \sqrt{n}}] \\ &= \frac{1}{\sigma^2} \mathbb{E}[ \lim_{n\to\infty} (Y_1 - \mu)^2 \mathbf{1}_{|{Y_1 - \mu}| > \varepsilon \sigma \sqrt{n}}] \\ &= 0 \end{align*} 故 Lindeberg條件成立,由 Lindeberg-Feller CLT 可知, $$ \underbrace{ \frac{S_n}{\sigma_n}}_{= \frac{\sqrt{n}}{\sigma}(\bar{Y}_n - \mu)} \xrightarrow{D} \mathcal{N}(0,1) $$ 亦即標準CLT成立。
三角陣列的使用非常廣泛,除了前述的CLT之外,比如Poisson 極限定理(或稱 Weak Law of Small Numbers),我們定義 $S_n := \sum_{i=1}^{n} X_{n,i}$ 則每個 $S_n$ 都是一個隨機變數且數列 $\{S_n\}_{n \ge 1}$ 可以討論收斂性。
Poisson Limit Theorem:對每個 $n \geq 1$,令 $\{X_{n,i}\}_{i=1}^n$ 為一族隨機變數,其整體族 $\{X_{n,i}\}_{n\geq 1, 1\leq i \leq n}$ 構成一個三角陣列,對每個 $n$ 而言,$X_{n,1}, \dots, X_{n,n}$ 相互獨立且 $X_{n,i} \sim Bernoulli(p_{n,i})$。定義 $n$ 項有限和 $S_n:= \sum_{i=1}^n X_{n,i}$ 且假設當 $n \to \infty$,我們有 $$\max_{1\leq i \leq n} p_{n,i} \to 0$$ 且 $$\sum_{i=1}^n p_{n,i} \to \lambda <\infty$$ 則 $S_n \xrightarrow{D} Poisson(\lambda)$
12/04/2025
[隨筆] 當學生研究遇上「做不出來」的困境
什麼不是更換研究方法的理由:
- 「跑不出答案(跑了很多次)」、「電腦算不動」、「算法不 converge 」、「結果怪怪的」、「找不到答案」、「證不出來」、「資料拿不到」、「AI建議我換方法(但自己不知道為什麼)」
- 「我看別人(文獻)用這方法有效」、「別人(文獻)都這樣用」、「文獻看不懂」
- 「我覺得 metaheuristic 方法 GitHub 上有現成 package 比較簡單」
- 「我不知道怎麼 debug」、「code不會寫」
要換方法應先提交 Failure Analysis Report:
- 原方法的完整理論與演算法描述
- 問題的 objective、constraints、dynamics
- 參數設定
- 算法步驟
- 預期應滿足的最佳性條件(如 KKT、Bellman、HJB、local/global optimality)
- 預期應滿足的對偶性質 (strong/weak duality,duality gap)
- 預期應滿足的拘束資格條件 (constraint qualification, Slater's condition)
- 預期應滿足的可測性/連續性/可導性等條件
- 預期應滿足的穩定性條件(如 Lyapunov function, asymptotic/non-asymptotic)
- 預期應滿足的強健性條件 (worst-case analysis, sensitivity analysis)
- 預期應滿足的算法複雜度條件
- 預期應滿足的近似條件
- 明確指出「哪裡做不出來」,只說「做不出來」= 無效論證。學生應回答:
- 失敗發生在哪一行計算?
- 是 gradient / subgradient / Jacobian / Hessian 算不出來?
- 約束是否不相容?
- 數值解是否跳出可行域?數值誤差?
- dynamics 無法滿足?
- initial condition 是否導致 divergence?
- 實驗/模擬結果是否可重現?(不同資料集都指向同一結論)
- 模擬結果不佳的具體意義(穩定性不好?報酬不佳?變異太大?)
- 合理的失敗原因推論(有理論或合理假設),例如:
- 模型非凸 → local solver 卡在 local minima
- state/control constraint 過於嚴格 → 無可行解
- dynamics stiffness 太高 → 數值爆炸
- objective/loss scale 不當 → 需要 normalization
- 多期多目標計算
- Impossibility claim 的證明: 若你要宣稱「這個問題做不到 / 不可能」必須附上 理論或模擬證據,例如:
- 證明無可行解
- 顯示最佳性條件(KKT / Bellman)不可同時滿足
- 顯示系統缺失某robustness/stability/performance
- 指出該問題在某些條件下為 NP-hard,並說明該障礙是否適用目前研究問題的結構
- 提供反例或實驗結果,清楚展示失敗原因
沒有上述證據,只說「做不出來」、「不可能」等說法,是不會被直接接受的。我預期學生應該要提供「數值/實證數據」與「結構性論證」各一項:
- 數值例子(宣稱非凸應該提供非凸性理論推導反例,或在低維情況繪製其非凸結構的圖例)
- 圖表 (solution path, 誤差收斂曲線,state trajectory, etc)
- log / 訊息 (錯誤碼,停止條件)
- constraint violation
- Optimality Condition (e.g., KKT) violation
- Complexity analysis
- 數值或者理論反例
- 調整 step size
- 更換 initial condition
- 放寬或修改部分 constraint
- scaling / normalization / shifting
- convex surrogate、linearization / relaxation
- 理論上合理的 heuristic(不是隨便 metaheuristic)
- greedy algorithm with provable approximation ratio 是合理的 heuristic;而 genetic algorithm without convergence guarantee 若只是因為有現成package可用,則不能直接取代理論分析。也應檢查「方法與問題的結構假設(convexity, smoothness, dimensionality等)是否相容。
- 考慮的問題範圍與算法適用性,比如 L-BFGS-B 適用於 box 拘束。
- 求解器更換 (Gurobi/MOSEK/CVX)
- 更換solver本身仍應有明確理由,比如問題規模大小變動等等。
對採用「新方法」的要求:必須有合理性證據
- 新方法與研究問題結構更一致(例如確認問題具有 QP, LP, SOCP, SDP 結構後,改用相對應的convex optimization approach)
- 可以證明更好的 optimality/stability/robustness 性質
- 可以證明可行性、收斂性
- 在保留可驗證的approximation/regret guarantee前提,達成原方法不可達的問題規模。
- 文獻中有具體、可查證的支持
- 「github上有現成套件」
- 「我覺得 metaheuristic 比較方便」
- 「網路上有人這樣用」
- 「我自己跑起來比較順」
反思:
12/01/2025
[機率論] 多變數連續映射保持機率收斂
8/18/2025
[測度論] 期望值下確界與函數值下確界之恆等式
Claim: 令 $(X, \mathcal{F})$ 為可測空間。令 $g: X \to \mathbb{R}$ 為可測函數,則 $$\inf_{\mathbb{P} \in \mathcal{P}(X)} \int_X g(x) d\mathbb{P}(x) = \inf_{x \in X} g(x)$$ 其中 $\mathcal{P}(X)$ 為 $(X, \mathcal{F})$ 上所有機率測度所成之集合。
Proof: 先證明 $\geq$: 對任意機率測度 $\mathbb{P}$,我們有 $$ g(x) \geq \inf_{x \in X}g(x) $$ 故取期望值不等式仍成立,亦即 $$ \mathbb{E}^\mathbb{P}[g(X)] = \int_X g(x) d\mathbb{P}(x) \geq \inf_{x \in X} g(x) $$
以下接著證明 $\leq$: 固定 $\varepsilon > 0$,則由 infimum 定義,存在 $x_\varepsilon \in X$ 滿足 $$ g(x_\varepsilon) \leq \inf_x g(x) + \varepsilon \qquad (*) $$ 令 $\mathbb{P}:=\delta_{x_\varepsilon}$ (Dirac at $x_\varepsilon$ 滿足 $\delta_x(A):=1_{x \in A}$, $A \in \mathcal{F}$ ) 則 $$ \mathbb{E}^\mathbb{P}[g(X)] = \int_X g(x) d\delta_{x_\varepsilon} = g(x_\varepsilon) $$ 由$(*)$我們進一步得到 $$ \int_X g(x) d\delta_{x_\varepsilon} = g(x_\varepsilon) \leq \inf_x g(x) + \varepsilon $$ 對兩邊同取 $\inf_\mathbb{P}$ 可得 $$ \inf_\mathbb{P} \int_X g(x) d\mathbb{P}(x) \leq \inf_x g(x) + \varepsilon $$ 令 $\varepsilon \downarrow 0$ 得到 $\inf_{\mathbb{P} \in \mathcal{P}(X)} \int_X g(x) d\mathbb{P}(x) \leq \inf_{x \in X} g(x)$
Remark: (Dirac 測度不需單點可測):在任意可測空間 $(X,\mathcal F) $上,對每個 $x\in X$ 定義 $\delta_x(A)=\mathbf 1_{\{x\in A\}}$ 其中 $A \in \mathcal F$,則 $\delta_x$ 是機率測度,且對一切 $\mathcal F$-可測 $g$ 有 $\int g\,d\delta_x=g(x)$。因此上述證明中以 $\delta_{x_\varepsilon}$ 作為選擇的測度不需要額外假設 $\{x\}\in\mathcal F$。
6/11/2025
[最佳化] C^2 函數一階逼近的餘項積分表示
1/30/2025
[人工智慧] 本地端 DeepSeek R1 快速安裝:以 Macbook Pro M4 Chip為例
Step 1: 在 Macbook Pro M4 上安裝的方式相當容易,只要打開 Mac 內建的終端機 Terminal 輸入:
ollama run deepseek-r1:14b
系統會自動開始下載所需資料,安裝完畢後即可開始運行。運行結果如下圖所示:1/09/2025
[數學分析] 連續函數族的逐點上包絡函數不一定連續
連續函數有諸多用途,一般在參數最佳化領域中常見的情況是考慮所謂的上包絡函數(upper envelope function)。
Definition: 定義函數族 \(\{f_t : t \in T\} \) 其中 \(T\) 為 index set 並考慮對任意 \(x \in X\),現在定義上包絡函數(upper envelope function) 或者 逐點上確界函數(pointwise supremum function)
$$ F(x) := \sup_t f_t(x)$$
Question: 一個有趣的問題是如果這些函數族成員都是連續函數,那麼取 supremum 之後所得到的新函數 \(F\) 是否仍為連續呢?
答案是否定的。以下例子說明甚至是定義在緊緻集合上的連續函數族也沒有保證上包絡函數連續。
Example: 考慮一連續函數族 \( \{f_t: t \in [0, T]\} \) 其中 \(f_t(x) := x^t\) 對 \(x \in [0,1]\) 且 \(t \in [0,1]\) 並定義 \(f_0 = 0\)。 則函數族的上包絡函數為 $$ \sup_t f_t(x) = \begin{cases} 1, & x \in (0, 1] \\ 0, & x = 0\end{cases}$$ 讀者不難發現此函數在 \(x=0\) 處有不連續跳點。
Comment: 在最佳控制與數理經濟中有個非常有用的定理可以刻畫上包絡函數的連續性稱作 Berge's Maximum Theorem 有興趣的讀者可以自行查閱。
11/06/2024
[隨筆] A+焦慮的世代
接住A+世代學生
若有人以為自己知道什麼,按他所當知道的,他仍是不知道---哥林多前書8:2
職業與學術之間:適合比起優異更加重要
個人選擇 vs 個人夢想的不一致性:
選幾個至少不討厭的目標/領域試試看如何?
以終為始:動態規劃的最優解
原則:尋找你自己
Two roads diverged in a wood, and I—I took the one less traveled by,
And that has made all the difference.
選擇一條少有人走的路,因為可能他帶給你最美的風景。並且譜寫成只屬於你的故事
後記:我大概有點資格談談這件事, 我本身研究橫跨隨機控制,優化理論與財務工程,走在這條路上的同行者寥寥。但是一路走來,我慶幸自己能有機會欣賞這條少有人走的道路以及沿途的特有風景。
8/11/2024
[數學分析] 連續函數性質與sublevel set 關係
考慮 $f: X \to \mathbb{R}$ 為連續函數,則其sublevel set $$L_s := \{x \in X: f(x) \leq s\}$$ 為閉集(closed set)。
Proof.
首先注意到 $(-\infty, s]$ 為在 $\mathbb{R}$ 的 closed set (why?),並且注意到 $f$ 的 sublevel set 可由連續函數 $f$ 的像原(preimage) 表示,亦即, $$f^{-1}((-\infty, s]) = \{x \in X: f(x) \leq s\}$$ 由連續函數等價定理:函數 $f$ 為連續若且唯若對於 $\mathbb{R} $ 中任意 closed set $A$ ,其 $f^{-1}(A) $ 為 closed。現令 $A:=(-\infty, s]$,且 $f$ 為連續,故 $L_s = f^{-1}((-\infty, s])$ 為 closed set。
6/30/2024
[轉載] My University Is Better Than Your University
by Zizheng Fang
7/12/2023
[轉載] PhD Simulator by Mianzhi Wang
2/17/2022
[隨筆] 指導教授的要求與省思
這一學期以來,我很幸運陸續有幾位碩士班同學表達有意願想找我當指導教授,我對每一位來訪的同學都表明:如果想找我當指導教授的話需要有 (or 致力達成) 以下兩項基本能力:
- 修習過 高等微積分 (or 數學分析或者等價的課程)
- 具備以至少一種程式語言(Matlab, Python, R, C,...)實現各種算法的能力。
我對(碩士班)學生的畢業期許是:至少需完成並投稿一篇我認可的領域內會議論文。
我知道上述的要求(特別是條件1)對許多同學而言是極為*沈重*的負擔,因為學生們大多沒有接受過嚴格的數理論證訓練,也並不是每一位都志在學術,大多數同學也許更在乎的是找實習/找工作機會加入業界崗位,更在意的大多都不是碩士論文做了什麼題目,而是能不能準時畢業。我曾經也是學生,我想我大概可以體會這些同學的想法。
然而,另一方面,我是做*理論*研究的學者,我感興趣的研究領域(隨機系統與投資組合優化理論)中許許多多的研究確實需要使用各種 數學工具 與 數學論證的手法。領域內的研究工作者需要能大致讀懂領域內相關文獻,並據此發想可能的新研究主題,接著利用各種(數學/優化/統計)工具來解決這些問題。陳述自己的研究成果方法多半是以定義/定理/證明的形式或者 算法/證明/實證模擬結果。最後實證的部分需使用真實資料輔以程式來實現。如果沒有受過一些嚴格論證的訓練與洗禮以及一定的程式撰寫經驗,要達成上述目標幾乎是寸步難行,特別是論證這塊,除了高微這門課之外我實在很難找到更好的替代方案。
學生們感到(辛苦)困難,老師也感到困難。或許我應該再想想有沒有更好的解決方案?
1/17/2022
[轉載] 錢本草-張說
譯文(編修版)
錢,味甜,性熱有毒,卻能預防衰老,駐容養顏。可以治療飢餓寒冷,解決困難,效果明顯。可以有利於國家和百姓,可以污損賢達,只是害怕清廉。貪婪之人服用以不過分為好,如果過度,則冷熱不均,引發霍亂。這味藥,沒有固定的採摘時節,無理採摘的使人精神損傷。如果只積攢不發散,會有水火盜賊等災難。如果只發散不積攢,會有饑寒困頓等禍患。一邊積攢一邊施財可稱為道,不把錢財當作珍寶稱為德,取得給予適宜稱為義,不求非份之財使用正當稱為禮,接濟大眾稱為仁,支出有度歸還有期稱為信,得錢財又不傷自己稱為智,用道,德,仁,義,禮,智,信這七種方法精鍊此藥,才可以長久地服用他。可以使人延年益壽,如果不這麼服用,則會智力減弱精神損傷,這點需要特別避免。
3/23/2021
[機率論] 兩隨機變數相等表示兩者有相同分布但反之不然
$$
P(X\in A\cap X\neq Y)\leq P(X\neq Y)=0
$$ 故可推得 $P(X\in A\cap X\neq Y)=0$。利用此結果,我們注意到
$$
P(X\in A)=P(X\in A\cap X=Y)+\underbrace{P(X\in A\cap X\neq Y)}_{=0}=P(X\in A\cap X=Y)
$$ 同理我們亦可觀察 $P(Y\in A)=P(Y\in A\cap X=Y)$。注意到若我們可證明 $$P(X\in A\cap X=Y) = P(Y\in A\cap X=Y) \;\;\;\;\; (*)$$則 $$P(X\in A)=P(X\in A\cap X=Y)=P(Y\in A\cap X=Y)=P(Y\in A)$$即為所求。
2/12/2021
[機率論] 一類含有supremum運算與期望值的不等式問題
令 $X,Y$ 為兩隨機變數定義在某機率空間 $(\Omega, \mathcal{B}, P)$ 且 $f: \mathbb{R}^2 \to \mathbb{R}$ 為一連續函數。若對 $X$ 的實現 $X=x$ 而言 (亦即,存在 $\omega \in \Omega$ 使得 $X(\omega) = x$ ),我們顯然有
$$\mathbb{E}[f(x,Y)] \leq \sup_x \mathbb{E}[f(x,Y)]$$
試問上述不等式左方若將 $x$ 換回隨機變數 $X$ 時仍然成立?亦即我們想問 $$\mathbb{E}[f(X,Y)] \leq ? \sup_x \mathbb{E}[f(x,Y)]$$
答案是否定的,我們看以下的反例:
Counterexample
考慮隨機變數 $X=Y$ 且 $P(X=1)=P(X=-1) = 1/2$ 且 $f(x,y) := xy$ 則我們可驗證 $$\mathbb{E}[f(X,Y)] = \mathbb{E}[X^2] = 1/2 + 1/2 = 1$$然而如果我們觀察 $$\mathbb{E}[f(1,Y)] = \mathbb{E}[Y] = \mathbb{E}[X] = 0$$ 另外 $$\mathbb{E}[f(-1,Y)] = \mathbb{E}[-Y] = -\mathbb{E}[X] = 0$$ 故 $\sup_x\mathbb{E}[f(x,Y)] = 0$但是 $$\sup_x\mathbb{E}[f(x,Y)] < \mathbb{E}[f(X,Y)]$$
2/10/2021
[機率論] 關於條件期望的一些基本觀念
在大學部機率論課程後半大多會介紹到所謂條件機率與條件期望,其中條件期望由於授課時間較接近晚期且觸及之內容較深,初次學習時並不容易掌握。以下我們試圖說明條件期望值本身為一隨機變數並給出一個簡單的例子做配搭。
條件機率為一隨機變數
令$X,Y$ 為兩隨機變數。假設$X$ 有給定事件 $\{Y=y\}$ 的條件機率分布其中 $y$ 表示隨機變數 $Y$ 所能取到的值。 既然有條件機率分布,則條件期望值存在,我們將其記作 $$\mathbb{E}[X\mid Y=y]$$ 注意到條件期望值與取值 $y$ 相關,故我們可寫 $$\mathbb{E}[X\mid Y=y]:=g(y)$$ 其中 $g(y)$ 表示為 $y$的函數 。依此,若我們把取值 $y$用 $Y$ 代回,則$g(Y)$ 為一隨機變數,記作 $\mathbb{E}[X \mid Y]$。
重疊期望性質 (Law of Iterated Expectations)
一般期望值與條件期望之間的關係可由 law of iterated expectations (或稱 law of total expectation) 定理刻劃。亦即 $$\mathbb{E}[X] = \mathbb{E}_Y[\mathbb{E}_X[X \mid Y]] $$其中 $\mathbb{E}_Y$表對 $Y$取期望 且 $\mathbb{E}_X$表對 $X$ 取期望。一般而言下標多半不寫出,多簡寫作 $$\mathbb{E}[X] = \mathbb{E}[\mathbb{E}[X \mid Y]] $$
以下我們看個具體的例子。讀者按照此例應可看出為何上述條件期望為隨機變數。並練習計算條件期望與使用重疊期望性質。
=======================
Example: 假設有五顆紅球與三顆綠球被放在一袋中,現在我們從中依序取出兩球不放回。令 $Y$ 為第一次取到紅球的計數 ($Y\in \{0,1\}$其中$Y=0$表示第一次沒取到 $Y=1$表示第一次取到),且 $X$ 為第二次取到紅球的計數 ($X \in \{0,1\}$ 其中 $X=0$表示第二次沒取到紅球,$X=1$表示第二次沒取到)。則 $X,Y$皆為(離散)隨機變數。求
(a) $\mathbb{E}[X \mid Y=0]$ 與 $\mathbb{E}[X \mid Y=1]$
(b) $\mathbb{E}[X \mid Y]$
(c) $\mathbb{E}[\mathbb{E}[X \mid Y]]$ 與 $\mathbb{E}[X]$。並驗證此兩者相等。
========================
Answer: 首先注意到 $$Y = \begin{cases} 0 & \text{with probability } \dfrac 3 8, \\[6pt]1 & \text{with probability } \dfrac 5 8. \end{cases}$$ 接著我們依序計算所求:
(a) 注意到 $$\begin{align}\mathbb{E}[X\mid Y=0] &= \sum_i i P(X=i \mid Y=0) \\&= 1\cdot P(X=1 \mid Y=0) + 0\cdot P(X=0 \mid Y=0) \\&= \dfrac 5 7 + 0 = \dfrac 5 7\end{align}$$ 同理$$\mathbb{E}[X\mid Y=1]= \sum_i i P(X=i \mid Y=1) = P(X=1 \mid Y=1) =\dfrac 4 7$$ 故此
(b) 由 (a)可知 $\mathbb{E}[X \mid Y] $ 為隨機變數滿足 $$\mathbb{E}[X \mid Y] = \begin{cases} \mathbb{E}[X\mid Y=0]=\dfrac 5 7 & \text{with probability } \dfrac 3 8, \\[6pt]\mathbb{E}[X\mid Y=1]=\dfrac 4 7 & \text{with probability } \dfrac 5 8. \end{cases}$$
(c) 一但有了隨機變數 $\mathbb{E}[X \mid Y] $ 的機率分布,由 law of iterated expectation 我們可直接計算 $\mathbb{E}[\mathbb{E}[X\mid Y]]$ 並驗證此確實等同於 $\mathbb{E}[X]$。亦即我們計算 $$\begin{align} \mathbb{E}[\mathbb{E}[X\mid Y]] &= \sum_{i} \mathbb{E}[X\mid Y=i] P(Y=i) \\&= 1 \cdot \mathbb{E}[X \mid Y=1] P(Y=1) + \mathbb{E}[X \mid Y=0] P(Y=0) \\& = \dfrac 5 7 \cdot \dfrac 3 8 + \dfrac 4 7 \cdot \dfrac 5 8 = \dfrac {35} {56}\end{align}$$
另一方面,我們直接計算 $\mathbb{E}[X]$ :利用期望值的定義如下 $$\begin{align}\mathbb{E}[X] &= \sum_i i P(X=i) \\&=1 \cdot P(X=1) + 0 \cdot P(X=0) \\ & = P(X=1,Y=0) + P(X=1,Y=1) \\ &= P(X=1|Y=0)P(Y=0) + P(X=1|Y=1)P(Y=1) \\&= \dfrac 5 7 \cdot \dfrac 3 8 + \dfrac 4 7 \cdot \dfrac 5 8 = \dfrac {35} {56}\end{align}$$與前述結果一致,至此得證。
2/09/2020
[數學分析] 一類 max/min operator 作用在分式 的等式
$$
\min_{0 \leq k \leq N} \frac{f(k)}{\max_{i\leq k}f(i)} = \min_{0\leq \ell \leq k \leq N} \frac{f(k)}{f(\ell)}
$$
Proof: 令
$$\frac{f(k_0)}{f(\ell_0)} := \min_{0\leq k\leq N}\frac{f(k)}{ \max_{i\leq k} f(i)}
$$ 其中 $\ell_0\leq k_0$ 使得 $\text{min}_{0\leq\ell\leq k\leq N}\frac{f(k)}{f(\ell)}\leq\frac{f(k_0)}{f(\ell_0)}$。
另一方面,令
$$\frac{f(k_1)}{f(\ell_1)}= \min_{0\leq\ell\leq k\leq N}\frac{f(k)}{f(\ell)}
$$ 且 $\ell_1\leq k_1$,則我們必定有
$$\frac{f(k_0)}{f(\ell_0)}\leq\frac{f(k_1)}{ \max_{i\leq k_1}\;f(i)}\leq\frac{f(k_1)}{f(\ell_1)}$$
由上述結果,我們得到
$$
\frac{f(k_0)}{f(\ell_0)}=\frac{f(k_1)}{f(\ell_1)}
$$ 亦即
$$\min_{0\leq k\leq N}\frac{f(k)}{ \max_{i\leq k} f(i)}= \min_{0\leq\ell\leq k\leq N}\frac{f(k)}{f(\ell)}$$ 至此得證。$\square$
12/18/2019
[隨筆] 博士之路的感謝
夜來一笑寒燈下,始是金丹換骨時
陸游 --- 夜吟
---
昨天 (12/17/2019) 我完成了我的博士論文答辯。我想趁著一切記憶還鮮明的時候 寫寫我的想法與心中的感謝。
心境
從 2013 到執筆寫下這篇文章的今天,六年多將近七年的留美歲月恍如昨日,當日少年轉眼變成大叔。我猶記剛剛踏上 Madison, Wisconsin 時候的大雪紛飛與零下 20 度的氣溫。我瑟瑟發抖,套上好友送的防寒手套,心中想著即將與剛新婚不久的 太太 順瑩 分離,經濟上與課業上的全新挑戰。這是個用英文點杯咖啡都顯得結巴困難的日子。
關於課業與研究
我是在 UW-Madison 電機與電腦工程系 攻讀博士,主修 控制系統 輔修 數學。我有幸師從 B. Ross Barmish 教授,他是 強健控制 與 控制工程在財務應用 的幾位領頭人物之一。
我主要研究領域是落在 隨機系統 與 財務工程 的交集1。讀博期間很慶幸在許多師長的幫助之下,順道取得同校的 數學與電機 雙碩士學位,加上我原本在台灣的機械碩士,僥倖集滿了三碩,多了幾根白髮,發了幾篇文章。最開心的大概是我終於可以厚顏自稱自己是 (應用) 數學家。 彷彿又更接近了一點當年在大學時候的夢想:成為一位 控制理論 學者。 讀博過程,除了研究之外,更常時候是在等待論文審核的時光中度過。填補這個等待就是做新的研究。一個挖坑又自己填坑的過程。很多煎熬,很多難關。許許多多的人在這路上幫助過我,或先或後,或直接或間接,難以計數,我由衷謝謝他們。
關於經濟
除了幾個特定超熱門領域之外,做理論研究並沒有太多經費。所以我得在 興趣 與 麵包 之間做選擇。我選了前者,也因此開啟了長年教課的日子。我感謝 UW-Madison 數學系 與 電機系 願意給我機會擔任 助教 或者 講師 職位。我由衷謝謝他們。
關於博士答辯之後與博士頭銜
答辯之前與答辯之後並沒有不同,答辯之後並沒有讓我對研究領域的認識就瞬間有了質的飛躍,更多時候是細水長流的累積直到答辯的那一刻。論文答辯 本身 不過是給我一個機會 分享總結 自己過去這些年的一些些研究成果。若要說博士頭銜有什麼作用,大概就是讓我得到了一個奢侈的特權:得到申請 助理教授 職位被拒絕的特權。希望這個特權不用被使用太多次...(註: 作者已接受國立清華大學 計量財務金融學系 的邀約成為該系2021年新聘助理教授)
關於家人
我的太太 順瑩 與台灣的家人們 是我最大的後盾。在我讀博期間,不論在經濟上,情感上都給予我極大的支持。為了我的控制學者夢,她三番兩次放下手邊的工作,來到一個語言不是很通的國家,費心分擔家務,照顧年幼的 我兒 亞諾,在此由衷感謝她的愛與付出。
關於信仰
對我而言,人更多是在低處或者痛苦的時候才會想要找到 上帝。我出國前曾經在 板橋基督長老教會 分享過一次 約伯記導讀--苦難的根源,這些年的經歷讓我覺得 神 真是幽默無比,這分享根本就是講給我自己聽的。我感謝我所信的這位 神,他讓我知道我雖經過死蔭幽谷,祂仍眷顧 並與我同行。這條博士之路,我想更是一條恩典之路。
宗翰 2019
於 Madison, Wisconsin
1 關於我的博士論文主題: Contributions to the Theory of Kelly Betting with Applications to Stock Trading: A Control-Theoretic Approach 有興趣的讀者可參考ProQuest連結 或者 個人Dropbox空間連結
[Claude] 國小數學加減乘除法計算小遊戲:數學怪獸大亂鬥
心血來潮用 Anthropic Claude Opus 4.6 做的簡單國小數學乘除法計算小遊戲,感嘆AI工具之強大與便利。原本可能要耗時幾天的工作轉眼就完成,時代的巨輪確實在飛速轉動。 數學怪獸大亂鬥(Math Monster Brawl)對戰的國小數學 加減乘除 小遊戲連結...
-
這次要介紹的是數學上一個重要的概念: Norm: 一般翻譯成 範數 (在英語中 norm 有規範的意思,比如我們說normalization就是把某種東西/物品/事件 做 正規化,也就是加上規範使其正常化),不過個人認為其實翻譯成 範數 也是看不懂的...這邊建議把 ...
-
數學上的 if and only if ( 此文不討論邏輯學中的 if and only if,只討論數學上的 if and only if。) 中文翻譯叫做 若且唯若 (or 當且僅當) , 記得當初剛接觸這個詞彙的時候,我是完全不明白到底是甚麼意思,查了翻譯也...
-
半導體中的電流是由電子(electron)及電洞(hole)兩種載子(carrier)移動所產生 載子移動的方式: 擴散(diffusion) $\Rightarrow$ 擴散電流 (不受外力電場作用) 飄移(drift) $\Rightarrow$ 飄移電流 (...