§21-4  算子範數

合用的放大倍率不只一個——其中有沒有最小的?如果有,它算得出來嗎?而把每個線性函數對應到這個數,得到的會不會又是一個 norm?

最小的那個倍率

電梯門口貼著「載重上限 1000 公斤」。這個數字不能亂訂:訂得太低,明明載得動的人被擋在外面;訂得太高,這塊牌子就等於沒有保障。真正有意義的是那個「剛好載得動」的臨界值,其餘的數字都是它的粗略版本。

上一篇算出的 A 是一個合用的倍率,可是例 5 的實測明顯寬鬆:上限 0.0866,實際只用到 0.0583。而且合用的倍率顯然不只一個——任何比 A 大的數也照樣合用。那麼有沒有最小的一個?

要找最小的倍率,先看它在做什麼事:倍率 M 合用,意思是每個 x 的像都不超過 M 倍長。既然線性函數把長度按比例放大,只要看長度不超過 1 的那些點被拉到多長就夠了。

DEFINITION
Let f: ℝᵖ → ℝ^q be linear. Define
  ‖f‖ = sup {‖f(x)‖ : x ∈ ℝᵖ, ‖x‖ ≤ 1}.
The set of all linear functions on ℝᵖ to ℝ^q is written L(ℝᵖ, ℝ^q).
把半徑 1 的球送進 f,量一量像最遠跑到哪裡——那個距離就是 ‖f‖。這個 sup 存在:那個集合非空(x = 0 給出 0),而且被上一篇的 A 界住,於是完備性公理 6.4 交出最小上界。(存在不等於被某個 x 取到——引理談 inf 時會再分這兩件事。)
正例:投影 P(x, y) = (x, 0) 的 ‖P‖ = 1——‖(x, y)‖ ≤ 1 時 ‖P(x, y)‖ = |x| ≤ 1,而 (1, 0) 恰好取到 1。反例:‖x‖ ≤ 1 這個限制不能省——拿掉之後那個集合對任何非零的 f 都無界,因為把 x 放大 t 倍,像就跟著放大 t 倍,根本沒有 sup 可言。
1 f A ‖f‖ 半徑 1 的球 最小的那個半徑

這張圖在說 ‖f‖ 量的是什麼:藍色的橢圓形是半徑 1 的球被送過去之後的樣子,紅色實線圓是裝得下它的最小的球,半徑就是 ‖f‖。灰色虛線圓是上一篇的 A 給的保證——它一定裝得下,但通常留了空隙。像被拉長成不是圓的形狀,正是因為不同方向被放大的倍數不一樣。

LEMMA
(a) For every x ∈ ℝᵖ we have ‖f(x)‖ ≤ ‖f‖ ‖x‖, and
  ‖f‖ = inf {M > 0 : ‖f(x)‖ ≤ M‖x‖ for all x ∈ ℝᵖ}.
(b) L(ℝᵖ, ℝ^q) is a vector space under pointwise addition and scalar multiplication, and f ↦ ‖f‖ is a norm on it.
(a) 回答了本篇的問題:合用的倍率有很多個,最小的那一個就是 ‖f‖ 自己。f 不是零函數時 ‖f‖ 本身就落在那個集合裡,inf 取得到;零函數時集合是全部的正數,inf 是 0,仍然等於 ‖f‖,只是取不到。(b) 說明這個記號不是借用——它真的守 8.5 的 norm 四條規格。
正例:投影 P 的 ‖P‖ = 1,而 (a) 說 ‖P(x, y)‖ ≤ ‖(x, y)‖——取 (3, 4) 驗:左邊是 3、右邊是 5。反例:(b) 的三角不等式不能改成等號——取 P(x, y) = (x, 0) 與 Q(x, y) = (0, y),兩者的 norm 都是 1,可是 P + Q 是恆等函數,norm 也是 1,不是 2。
PROOF

記 S = {M > 0 : ‖f(x)‖ ≤ M‖x‖ 對所有 x 成立}。(a) 要證兩件事:‖f‖ 自己合用,而且沒有比它更小的合用者。(b) 逐條驗 8.5 的四條規格。

證明計畫 · 由所求想起
(a) 合用:定義只管半徑 1 以內的點,而要證的是所有點。把任意的 x 先縮成單位長度,用定義壓住,再把縮放倍數乘回去——齊次性讓這一來一回不留痕跡。
最小:任何一個合用的 M,在半徑 1 以內都壓得住那些像,所以它是那個集合的上界;而 ‖f‖ 是最小上界,於是 ‖f‖ ≤ M。
(b) 加法與純量倍都是逐點做的,四條規格各自翻譯成「對半徑 1 以內的每個 x 成立」,再取一次 sup。

Proof.  (a) If x = 0, then f(x) = 0 and both sides vanish. If x ≠ 0, put u = x/‖x‖, so that ‖u‖ = 1. Homogeneity gives f(u) = f(x)/‖x‖, hence
  ‖f(x)‖ / ‖x‖ = ‖f(u)‖ ≤ ‖f‖,
which is the asserted inequality.
這一步的所求:把定義的適用範圍從單位球推到全空間。做法是先縮後放:u 與 x 指向同一個方向而長度恰好是 1,定義管得到它;再靠齊次性把 ‖x‖ 這個倍數原封乘回去。拿投影 P 與 x = (3, 4) 對照:‖x‖ = 5、u = (0.6, 0.8)、P(u) = (0.6, 0) 長度 0.6 ≤ ‖P‖ = 1,乘回 5 得 3,正是 ‖P(x)‖。x = 0 要單獨講一句,因為那時除不得。
Now let M ∈ S. If ‖x‖ ≤ 1, then ‖f(x)‖ ≤ M‖x‖ ≤ M, so M is an upper bound of the set whose supremum defines ‖f‖; hence ‖f‖ ≤ M. Thus ‖f‖ is a lower bound of S. If ‖f‖ > 0, the first paragraph shows ‖f‖ ∈ S, so ‖f‖ = inf S. If ‖f‖ = 0, the first paragraph forces f(x) = 0 for every x, so every M > 0 belongs to S and inf S = 0 = ‖f‖.
這一步的所求:說明沒有更小的合用者。論證的兩句話用的是同一個工具的兩面——‖f‖ 是最小上界,所以任何上界都不小於它;而每個合用的 M 恰好都是上界(§6-1 的 6.2 就是這樣定義 sup 的)。要留意 S 只收正數,所以零函數得單獨處理:那時 S 是全部的正數,它的 inf 是 0,恰好也是 ‖f‖。
(b) If f, g are linear and c ∈ ℝ, then f + g and cf satisfy the defining equation by direct computation, so L(ℝᵖ, ℝ^q) is closed under the pointwise operations of the function space and is a vector space.
這一步只需要驗封閉性。逐點定義的加法與純量倍在 §8-1 例 2(函數空間 ℝ^S)就已經領過 vector space 的照,所以八條公理不必重驗;要查的只有「兩個線性函數的和還線性嗎」——把定義的等式對 f 與 g 各寫一次再相加即可。§17-3 的 17.8 對有界函數空間走的也是同一條路。
For the norm axioms, let ‖x‖ ≤ 1 throughout. Non-negativity is clear. If ‖f‖ = 0, then part (a) gives f(x) = 0 for every x, and conversely the zero function has norm 0. Next ‖(cf)(x)‖ = |c| ‖f(x)‖, and taking suprema gives ‖cf‖ = |c| ‖f‖. Finally ‖(f + g)(x)‖ ≤ ‖f(x)‖ + ‖g(x)‖ ≤ ‖f‖ + ‖g‖, so ‖f‖ + ‖g‖ is an upper bound and ‖f + g‖ ≤ ‖f‖ + ‖g‖.
四條規格逐條翻譯。三角不等式那一條的模式值得記住:先在每一個 x 上把左邊壓住,得到的上限與 x 無關,於是它是整個集合的上界,最小上界自然不超過它。齊次性那一條在 c = 0 時兩邊都是 0,c ≠ 0 時把正的常數提出 sup 之外即可。
最小的合用倍率存在,就是 ‖f‖;而這個記號守得住 norm 的四條規格。∎
u x ‖u‖ = 1 先縮到單位長度 估完再乘回去

這張圖在說 (a) 的第一步做了什麼:x 與 u 在同一條射線上,只差一個正的倍數 ‖x‖。定義只認得虛線圓以內的點,而 u 恰好在圓上;齊次性讓「縮進去再放回來」不留任何痕跡,所以在單位球上得到的結論可以原封搬到全空間。

例 6把倍率算到剛好
A 到底鬆了多少?真正的 ‖f‖ 算得出來嗎?
  1. 取 §21-2 例 3 那個映射 f(x, y) = (2x + y,  x,  −y)。上一篇算得 A = √7 ≈ 2.646。
  2. 先求上界。直接展開:
      ‖f(x, y)‖² = (2x + y)² + x² + y² = 5x² + 4xy + 2y²。
    猜答案是 √6,於是要證 5x² + 4xy + 2y² ≤ 6(x² + y²)。移項配方:
      6(x² + y²) − (5x² + 4xy + 2y²) = x² − 4xy + 4y² = (x − 2y)²,
    平方恆非負,不等式成立。
  3. 於是 ‖(x, y)‖ ≤ 1 時 ‖f(x, y)‖² ≤ 6(x² + y²) ≤ 6,取 sup 得 ‖f‖ ≤ √6。
  4. 再求下界。配方那一步在 x = 2y 時恰好歸零,所以取那個方向的單位向量 u = (2, 1)/√5。算一次:f(2, 1) = (5, 2, −1),長度 √30,除以 √5 得 √6。所以 ‖f‖ ≥ √6。
  5. 兩邊會師:‖f‖ = √6 ≈ 2.449,而 A = √7 ≈ 2.646。δ(ε) = ε/√6 因此也合用,比 ε/√7 寬鬆約 8%。
  6. 順帶量另一個方向:與 (2, 1) 垂直的方向上,‖f(u)‖ 恰好是 1——同一個函數在不同方向上的放大倍數從 1 到 √6 都有,而 ‖f‖ 記的是其中最大的那個。
求 ‖f‖ 的標準手法是上界與下界各走一趟:上界靠代數不等式,下界靠交出一個真的取到的方向。兩邊會師才算算完——只證上界不能斷言那是最小的。要留意 A 並非沒有用,它便宜(看一眼表就算得出來)而且永遠合用;‖f‖ 精確,可是每個函數都要重新解一次不等式。
A ‖f‖ 1 最大 最小 0π/2π 單位向量轉一圈時像的長度

這張圖是例 6 的實際數值:橫軸是單位向量的方向角,縱軸是它的像的長度。曲線的最高點恰好碰到紅色虛線 ‖f‖ = √6 ≈ 2.449,最低點落在 1。灰色虛線的 A = √7 ≈ 2.646 整條都在曲線上方而且沒有碰到——這就是「合用但不是最小」的樣子。曲線在半圈之後重複,因為方向相反的單位向量像的長度相同。

最後看一件與 §20-5 的 20.8(合成保連續)呼應的事:兩個線性函數接起來,倍率會怎麼變。

THEOREM
Let g: ℝᵖ → ℝ^q and f: ℝ^q → ℝʳ be linear. Then f∘g: ℝᵖ → ℝʳ is linear and
  ‖f∘g‖ ≤ ‖f‖ · ‖g‖.
The inequality may be strict.
兩道工序接起來,總倍率不超過兩者相乘。等號不必成立——前一道送出去的方向,後一道未必照樣賣力放大。
正例:取 g 為「乘 3」、f 為「乘 2」(都在 ℝ 上)。‖g‖ = 3、‖f‖ = 2,而 f∘g 是「乘 6」,norm 恰好是 6——等號成立。反例:例 7 會給出嚴格不等的情形。
PROOF

兩件事要證:合成仍線性,以及倍率的估計。第一件是直接代入,第二件把引理的 (a) 連用兩次。

證明計畫 · 由所求想起
線性:所求是合成滿足定義的等式。把 g 的線性用一次讓係數穿過內層,再把 f 的線性用一次讓係數穿過外層。
倍率:所求是半徑 1 以內的像的一個上界。由外往內剝——先用 (a) 把外層的 f 換成 ‖f‖ 乘上內層的像,再用一次 (a) 把內層的像也換掉。

Proof.  The domain of g is all of ℝᵖ and its values lie in ℝ^q, which is the domain of f; so by 2.2 the composition has domain ℝᵖ. For a, b ∈ ℝ and x, y ∈ ℝᵖ,
  (f∘g)(ax + by) = f(ag(x) + bg(y)) = a f(g(x)) + b f(g(y)),
so f∘g is linear.
這一步的所求:合成的線性。兩個等號各用一次線性,次序是先內後外:第一個等號把係數搬過 g,第二個等號把它們搬過 f。定義域那一句不是多餘的——§2-2 的 2.2 規定合成的定義域是「f 吃得下 g 的輸出」的那些點,而這裡 g 的值域整個落在 f 的定義域裡,所以一個點都沒被剔掉,21.1 要求的「定義域是整個 ℝᵖ」才成立。
Now let ‖x‖ ≤ 1. Applying part (a) of the Lemma to f and then to g,
  ‖f(g(x))‖ ≤ ‖f‖ ‖g(x)‖ ≤ ‖f‖ ‖g‖ ‖x‖ ≤ ‖f‖ ‖g‖.
Hence ‖f‖ ‖g‖ is an upper bound of the defining set, and ‖f∘g‖ ≤ ‖f‖ ‖g‖.
這一步的所求:一個與 x 無關的上界。剝的次序是由外而內:第一個不等號把 f 換掉,剩下的 ‖g(x)‖ 又是引理管得到的形狀,第二個不等號把它也換掉。最後一個不等號用掉 ‖x‖ ≤ 1。三步之後右邊完全不含 x,於是它是上界,最小上界不超過它。等號會不會成立,證明本身沒有回答——那要看兩道工序的方向搭不搭。
接起來的總倍率不超過兩者相乘,而這個估計只用了引理的 (a)。∎
例 7倍率從 1 掉到 0
什麼時候上一條的不等號會是嚴格的?
  1. 取 g(x, y) = (0, y) 與 f(x, y) = (x, 0),兩個都是平面上的投影。
  2. 兩者的 norm 都是 1:‖(x, y)‖ ≤ 1 時 ‖g(x, y)‖ = |y| ≤ 1 且 (0, 1) 取到 1;f 同理,由 (1, 0) 取到。
  3. 算合成:(f∘g)(x, y) = f(0, y) = (0, 0),對每一個點都是零向量。所以 ‖f∘g‖ = 0。
  4. 對照定理:0 < 1 · 1 = 1,嚴格不等。
  5. 機制講得出來:g 把整個平面壓到縱軸上,而 f 恰好把整條縱軸壓成原點。g 最賣力的方向,正是 f 完全放棄的那一個。
不等號能不能取等,看的是「前一道最賣力的方向」與「後一道最賣力的方向」搭不搭。兩者對齊時取等(定理卡的正例就是這樣,一維空間只有一個方向),完全錯開時像這個例子一樣掉到零。‖f∘g‖ ≤ ‖f‖‖g‖ 只保證上限,不保證用得到。
gf 原本的平面 壓到縱軸 再壓成原點

這張圖在說例 7 的機制:第一道把整個平面壓到縱軸上,第二道再把縱軸整條壓成原點。兩道各自都不把任何長度放大,而且各有一個方向的長度被原封保留(所以 norm 都是 1),接起來卻把一切歸零——因為第一道保留下來的那個方向,恰好是第二道要丟掉的那一個。要留意 norm 是 1 並不代表每個向量的長度都不變:g(1, 0) = (0, 0) 就被壓掉了。這正是 ‖f∘g‖ ≤ ‖f‖‖g‖ 只能寫成不等號的理由。

—— 第四階段到此結束 ——

本篇把「合用的倍率」收攏成一個數:‖f‖ 是單位球上像的最遠距離,而引理證明它恰好是最小的合用倍率,並且守得住 norm 的四條規格。例 6 用配方與一個取到極值的方向,把上界與下界逼到會師 √6,看出上一篇的 √7 鬆了約 8%。合成的估計把引理的 (a) 連用兩次就結束,而例 7 說明那個不等號真的可能嚴格。本節到此收工,起來走一走。

下一幕預告

線性函數的連續性之所以一次驗得完,是因為它的行為被一張有限大小的表完全鎖死。可是絕大多數的函數沒有這種結構,前一節那些例子就是。

接下來要換一個方向找出路:不去限制函數,改去限制定義域。前一節談的都是一個點附近發生的事;下一節問的是整個定義域上的事——連續函數把 compact 的集合送到什麼樣的集合,把 connected 的集合又送到什麼樣的集合。§11-2 的 Heine-Borel 定理與 §12-3 的 12.8(ℝ 的連通子集恰好是區間)會在那裡一起被兌現,而兌現出來的結論相當實用:閉區間上的連續函數一定取得到最大值,也一定不會跳過任何中間值。