
Gobert 和 Sabonis 都是中鋒,一個統計模型把他們分開了。
模型看到的不是球員的身高或球隊,是他每分鐘出場時間裡把出手放在球場哪些位置,以及在那些位置上進球的比例。位置標籤沒有進入模型,卻被模型還原出來,而且還原得比標籤本身更細。
Rudy Gobert 在籃框正下方接球,轉身放進。Domantas Sabonis 在同一個位置做同樣的事,但他一個球季裡也會晃到底角投幾記三分。Alperen Şengün 站得更外面一點,短中距離的翻身跳投是常備武器,偶爾也拉到三分線外出手。
球隊名單上,三個人都寫著中鋒。
延世大學統計與資料科學系的 Minsung Choi 與 Seonghyun Jeong 在 2026 年 5 月放上 arXiv 的論文裡,有一個模型在完全不知道這三個人的身高、球隊、位置標籤的前提下,把他們分到了三個不同的群。模型拿到的只有三樣東西:每次出手落在球場上的座標、那球進了沒有,以及球員整季的出場分鐘數。
一個球員就是一團帶標記的點
論文的方法叫 DPM-MPPP,狄氏過程混合的帶標記卜瓦松點過程。名字很長,但拆開來每一塊都對應到投籃圖的一個特徵。
卜瓦松點過程描述「事件散落在一個連續空間上」。一個球員整季的出手位置,就是進攻半場這個二維區域上的一堆點。帶標記,是說每個點還掛著一個屬性;這裡的屬性是二元的,進或不進。狄氏過程混合,則是讓資料自己決定要分成幾群。
作者用的是 2024–25 例行賽的出手紀錄,透過 nba_api 從 NBA 官方統計網站抓下來,總共 219,527 次出手、566 名球員。每名球員的出手數從 1 次到 1,656 次都有,平均 387.9 次,中位數 287 次。差距這麼大,分群很容易被出手量本身主導:出手多的自成一群,出手少的自成一群,空間形狀反而看不見。
論文的處理是給每名球員一個 offset,用他整季的出場分鐘數。強度函數被這個 offset 等比例縮放之後,剩下來的就是單位出場時間的出手分布。總量被除掉了,比較的是形狀。
過去的做法多半要先把球場切開
投籃圖的統計分析不是新題目。附錄裡的文獻回顧列了八篇,各自卡在不同的地方。
Reich 等人 2006 年的作法是把球場離散化,在格子上估出手頻率與效率。Yin 等人 2023 年分群的對象是離散化後的出手強度矩陣,Hu 等人 2023 年則是對分區出手次數跑零膨脹卜瓦松迴歸混合。Wong-Toi 等人 2023 年把前場切成 12 個預先定義的區域,聯合分析出手數與命中率,代價是只能留下每一區都至少出手四次的球員。
還有兩階段的問題。Hu 等人 2021 年用對數高斯考克斯過程做貝氏群組學習,流程明確分成先估後分兩步,而且排除了低出手量球員。Jiao 等人 2021 年同時建模出手強度與出手結果,但球員分群只是對前 50 名射手的擬合參數做的二次分析。
切格子會讓結果受格子大小影響,區域邊界一畫定,同一塊區裡的差異就消失了。兩階段的流程則讓分群的不確定性無從量化。至於矩陣與分區的表示法,因為沒有把空間配置和總出手量分開,總量差異會混進分群目標。
群數是長出來的
狄氏過程混合的用處在這裡。它不需要事先指定群數,模型會依資料決定要用掉幾個成分。
實作上作者設了截斷層級 K 等於 50,集中參數 α 等於 1。跑完之後,按「期望成員數超過 1」這個活躍判準,566 名球員被分進 16 個活躍的群,其中 15 個群包含 5 名以上球員。
強度曲面本身用張量積三次 B 樣條表示,每軸 10 個內部節點,兩軸相乘得到 196 個基底函數,並套上一階貝氏 P 樣條懲罰矩陣做平滑。這是連續的曲面,不是格子。
平方連結換來的解析解
點過程模型最麻煩的一步,是似然函數裡那個對整個定義域的強度積分。用最常見的對數連結,也就是對數高斯考克斯過程,這個積分算不出封閉解,所以才有那些切網格、有限元素、INLA 近似的補救辦法。
作者選的是平方連結:強度等於基底函數線性組合的平方。這樣積分與資料項的期望值都有解析解,ELBO 可以直接寫出來,不需要再疊一層近似。
代價是平方連結有兩個老毛病。係數全部變號,強度曲面完全不變,所以參數不可辨識。線性組合若在定義域內穿過零點,就會產生節線,讓最佳化變得不穩定,對初始值敏感。
論文的解法是把係數限制在嚴格為正的區域,再對這一塊做拉普拉斯近似,並且證明這樣做沒有丟掉東西。定理 2 說,在強變號區域上的經驗準則上確界,以趨近於 1 的機率低於正負同號區域,所以最大值不會落在變號區。定理 3 補上分布層面的部分:變號區域的指數權重相對於正區漸近可忽略,所以排除變號組態不會丟掉漸近上要緊的部分。兩個定理合起來,把拉普拉斯近似擺在正區的受限模態上,就足以涵蓋基底係數這一塊非共軛區塊的局部貢獻。
合成資料上的成績
真實資料沒有標準答案,所以驗證得靠模擬。作者設計了六種設定,涵蓋不同的標記強度幾何形狀、群數、群大小不均,以及事件數多寡;每種設定各生成 100 組獨立資料。
比較對象有四個:分箱後跑 K-means、分箱後跑有限高斯混合、核密度估計後跑 K-means、核密度估計後跑有限高斯混合。這四個基線都被餵了正確的群數,DPM-MPPP 沒有。
以分群純度衡量,DPM-MPPP 在六種設定全部最高。三種完整設定分別是 1.000、1.000、1.000,減量版本是 0.984、0.940、0.945。六種設定裡有五種的最強基線是 KDE + K-means,完整設定拿到 0.941、0.874、0.892,減量版本掉到 0.887、0.793、0.749;剩下的設定 C 完整版由分箱後跑 K-means 以 0.909 略勝。分箱後跑有限高斯混合大多墊底,六種設定都落在 0.60 到 0.73 之間。
資料變少時差距拉開得最明顯。基線靠的是每名球員各自算出來的摘要特徵,樣本一少,特徵就變吵。DPM-MPPP 直接對點樣式建模,同一群裡的球員共用一組群層級的標記強度曲面,資訊在群內互相借用。
十五個群
回到球員。論文附了每一群出手數前五名的代表球員,對照著看,分群的邏輯相當清楚。
得分主力被拆成三群。Cluster 3 是 Shai Gilgeous-Alexander、Cade Cunningham、Devin Booker、DeMar DeRozan、LeBron James。Cluster 14 是 Anthony Edwards、Jayson Tatum、Jalen Green、Tyler Herro、Donovan Mitchell。Cluster 7 則是 Malik Beasley、Tyrese Haliburton、Derrick White、Payton Pritchard、Brook Lopez。三群都屬於球隊的主要得分選項,差別在進攻火力如何分配到禁區、中距離與三分線外。
禁區球員也是三群。Cluster 13 幾乎完全集中在籃框附近,代表球員是 Jarrett Allen、Jalen Duren、Rudy Gobert、Yves Missi、Daniel Gafford。Cluster 5 以籃下為主,額外帶一點底角三分,代表球員是 Domantas Sabonis、Amen Thompson、Onyeka Okongwu、Jimmy Butler III、Nic Claxton。Cluster 15 的短中距離參與度更高,偶爾也在底角以外的三分線出手,代表球員是 Alperen Şengün、Ivica Zubac、Jakob Poeltl、Zion Williamson、Isaiah Hartenstein。
射手型的 Cluster 6 與 Cluster 11 外圍取向相近,Cluster 11 在底角與中央區域的比重稍高。前者代表球員是 Julian Champagnie、Duncan Robinson、Jalen Wilson、Donte DiVincenzo、Royce O'Neale,後者是 Buddy Hield、Jaylen Wells、Georges Niang、Nickeil Alexander-Walker、Kevin Huerter。
命中率曲面是免費附送的
因為進與不進被建成兩個獨立的卜瓦松過程,兩者相加就是總出手強度,相除就得到空間上隨位置變動的命中機率曲面。這在數學上是標記定理與疊加定理的直接結果,不需要另外再建一個命中率模型。
畫出來的圖符合直覺:禁區群的高命中區集中在籃框周圍,射手群的高命中區沿著三分線分布。事件發生與事件結果的依賴關係,由兩個標記強度的相對大小決定。
模型承認的限制
論文自己在結論裡指出,跟許多貝氏無母數混合模型一樣,DPM-MPPP 在資訊量不足的情況下會輕微過度分裂群。設定 C 的減量版本裂得還算溫和:多出來的估計成分,是從真實群 2 和真實群 4 分裂出來的小衛星,各只帶走 2 名個體。設定 B 的減量版本裂得更開,真實群 2 被拆成 13 人與 9 人兩塊。
另一個限制是標記。目前的公式只處理離散標記,這篇用的是二元的進或不進。作者把連續標記列為後續工作的方向,那會讓同一套框架可以處理更豐富的事件層級屬性。
投籃圖只是這篇論文的驗證場地。同樣的結構出現在腫瘤病理影像的細胞標記、星系分布的形態標記、犯罪熱點的類型標記上。共同的形狀是:一群受試對象,每個都產生一堆帶屬性的事件,而你想知道他們可以分成幾類。