足球比赛的预测准确率长期徘徊在一个不高的水平,即使是最好的模型也很难稳定超过六成。华体会官网把这个现象的原因讲清楚,包括足球这项运动本身的数据特征,以及模型建设里的几个硬约束。

1、可用数据的历史长度限制了模型
高质量的追踪数据只有近十年左右的历史,更早的比赛只有基础统计。这意味着模型可用的训练样本很有限,尤其是淘汰赛与关键场次的样本更少。同时足球的战术演变很快,十年前的数据对今天的预测价值有限,因此模型必须对近期数据赋予更高权重,这进一步减少了有效样本量。样本不足是足球预测模型最根本的约束,比算法选择的影响大得多。
2、特征选择比算法更重要
常用的特征包括近期表现、主客场差异、休息天数、伤停名单、历史交锋、进球与失球的预期值差、以及联赛排名。研究发现最有预测力的特征往往不是最直观的那些:预期进球差比实际进球差更稳定,休息天数比排名更重要,主客场差异在某些联赛里几乎消失。算法方面,简单的回归模型与复杂的机器学习模型差距不大,这再次说明瓶颈在数据而不在方法。

3、评估方法决定了结论的可信度
评价一个预测模型不能只看它猜对了多少场,因为随机猜测也能达到三成左右,而总是猜主队胜就能达到四成多。正确的评估指标是与这些基准比较的提升幅度,以及概率校准程度,也就是模型预测六成胜率的比赛里,实际是否真的有六成赢了。很多公开宣称准确率高的模型,用的是错误的基准或者只在特定时段测试,这类结论不可信。
4、模型在什么情况下会明显失效
有几类比赛是所有模型的共同难点。第一类是赛季初,因为球队阵容变化大,历史数据失去参考价值。第二类是换帅之后的前几场,新战术的影响无法量化。第三类是关键保级战与决赛,心理因素权重上升,而这些因素没有数据可采集。第四类是天气或场地出现异常的比赛。因此一个诚实的模型会给出置信度,在这些场景下主动降低置信度,而不是给出一个看起来很确定的概率。
5、预测模型的真正用途不是猜结果
俱乐部使用预测模型的方式与公众想象的不同。他们不用模型预测单场比赛的胜负,而是用它评估战术调整的效果,比如改变防线高度后失球概率会怎么变化;或者用它做赛季规划,估算不同引援方案对最终排名的影响。这类用途关注的是概率分布的变化,而不是某一次的预测结果。这才是预测模型在职业足球里的真实位置,也是它最有价值的地方。
6、预期进球模型是怎么建出来的:从坐标到概率
预期进球模型的输入是每一次射门的若干特征,最基础的是射门点到球门的距离与角度,这两项决定了理论上的可射门面积。在此之上会加入射门方式,头球、脚内侧推射、正脚背抽射与凌空抽射的转化率差别很大;加入身体状态,静止射门、跑动中射门与失衡状态下的射门分别建模;加入防守压力,最近防守者的距离与门将是否已经封堵近角;加入比赛情境,包括比分状态与比赛时间,因为落后时的射门往往更仓促。模型的输出是这一次射门的进球概率,通常用逻辑回归或梯度提升树拟合,训练样本是历史上几十万次射门的结果。模型质量的评估用对数损失而不是准确率,因为预测的是概率而不是结果。不同供应商的模型差异主要来自特征集合与样本范围,有的只用基础特征,有的加入追踪数据计算门将的实际站位,后者的精度明显更高但只覆盖有追踪系统的联赛。使用预期进球时最重要的一条是:它是长期指标,单场比赛的预期进球差几乎没有解释力,必须累积十场以上才能看出稳定的能力差异。
7、低分项目让随机性占主导
足球一场比赛的平均进球数不到三个,这个特征决定了随机因素的影响力远大于其他运动。在高分项目里,实力差距会在大量得分机会里被平均掉,因此强队胜率更高;在足球里,一次误判、一次门柱、一次个人失误就能改变结果。统计上这表现为爆冷频率高,实力明显占优的一方胜率往往只有五到六成。任何模型都无法消除这层随机性,它只能在这层随机性之上做出概率估计。
看预测可以先问基准是多少
下一次看到一份比赛预测的准确率,先问它的对照基准是什么。华体会官网的经验是,没有基准的准确率数字没有任何意义,而提供基准的分析通常也更可靠。