世界杯决赛第 106 分钟,费兰·托雷斯左脚破门,西班牙 1 比 0 战胜阿根廷,时隔 16 年再次捧起大力神杯,梅西的世界杯之旅就此画上句号。在球迷狂欢之余,赛前的一组预测数据也被重新翻了出来:体育数据公司 Opta 曾利用超级计算机模拟赛事,给西班牙约 60% 的捧杯概率,阿根廷约 40%。但这真的有什么好吹嘘的呢?决赛只有两支队伍,即便纯粹靠运气蒙,猜中的概率也有百分之五十。
真正让 Opta 令人称奇的,是有网友发现,早在世界杯开赛前,Opta 就将西班牙列为夺冠头号热门。更巧的是,当时它给出的夺冠概率前四名,与最终杀进半决赛的四支球队完全吻合,一个不差。
我不禁思考,如果将这种技术应用于博彩,岂不是能轻松获利?于是 APPSO 深入挖掘了 Opta 预测背后的 2.5 万次模拟,探究 AI 预测究竟是否真的不依赖运气。需要强调的是,本文仅复盘预测方法与公开数据,不提供任何投注建议。
Opta 的答案经历了怎样的调整?
Opta 是 Stats Perform 旗下的体育数据品牌,自 1996 年起便开始记录足球比赛。Stats Perform 总部位于伦敦,专注于比赛数据的采集与分析,并向转播机构、媒体、球队和博彩平台提供统计及预测产品。西班牙最终夺冠,Opta 在决赛前确实将其列为更有希望的一方。那张 59.5% 对 40.5% 的图表,仅仅是最终的一个节点。
在同篇决赛前瞻中,Opta 还预测了双方在 90 分钟常规时间内的比赛结果。它给出的最高概率选项是西班牙获胜,但实际比赛踢到 90 分钟时,比分仍是 0 比 0。我自己当时也据此购买了西班牙常规时间获胜,最终自然没有命中。西班牙虽然最终在加时赛夺冠,但对投注而言,猜中冠军和押中 90 分钟赛果完全是两码事。Opta 给出的 90 分钟赛果概率为:西班牙胜 45%、平局 29%、阿根廷胜 26%。这与包含加时和点球在内的最终夺冠概率口径不同。
开赛前,Opta 模拟了 2.5 万届世界杯。西班牙以 16.1% 的夺冠率排名第一,随后依次是法国 13.0%、英格兰 11.2% 和阿根廷 10.4%。一个月后,真正进入半决赛的球队,恰好也是这四支。Opta 当时发布的是夺冠概率榜,并未直接圈定四强名单,但榜单前四与实际四强的完美重合,比单纯押中西班牙多了一层看点。
随着赛事推进,西班牙的夺冠概率并非一路飙升:小组赛结束后降至 13.5%;32 强赛结束再降至 13.0%;16 强赛结束后回升至 21.3%;八强赛结束后为 23.4%。直到西班牙淘汰法国进入决赛,夺冠率才跃升至 59.5%。
将这六个数字连起来看,很容易产生一种错觉:Opta 似乎随着比赛推进,越来越看懂了西班牙。但这并非在反复回答同一道题。每踢完一轮,模型面临的局面都会发生变化:这支队伍刚刚表现如何、下一场对手是谁、晋级路线顺不顺,这些信息都会输入到下一次计算中。
到半决赛阶段,变化更为明显。西班牙淘汰法国,阿根廷也顺利过关,冠军候选从四支缩减至两支。此时西班牙的夺冠率从 23.4% 蹦升至 59.5%,并非模型突然开了天眼,而是它已经跨过了半决赛,距离冠军仅剩最后一场。换句话说,曲线上升的每一个台阶,背后都是一场已经结束的比赛,不确定性被逐步消除。到了决赛前只剩两支球队,59.5% 更像是一道算术题,而非预测。
至于模拟 2.5 万次,它解决的是另一个问题:让计算结果更加稳定。相同条件下多模拟几次,可以减少随机波动,但无法保证模型一开始估计的概率就是对的。这就好比一台未校准的体重秤,称一次显示 65 公斤,称一百次还是 65,稳得让人想信。但你实际可能是 75 公斤,初始数字就掺杂了误差。更何况,Opta 并未公开完整的代码、输入和参数,外人无法重跑整套预测。西班牙夺冠只能说明这次方向押对了,无法凭此证明模型长期靠谱。
不同 AI 的预测逻辑
这届世界杯出现了至少四种 AI 预测。把它们混在一起比较,准确率很容易越算越糊涂。联想与咪咕留下了连续百场的记录,比随手问一句谁夺冠要扎实得多。AI vs the World Cup 则更进一步:统一资料与提示词、锁定版本,并要求模型给出概率,还将赛前预测做成数字指纹留档。而 Opta 则根本不是聊天机器人,它是一条专门的体育数据和概率模拟管道。
目前公开的连续记录显示,大模型预测足球比赛的命中率大多在六成多。联想和咪咕统计了世界杯前 100 场比赛,12 款模型每场都要判断主胜、平局或客胜,累计 1200 次预测,整体命中率为 65.7%。同场活动的普通用户命中率仅为 58.9%。这十二款模型加在一起,也仅比普通人多对了不到 7 个百分点。另一个项目 AI vs the World Cup,让 5 款模型使用同一份资料和提问方式,持续预测整届世界杯,最终猜对比赛走向的比例约为 68.0% 至 70.2%。小组赛阶段判断 90 分钟内胜负平;淘汰赛阶段则变为预测哪支球队能晋级。
然而,这两组数字不能直接用来排高低。它们测试的不是同一批模型,资料、提问方式和更新时间不同,连猜对的定义也不完全一致。联想与咪咕主要统计胜平负,而 AI vs the World Cup 在淘汰赛统计的是晋级结果。因此,68% 不一定比 65.7% 更强。这些项目的价值在于记录了每一场预测,而不是比赛结束后只挑猜中的结果展示。要判断大模型究竟比普通竞猜强多少,需要在相同题目、信息和规则下,与简单预测方法及赛前赔率进行比较。
Opta 做的事情则大相径庭。大模型往往是读完资料后直接给出谁会赢的判断;Opta 则先建立一套专门的足球数据系统,再根据这些数据计算不同结果发生的概率。其数据来源是长期、标准化的比赛记录。每场比赛都会由专业人员按照统一规则,记录射门、传球、犯规等 60 多类场上事件。比赛进行时有工作人员同步检查,赛后还会复核,尽量减少漏记和错记。简而言之,Opta 的概率不是靠几篇赛前新闻猜出来的,而是依赖大量、长期、反复核对的比赛数据。X 用户 Alexander Bogachev 展示了一段 3D 重建视频,正是基于 Opta 的比赛事件数据,将每一次传球、射门和进球还原成了一场可视化的比赛。
AI 最容易在平局上栽跟头
联想与咪咕的百场数据中,AI 对 76 场分出胜负的比赛,方向命中率达到 81.0%;但遇到 24 场平局时,命中率骤降至 17.0%。在 15 场 12 款模型全错的比赛中,有 11 场是平局。APPSO 也曾用 Fable 5 做过小额实验:大模型辅助写代码、回测和查漏洞,概率则由球队实力评分 Elo、进球分布和市场赔率计算。按本地记录拆分,23 笔投注净利 741.5 元,但样本太小且中途有临时加注。回看小组赛,模型第一选择命中 44 场,却一次都没把平局列为最可能结果。
即便猜对六成,照样可能亏钱。假设赔率为 1.60,命中率为 60%,粗略期望值仍是 0.6 × 1.60 – 1 = -4%。足球是低比分项目,一张红牌、一次折射或门将的一次判断,足以让最可能的结果输给第二、第三可能。模型可以预留这些小概率结果的位置,却无法提前知道意外会在哪一分钟发生。例如最后的冠军预测,模型猜对了西班牙胜利,却没料到 90 分钟内 0 比 0 平局,而加时赛不计入胜平负投注结果。
实际上,Opta 的这套预测技术早已不仅用于谁夺冠的营销,博彩公司也在深度使用。Stats Perform 是一家专门收集和提供体育比赛数据的公司,FIFA 授权它将世界杯的官方比赛数据提供给合法博彩公司。博彩公司拿到数据后,利用这些数据计算赔率、在比赛过程中实时调整赔率,并在赛后确认投注结果。此外,像 Sportradar 这样的体育数据公司也提到,机器学习会帮助博彩公司定赔率、根据投注情况调整赔率,以及发现异常投注、控制可能的损失。
这些合作表明,AI 和数据模型已经进入博彩公司的生产系统,用于提速、批量处理和辅助定价,确实是能搞钱的。但作为普通人需注意,你拿到同一批公开信息,并不等于能长期赢过市场;博彩公司在使用模型,且赔率里已经留有它们的利润,它们早就把意外提前算进了概率里。
