1章节 01

足球数据分析实战:预期进球模型与球员相似度系统导读项目核心概述

本文介绍了一个基于StatsBomb公开数据的足球分析项目,构建了预期进球(xG)预测模型和球员相似度聚类系统,展示了从数据工程到机器学习模型评估的完整流程。

项目背景与作者

原作者: Guilherme Padinha (具有半职业足球背景的数据工程师)

来源: GitHub项目football-analytics-portfolio

核心问题: 解决职业足球分析中的两大核心问题——射门质量评估与球员风格画像及替代人选搜寻。

2章节 02

项目背景与核心问题足球数据分析的现状

足球数据分析已从边缘爱好发展为职业俱乐部决策的核心支撑,应用于转会评估、战术布置等场景。

项目要解决的问题

射门质量评估: 区分射门机会本身的质量与球员的射门能力。

球员画像与搜寻: 识别球员风格及相似替代人选。

数据来源

项目基于StatsBomb和SkillCorner的公开数据构建。

3章节 03

预期进球(xG)模型构建方法问题定义

xG模型计算给定射门条件下的进球概率,分离射门机会质量与球员能力。

数据选择

训练数据: 勒沃库森2023/24赛季(10,824次射门)、英超2015/16赛季

测试数据: 2024年欧洲杯(1,316次射门)

特征工程

包含几何特征(距离、角度)、技术特征(射门部位、是否受压迫)、情境特征(助攻类型、比分差)等。

模型对比

模型

训练集ROC-AUC

测试集ROC-AUC

逻辑回归

0.786

0.765

梯度提升(调优后)

0.796

0.760

作者指出梯度提升模型未显著超越逻辑回归,且解释性更差。

4章节 04

球员相似度与聚类系统方法问题价值

为转会市场提供数据驱动的球员替代人选搜寻工具。

数据与指标

数据: 英超2015/16赛季,出场时间>900分钟的300名球员

指标: 每90分钟标准化的进攻、组织、防守、盘带指标

聚类策略

按位置分组(后卫/中场/前锋),排除守门员

K-means聚类(K=4),每组独立运行

最近邻查找:基于实际距离排序而非仅聚类成员身份

5章节 05

模型结果与有效性验证xG模型验证

泛化能力: 欧洲杯测试集ROC-AUC(0.765)略低于训练集,校准度更好

可视化: 射门地图、校准曲线、特征重要性、超/低表现排名(如阿圭罗、马赫雷斯)

球员相似度结果

中场聚类: 破坏型(坎特、盖耶)、创造型(厄齐尔、法布雷加斯)

后卫聚类: 进攻型边后卫(克雷斯韦尔、贝莱林)

最近邻: 坎特的最近邻为盖耶、蒂奥特等防守型中场;克雷斯韦尔的最近邻为布伦特等进攻型边后卫

可视化: 雷达图对比球员风格

6章节 06

技术实现与项目亮点技术栈

推断使用Python生态:pandas(数据处理)、scikit-learn(ML模型)、matplotlib/seaborn(可视化)

代码组织

docs/: 项目文档

notebooks/: 分析笔记本

outputs/: 图表与结果

项目亮点

问题导向: 聚焦职业俱乐部实际需求

诚实评估: 坦诚模型局限性(如梯度提升未超越逻辑回归)

领域知识: 特征设计与结果解读融入足球专业知识

可解释性: 可视化工具便于非技术人员理解

外部验证: 结果与历史记忆一致(如英超2015/16赛季超表现榜单)

7章节 07

项目局限性与改进方向数据局限

仅使用单一赛季数据

位置分类粗糙

缺少体能指标

方法局限

K-means假设球形聚类

最近邻用欧氏距离未考虑特征重要性

无时间维度

应用局限

未调整联赛差异

未考虑对手质量

改进方向

验证跨赛季稳定性、细化位置分类、加入体能指标、使用更灵活的聚类方法、考虑对手质量等。

8章节 08

项目总结本项目是高质量的足球数据分析案例,完整展示了从问题定义到结果解释的流程。其技术扎实,且体现了数据科学家的职业素养:诚实评估、领域知识融合、可解释性优先。对体育数据科学学习者而言,是极佳的参考案例。

Copyright © 2088 世界杯德国7比1巴西|2010 世界杯|MPM-DPM三部曲世界杯策略分析站|mpmdpmtrilogi.com All Rights Reserved.
友情链接