1章节 01
足球数据分析实战:预期进球模型与球员相似度系统导读项目核心概述
本文介绍了一个基于StatsBomb公开数据的足球分析项目,构建了预期进球(xG)预测模型和球员相似度聚类系统,展示了从数据工程到机器学习模型评估的完整流程。
项目背景与作者
原作者: Guilherme Padinha (具有半职业足球背景的数据工程师)
来源: GitHub项目football-analytics-portfolio
核心问题: 解决职业足球分析中的两大核心问题——射门质量评估与球员风格画像及替代人选搜寻。
2章节 02
项目背景与核心问题足球数据分析的现状
足球数据分析已从边缘爱好发展为职业俱乐部决策的核心支撑,应用于转会评估、战术布置等场景。
项目要解决的问题
射门质量评估: 区分射门机会本身的质量与球员的射门能力。
球员画像与搜寻: 识别球员风格及相似替代人选。
数据来源
项目基于StatsBomb和SkillCorner的公开数据构建。
3章节 03
预期进球(xG)模型构建方法问题定义
xG模型计算给定射门条件下的进球概率,分离射门机会质量与球员能力。
数据选择
训练数据: 勒沃库森2023/24赛季(10,824次射门)、英超2015/16赛季
测试数据: 2024年欧洲杯(1,316次射门)
特征工程
包含几何特征(距离、角度)、技术特征(射门部位、是否受压迫)、情境特征(助攻类型、比分差)等。
模型对比
模型
训练集ROC-AUC
测试集ROC-AUC
逻辑回归
0.786
0.765
梯度提升(调优后)
0.796
0.760
作者指出梯度提升模型未显著超越逻辑回归,且解释性更差。
4章节 04
球员相似度与聚类系统方法问题价值
为转会市场提供数据驱动的球员替代人选搜寻工具。
数据与指标
数据: 英超2015/16赛季,出场时间>900分钟的300名球员
指标: 每90分钟标准化的进攻、组织、防守、盘带指标
聚类策略
按位置分组(后卫/中场/前锋),排除守门员
K-means聚类(K=4),每组独立运行
最近邻查找:基于实际距离排序而非仅聚类成员身份
5章节 05
模型结果与有效性验证xG模型验证
泛化能力: 欧洲杯测试集ROC-AUC(0.765)略低于训练集,校准度更好
可视化: 射门地图、校准曲线、特征重要性、超/低表现排名(如阿圭罗、马赫雷斯)
球员相似度结果
中场聚类: 破坏型(坎特、盖耶)、创造型(厄齐尔、法布雷加斯)
后卫聚类: 进攻型边后卫(克雷斯韦尔、贝莱林)
最近邻: 坎特的最近邻为盖耶、蒂奥特等防守型中场;克雷斯韦尔的最近邻为布伦特等进攻型边后卫
可视化: 雷达图对比球员风格
6章节 06
技术实现与项目亮点技术栈
推断使用Python生态:pandas(数据处理)、scikit-learn(ML模型)、matplotlib/seaborn(可视化)
代码组织
docs/: 项目文档
notebooks/: 分析笔记本
outputs/: 图表与结果
项目亮点
问题导向: 聚焦职业俱乐部实际需求
诚实评估: 坦诚模型局限性(如梯度提升未超越逻辑回归)
领域知识: 特征设计与结果解读融入足球专业知识
可解释性: 可视化工具便于非技术人员理解
外部验证: 结果与历史记忆一致(如英超2015/16赛季超表现榜单)
7章节 07
项目局限性与改进方向数据局限
仅使用单一赛季数据
位置分类粗糙
缺少体能指标
方法局限
K-means假设球形聚类
最近邻用欧氏距离未考虑特征重要性
无时间维度
应用局限
未调整联赛差异
未考虑对手质量
改进方向
验证跨赛季稳定性、细化位置分类、加入体能指标、使用更灵活的聚类方法、考虑对手质量等。
8章节 08
项目总结本项目是高质量的足球数据分析案例,完整展示了从问题定义到结果解释的流程。其技术扎实,且体现了数据科学家的职业素养:诚实评估、领域知识融合、可解释性优先。对体育数据科学学习者而言,是极佳的参考案例。