深圳赛区当季表现
负责选手与英雄在位置维度上的长期表现,是登场率与分钟经济差的主要样本来源,也是每周同步体量最大的一条线。
编辑部说明
LOL押注正规平台中文官网日常只做两件事:把赛区对局整理成结构化的读数,以及把读数的来源写清楚。这个页面讲的是后者——一条对局记录经过谁的手、按什么标准变成面板上的数字和句子,以及一旦出错,我们以什么方式对外交代。
起点
赛区数据最怕两件事:样本太散,口径太活。把范围先收在当季深圳赛区与成都对局两条线上,单赛季的对局密度足够支撑按位置做五组拆分,也足够让同一名选手的分钟经济差在一段时间里保持可比。范围一旦放宽,口径就会跟着漂移,读者看到的曲线也就失去了前后对照的意义。
第二个理由和读的人有关。多数人查数据时想要的并不是一张更全的表,而是一个能回答具体问题的数字:这个位置谁的经济差靠前、这场对局的曲线在第几分钟转向。把口径摊开讲,等于把结论背后的算法一并交出去,读者才有办法判断这个数字值不值得信。
加工链路
从原始记录到面板上的一行读数,中间隔着一串固定顺序的加工步骤。前四步由脚本完成,第五步是唯一需要人坐下来逐条看的关口。
比赛日结束后,对局记录按赛段与对局编号入库,只保留结构字段,不做任何推算。
脚本按位置把选手与英雄的对应关系拆成五组,登场率在这一步才具备计算前提。
脚本十二类可视指标由同一套脚本产出,经济曲线按分钟采样,模型读数单独走一条计算链。
脚本校验组按分层抽样核对计算结果,给异常条目写回查说明。整条链路只有这一步需要人判断。
人工数据写入当前版本面板,口径版本随条目一起携带,历史读数都能顺着版本号往回查。
脚本校验关口
数据进面板之前要过三道关。前两道按固定比例执行,第三道由条件触发,不占固定工时。
每一场比赛记录都与来源清单逐条对照,全量执行,不做抽样。
校验组按位置与赛段分层抽取一成五的条目逐项复核,保证五组位置都被覆盖到。
单场指标偏离该位置赛季中位数三个标准差,或同一选手相邻两场的同指标落差超过四成,自动标记进入回查。
写作与制图规范
准则不长,但每次发稿前都会对照一遍。左边是长期执行的做法,右边是明确划掉的写法。
谁在做
团队一共十八人,岗位按链路切开:有人负责从对局里把记录捞出来,有人只负责挑毛病,有人维护模型与工程,也有人把结果写成读得懂的句子。
起步阶段只做单赛区的对局记录与基础胜负统计,一张表就装得下。
补上分钟经济曲线,并把登场率按五组位置拆开,榜单从一份变成五份。
指标扩到十二类可视项,夺冠概率模型进入面板,读数开始带差值记录。
当前面板版本。口径说明同步走到 R7,历史条目保留旧版本标记,改动都留在更新记录里。