ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

淘天数据岗秋招笔试全解析:SQL、统计与业务分析

淘天数据岗秋招笔试全解析:SQL、统计与业务分析 九月的第三个周六晚上我提交了淘天集团数据岗的秋招笔试时长120分钟题量不算大但交卷那一刻脑子里嗡嗡的。回看整个准备周期从一份看似普通的数据岗笔试邀请函到真正坐在摄像头前答题这中间的差距远比我预想的大。2024年秋招季阿里巴巴淘天集团淘宝天猫商业集团的数据岗几乎是所有投递数据分析、数据科学方向的候选人绕不开的一关而笔试作为第一道硬性筛选直接把很多人挡在了和面试官见面的门槛之外。这篇文章不是标准答案也不是官方真题回忆版——每年题型本就在变内容也有方向和批次差异。我想做的是以亲历和复盘的方式把数据岗笔试背后的考察逻辑、高频知识模块、答题框架和备考节奏完整梳理一遍让不同基础的同学都能在打开笔试链接前心里有底。适合正准备秋招、想冲大厂数据岗的同学也适合想了解互联网数据岗到底考什么的在校生看一看。1. 为什么这场笔试值得认真对待目标岗位与考察逻辑先说一个很多人低估的事实淘天数据岗的笔试不是单纯考知识储备而是在考一个数据从业者面对真实业务问题时能否快速找到有效路径。简历也许能包装笔试分数很难包装。网申之后笔试通知往往一到两天就触发你连临时抱佛脚的时间窗口都很有限这本身就是一场你到底有没有持续积累的检测。1.1 笔试在整个秋招流程中的位置淘天数据岗的秋招流程通常是网申、在线笔试、简历评估、多轮面试、意向沟通与Offer。笔试在网申之后系统自动触发这意味着你的笔试表现会和简历一起被综合评估。笔试分数高可以直接弥补简历上项目经历不够硬的短板笔试分数低即使学校和实习背景光鲜也可能在进入面试前就被卡住。另外不要以为笔试只是随便考考的筛选工具。在实际流程中面试官会看到你的笔试卷子尤其是SQL题和案例分析题阅卷留下的印象会延续到后续技术面。也就是说笔试的答题思路、代码习惯、结构组织能力都是你未来合作者对你的第一印象。把笔试当成一份远程工作的开卷报告来对待比当成考试更有意义。1.2 数据岗的方向差异与统一考点这里说的数据岗其实覆盖三类并不完全相同的方向数据科学/数据分析方向核心解决业务问题比如用户增长、货品运营、价格策略、活动效果评估笔试侧重SQL、统计概率、业务分析也会有机器学习基础。数据开发方向重点在数仓建模、ETL流程、数据质量保障、调度与存储笔试侧重SQL、数据库原理、数据结构和少量算法。算法方向搜索/推荐/广告/大模型应用笔试通常单独一套重点考察机器学习理论、编程能力、模型设计题量节奏差异很大。尽管方向不同2024年秋招的笔试有一个共同特征不考偏题怪题考你基本功是否扎实、业务语言是否通顺。如果你连基础SQL都写得不顺畅后面的业务题基本没有胜算。2. SQL与数据处理试卷中分值最集中、也最能拉开差距的版块不管投哪个数据方向SQL都是淘天笔试的绝对主战场。2024年的卷子里SQL相关分值占比通常在30%到40%而且分布在客观题、编程题和案例分析题三个位置。为什么淘天这么重视SQL因为入职之后每天面对的就是数仓里的海量业务表所有取数、分析、报表、看板都要自己跑SQL。笔试考SQL本质上是在预演你入职后每天要做的事。2.1 高频考点从多表关联到窗口函数多表关联JOIN基础到不能再基础但出题从来不在两张表简单关联上纠缠而是给三张甚至四张业务表让你完成某种取数逻辑。常见考察点包括INNER JOIN与LEFT JOIN的行为差异、关联后的去重问题、关联键的选择。有一个高频易错点当关联表存在一对多关系时结果集行数会膨胀导致聚合指标算错。比如你要算每个用户的首单时间用订单表和用户表关联后每个用户可能对应多行如果直接求MIN(订单时间)结果是对的但如果先JOIN再COUNT就会把订单量算错。笔试里这类题型考察的就是你是否理解先聚合再关联与先关联再聚合的区别。分组聚合与HAVING按维度统计指标、再筛选满足条件的维度考察聚合函数组合和NULL值处理。COUNT(列名)不统计NULLCOUNT(*)统计NULL这是永远翻不了篇的送分题但每年都有人错。窗口函数窗口函数是这两年笔试出镜率最高的SQL考点主要包括ROW_NUMBER()、RANK()、DENSE_RANK()、LAG()/LEAD()、SUM() OVER(PARTITION BY ... ORDER BY ...)等。常考场景有求每个用户最近的订单、每类商品的销量排名求用户连续活跃天数分组求累计值、同环比窗口函数之所以高频因为它对应业务分析中最常见的分组内比较场景。比如每个类目下GMV最高的商品是哪个传统写法要自联子查询窗口函数一行解决。留存与漏斗计算留存率和漏斗转化率是电商数据岗位必考内容。2024年笔试中有一类超高频题给定用户活跃表和订单表要求计算某个时间段内新用户的次日留存率或某个活动页面的点击到支付转化率。这类题看似业务分析实际考的是SQL实现能力关键在时间区间写清楚、用户去重逻辑别漏、口径定义要严谨。2.2 一个典型的SQL综合题拆解拿一道群里讨论度很高的留存计算题做拆解假设有用户活跃表user_active字段包括user_id、dt订单表order_info字段包括order_id、user_id、dt、amount。请计算2024年9月1日活跃用户中在9月2日至9月8日期间完成首单的用户占比。很多人第一反应是先JOIN再算但核心逻辑要分三步走。第一步先找出首次下单的用户口径是整个生命周期内的首单SELECT user_id, MIN(dt) AS first_order_date FROM order_info GROUP BY user_id第二步筛选9月1日活跃、且首单日期在9月2日到9月8日之间的用户。这里隐含一个关键口径这些用户在9月1日之前不能有下单记录否则首单就不成立。所以要先排除9月1日前已经下过单的用户再去JOIN活跃表。第三步拿符合条件的用户数除以9月1日活跃用户总数得到占比。这类题考的不只是SQL语法更是业务口径理解。口径理解不一致写出来的SQL就是完全不同的逻辑。我准备期间总结了一条铁律先确认口径再判断数据粒度最后才写代码。顺序一旦搞错写多快都是错的。2.3 避坑清单NULL值陷阱COUNT(列名)不统计NULL但COUNT(*)统计GROUP BY结果中NULL本身也是分组。关联膨胀多表关联前先在子查询里聚合或去重再关联不要等结果爆炸了再回头查。时间边界用dt 2024-09-01 AND dt 2024-09-02而不是BETWEEN避免时间戳精度导致丢数据。窗口函数不要漏PARTITION BY只写ORDER BY不写PARTITION BY结果就是全局累计和你想要的分组内累计完全两回事。执行顺序要记清WHERE在GROUP BY之前HAVING在GROUP BY之后窗口函数在WHERE之后执行。3. 统计概率与AB实验从理论公式到电商业务的语言翻译统计概率是淘天数据岗笔试的第二大板块占总分20%到25%。这部分出题非常灵活不会直接问伯努利分布的期望是多少而是把概率问题包装在电商业务场景里让你在理解业务的同时完成计算。平时只刷题不思考业务的人很容易在这里被拉开差距。3.1 条件概率与贝叶斯公式高频中的高频贝叶斯公式几乎是每年的保留节目2024年笔试中出现过一道非常典型的场景题某个商品推荐系统对用户真实点击的捕获准确率为95%误报率为4%。已知全站用户对该商品真正感兴趣的比例是1%。现在系统推送后用户点击了请问该用户真正感兴趣的概率是多少设P(感兴趣)0.01P(点击|感兴趣)0.95P(点击|不感兴趣)0.04。要求P(感兴趣|点击)P(点击)0.95×0.010.04×0.990.00950.03960.0491P(感兴趣|点击)0.0095/0.0491≈19.35%这个结果和直觉正好相反即便系统打出点击信号真实感兴趣的概率也不到两成。原因是先验概率太低了全站只有1%的用户感兴趣哪怕误报率只有4%也会造出大量假阳性。这类题不需要做百题斩关键是理解先验概率似然度→后验概率的框架把百分数化为小数按部就班算清楚。3.2 常见分布与期望别死记公式要懂场景笔试对分布的考察一般停留在识别应用层面。我建议你梳理每一个分布在描述什么二项分布N次独立实验中成功次数比如一批流量中点击数的分布泊松分布稀有事件在固定时间或空间内的次数比如某小时客服工单数、某活动页面访问量正态分布近似误差、大量独立随机变量之和的分布常用于中心极限定理相关题目均匀分布/指数分布随机等待时间、连续均匀取值实际考题往往给一个业务场景让你选分布模型。另外期望和方差的线性变换规则也考过比如已知X服从均值为3的泊松分布求2X1的期望和方差。泊松分布的期望等于方差这是关键然后注意Var(2X1)4Var(X)常数项对方差无影响这一步很多人出错。3.3 AB实验命题人最爱追问的假设检验细节AB实验是互联网公司做决策的核心工具也是淘天数据岗笔试中几乎必考的统计知识点。2024年考到的内容包括假设检验、显著性水平、统计功效、样本量计算和实验设计。一个高频考点是样本量估算公式n (Z_(α/2)Z_β)^2 × [p1×(1-p1)p2×(1-p2)] / (p1-p2)^2笔试一般不要求手算出具体数字往往给简化条件让写出计算思路但如果你能直接把公式写出来并解释每个参数的业务含义这道题基本稳了。Z是标准正态分位数α是显著性水平β与统计功效相关p1和p2是两个版本的目标转化率。另一个高频考点给出实验数据p值小于0.05问你能否支持业务上线决策。回答时要主动提几个陷阱多重比较问题同时看多个指标时容易产生伪显著流量污染实验组和对照组用户互相串访影响结果新奇效应用户对新版本的新鲜感让初期数据失真最小可检测变化设定太小导致样本量需求巨大、实验周期拉长我建议准备AB实验时不要只背概念要会落到实验结论能不能支持决策上因为命题基本都是从这个角度出发的。3.4 描述统计与口径问题看似简单却暗藏杀机描述统计在笔试里看起来最简单均值、中位数、方差、相关系数都是基础概念但淘天的命题常在口径上做文章。同样是客单价可以定义为GMV/支付订单数也可以定义为GMV/支付用户数两个口径差距很大。2024年有一道选择题让我印象很深给出一组用户支付金额数据其中含一个极端大值问哪个统计量最适合描述整体水平。答案是中位数因为均值被极端值严重拉高而中位数更稳健。准备时一定要把每个统计量的适用场景和局限性梳理一遍别觉得简单就跳过。4. 机器学习基础不只考记住概念更考能不能判断什么时候用机器学习知识在数据科学和算法方向笔试题中占比约20%到25%。淘天的考察方式很有趣很少让你默写公式而是给一个业务情境让你从技术和业务两个维度判断该如何选择。简而言之它考的是工程判断力而不是概念复述力。4.1 偏差与方差绕不开的底层思维这部分几乎年年考。常见出题方式给出训练集和测试集误差让你判断模型处于什么状态以及怎么调。训练集准确率99%、测试集75%明显是过拟合对应措施包括增加训练数据、降低模型复杂度、添加正则化、交叉验证调参。反过来训练集和测试集误差都很高则是欠拟合应增加模型复杂度或特征。给大家一个备考建议不要只背结论要理解原理。增加数据为什么能缓解过拟合因为模型可以从更多样本中学到一般规律而不是记忆个别样本。正则化为什么有效因为它通过惩罚大权重降低模型对某些特征的过度依赖。原理理顺了选择题和简答题都能应对。4.2 常见算法的适用场景与优缺点笔试中算法考察经常是比较级别的题目——给你几个算法让你根据场景选最合适的。以下是高频考点逻辑回归适用二分类和需要可解释性的场景风控、营销响应率预测。优点是解释性强、训练快缺点是无法自动处理非线性关系、依赖特征工程。决策树与随机森林适用表格类数据、非线性关系明显、需要特征重要性排序。决策树的缺点是容易过拟合、不稳定随机森林通过多棵树投票和随机采样降低方差。XGBoost / LightGBM / GBDT梯度提升树模型是表格数据建模的默认选择。考点常聚焦于GBDT与AdaBoost的区别、XGBoost正则化项的作用、LightGBM的直方图优化。K-Means聚类适用用户分群、物品聚类。核心考点是K值选取肘部法则、轮廓系数、K-Means的局限对初始中心敏感、只能发现球形簇。深度学习基础数据科学方向考得不深但你需要了解过拟合、dropout、批归一化、学习率等概念以及CNN、RNN、Transformer的基本适用场景。2024年开始大模型相关的基础概念注意力机制、Transformer结构也开始进入笔试范围但深度不大了解层面足够。4.3 特征工程与模型评估比模型本身更常考淘天笔试中特征工程和模型评估的题量实际上比算法原理本身还大。常见考点特征缩放为什么树模型不需要标准化但SVM、KNN和逻辑回归需要缺失值处理均值填充、中位数填充、删除样本的适用情形类别特征编码独热编码、标签编码、目标编码的适用场景样本不均衡欠采样、过采样、SMOTE、调整类别权重的基本思路评价指标精确率、召回率、F1、AUC在不同业务场景下的选择关于AUC笔试里出现频率极高常见的表述是随机抽取一个正样本和一个负样本正样本预测值大于负样本预测值的概率。想答好这类题要同时掌握这个概率解释和ROC曲线下面积的定义。4.4 一个综合案例模型题如何组织答案笔试简答或案例题偶尔把机器学习知识和业务问题混在一起出题。比如电商平台要预测未来7天不同品类的销量以便提前备货。已知有历史销量、促销日历、天气、商品信息、评价数据。请设计一个预测方案。这类题没有标准答案但期待一个清晰的思路。我通常按目标定义→数据探索处理→特征工程→模型选型→评估与迭代→上线与监控六步走。模型选型部分要说明销量数据通常有季节性和趋势性同时受促销活动影响巨大。短期预测可以先用XGBoost/LightGBM这类树模型把历史销量、促销标识、节假日、天气等作为特征如果长期依赖明显再引入Prophet或时序模型做对比。评估用时间序列交叉验证而不是随机切分避免未来数据泄漏到训练集。这个框架能同时展示你的技术储备和工程意识而正是面试官和阅卷者看重的。5. 业务数据分析题从会写SQL到能讲清业务的关键一跃如果说完客观题靠刷题可以达到那么业务案例分析题靠的是长期积累的数据思维。这是淘天数据岗笔试中区分度最大的题型很多候选人前面的题答得漂亮最后却栽在业务题上。这类题通常给一个真实业务场景让你提出分析思路、给出指标体系、判断结论是否可靠。2024年秋招笔试中我遇到的业务题大致覆盖以下几类。5.1 指标体系类从北极星指标到逐层拆解常见问法如何衡量某次大促活动的效果请为电商平台的用户增长设计一套核心指标体系。回答这类题比较稳妥的框架是明确业务目标GMV提升用户增长利润增长确定北极星指标大促通常是GMV或成交用户数按人货场三维拆解人新老用户、各层级用户、货品类、价格带、场频道、会场、推荐位补充比率类指标做纵向对比转化率、客单价、复购率区分过程指标和结果指标识别可干预的环节比如衡量双11大促指标体系可以这样分层核心结果指标GMV、成交用户数、客单价、订单量过程指标访客数、加购人数、加购转化率、支付转化率流量渠道指标各渠道曝光-点击-转化漏斗用户分层指标新老用户贡献、会员与非会员表现差异货品指标品类销售结构、折扣带来的毛利变化如果回答只罗列指标会显得没有层次。我准备时总结的原则是先定义目标和口径再按结果→过程→拆解→行动四层展开。这个表达方式能让阅卷者感受到分析是有逻辑的而不是指标拼凑。5.2 问题归因类用数据定位波动的原因这类题很经典几乎每年必出。典型问法某电商平台App最近一周转化率下降了5%请分析可能的原因并给出数据验证思路。回答这类题不能上来就猜原因要搭建一个排查框架。第一步确认数据口径转化率下降是哪个口径下的活跃用户基数变了吗统计周期变了吗是同比还是环比有没有埋点调整或数据缺失先排除数据本身的问题。第二步维度下钻按渠道、类目、新老用户、设备、地域等维度拆分判断下降是全局性的还是局部性的。如果是某个渠道下降看流量质量变化如果是某个类目下降关注该品类的供给和价格变动。第三步外部因素排查竞品大促、季节波动、舆论影响等。第四步内部因素排查产品改版、页面调整、推荐策略变化、券策略调整、服务故障等。最后给出验证方法用时间序列对比、同期群分析、AB实验等手段验证假设并给出可能的解决方案。答题时不要猜一个原因就写到底要体现出你是在做排查而不是下结论。阅卷者更看重逻辑框架和数据思维。5.3 运营策略类把结论转化为可落地的动作这类题通常给一个运营场景让你提出策略建议。比如平台用户活跃度下降付费用户比例也在走低请结合数据分析方法提出一份用户激活和提升付费的方案。直接给运营方案发券、搞活动是最常见的错误。更好的回答是先用数据划分用户群。RFM模型最近购买时间、购买频率、消费金额是回答用户分层类题目的利器。找出流失风险最高的群体针对不同群体给出对应的激励和触达策略说明如何通过AB实验验证效果并在结尾带上预期效果评估——说明实验后看哪些指标、怎么判断策略是否有效。这样答案会更完整也更有目标感。5.4 数据表达别忽略这项隐性考察笔试很少直接考绘图但有一个隐性要求文字表达能力。案例分析题不要求画图但如果你能在答案里用表格或分步骤把逻辑列出来阅卷体验会好很多。淘天笔试题中还有一类表达题向业务方非技术背景解释某个复杂结论。回答时避免堆砌专业名词多用对比、类比和具体数字。比如解释AUC可以类比为随机抽一个购买用户和一个未购买用户模型判断两类用户内部得分先后关系的概率。把技术翻译成业务语言是数据岗最容易被低估的软技能。6. 备考节奏与临场策略把复习效率拉满的实操方法聊完了知识点最后说备考节奏和对策。这部分最容易被忽视但恰恰决定了所有知识积累在上考场时能否充分兑现。6.1 时间线提前六到八周启动比较稳妥如果是秋招季7月到9月开始投递笔试随后陆续进行建议至少提前六到八周系统准备。合理的时间线大概是第1-2周摸底与基础回归先找一套往年的模拟题或真题做一遍了解差距。系统过一遍SQL基础知识尤其是JOIN、窗口函数、聚合。把概率论和统计核心概念条件概率、贝叶斯、常见分布、假设检验复习一遍。第3-4周专项突破集中刷SQL题每天2到3道优先练窗口函数和留存计算。统计概率做专项练习AB实验概念和计算彻底搞懂。机器学习基础概念系统过一遍整理算法对比表适用场景、优缺点、关键参数。第5-6周综合模拟与查漏补缺每周末做一次完整限时模拟90到120分钟。针对模拟暴露的薄弱环节带着问题回看知识点。开始积累业务分析框架总结不同场景的回答模板。第7-8周冲刺与状态调整减少新题量重点回顾错题和笔记。熟悉笔试平台操作确认网络、摄像头、安静环境等硬性条件。保持稳定作息调整到最好的考试状态。6.2 时间分配别在客观题上恋战以90分钟、12道题为例我个人建议的分配是客观题约25分钟每道控制在4分钟左右不会的先跳过编程/SQL题约20分钟先审题、再理逻辑、最后写代码统计计算题约20分钟注意单位和量级案例分析题约25分钟优先级最高先搭框架再填充核心原则是案例题优先因为它分值大、区分度高、结构完整就能拿回大部分分。前面客观题耗太多时间导致案例题来不及写是最亏的结果。6.3 实战中踩过的坑第一次模拟机试时我犯过几个很典型的错误分享出来帮大家避雷坑一SQL题不审题就开写有一次模拟题要求计算每个用户最近一次下单距今天数我上来就写ROW_NUMBER()忽略了附加条件只统计2024年有过下单记录的用户导致整段SQL输出不符合要求。这个教训让我学会了先审题再列数据血缘关系最后才写代码。坑二统计计算的量级没核对有次算完概率后忘了把结果转成百分比并按业务场景核对合理性差点把一个低概率事件写成高概率结论。现在我的习惯是先写公式、再代入数值、最后核对单位、量级和是否在0到1之间。坑三案例分析有结论没过程第一次写业务题时我直接写结论和方案完全没写怎么通过数据验证。后来复盘发现阅卷者更关注分析路径而不是最终结论。我后来把所有业务答题固定成一个链条口径确认→维度拆解→数据验证→结论输出→行动建议。6.4 笔试之外的隐性准备最后提一个很容易被忽略的点笔试不是孤立环节它和后续面试强关联。淘天笔试中的业务案例题其实是在为面试中的业务问题做预热。笔试中总结的分析框架面试完全可以复用。我在准备笔试时额外做了一件事把每个答题框架整理成可迁移模板再把每个模板配上一个真实业务案例。这样面试时如果被问分析某个业务问题就能快速调用最合适的框架再往里面填充具体数据场景。这个方法在后续面试中帮了我很大的忙。实际上笔试到面试之间的这段框架沉淀期才是秋招里性价比最高的时间投入。你准备的每一个分析框架、每一段SQL逻辑、每一个统计口径判断都会在面试和后续实习中被反复调用。把笔试当成一次系统梳理自己数据能力的机会而不只是一场要应付的考核收获会超出预期的。
返回列表