返回首页本学科首页
Data Scientist / ML Engineer

让数据回答因果,而不只是相关

五年工业界数据科学经验,做过推荐系统、需求预测与增长实验平台。我关心的不是模型指标又涨了多少,而是这个提升能否真实转化为业务价值、并且经得起 A/B 检验。

杭州 · 混合办公
5 年算法经验
在读博士(在职)
苏未晞

苏未晞

数据科学家 · 推荐算法与因果推断
开放交流 · OPEN
23
上线模型
8.7%
CTR 相对提升
420亿
日处理数据
160+
A/B 实验
DATASETS

项目案例

23
上线模型
8.7%
CTR 相对提升
420亿
日处理数据
160+
A/B 实验
ABOUT

关于 苏未晞

离线 AUC 提升 2 个点,线上可能毫无变化。我这几年最大的成长,是学会对"提升"这件事保持警惕。

我目前在一家电商平台负责**推荐算法**与**增长实验体系**。日常工作大致分三块:迭代排序模型、维护特征与训练管道、以及设计并解读线上实验。这三件事缺一不可——只做模型的算法工程师,很容易在一个失真的离线指标上自我感动。

技术上我的主线是**深度排序模型**与**因果推断**的结合。传统推荐容易陷入"推荐它是因为它本来就会被点"的自我强化循环,我们通过引入 uplift 建模与去偏采样,把资源真正倾斜给增量更高的人群,在同等曝光下把 GMV 提升了 5.3%。

工程能力是数据科学家的隐形门槛。我独立搭建过团队的**特征平台**,把特征上线周期从平均 3 天压缩到 4 小时,并解决了长期困扰团队的训练-推理特征不一致问题。这类工作不会写进论文,但它决定了一个算法团队的迭代速度上限。

我在职攻读统计学博士,研究方向是**观测数据下的处理效应估计**。学术训练让我在面对业务问题时会多问一句:"这个结论的识别假设是什么?"——这个习惯帮团队避免过好几次错误的归因。

技术能力分布

能力矩阵

建模与算法
PyTorch / 深度学习90%
XGBoost / LightGBM94%
因果推断方法88%
时序预测82%
Bandit / 强化学习70%
数据工程
Python96%
SQL / Hive93%
Spark86%
Airflow84%
Docker / K8s74%
分析与表达
A/B 实验设计92%
统计推断90%
数据可视化85%
业务沟通86%
论文写作80%
职业与学术经历

经历年表

2023.05 — 至今

数据科学家 · 推荐与增长算法 @ 某综合电商平台

负责主站推荐排序模型与增长实验体系,同时承担团队的 ML 基础设施建设。

2021.03 — 2023.04

算法工程师 · 供应链智能 @ 某零售科技公司

负责需求预测与库存优化算法,服务全国 12 个区域仓。

2020.07 — 2021.02

数据分析师 @ 某互联网内容平台

负责用户增长方向的数据分析与实验支持,是我从分析转向建模的起点。

2022.09 — 至今

统计学 · 博士在读(在职) @ 国内某综合性大学

研究方向为观测数据下的异质处理效应估计,已发表 KDD、CIKM 论文各一篇。

CAPABILITIES

三层能力:建模、工程、决策

机器学习建模

面向排序、预测与分类场景的模型设计、训练与调优。

  • 深度排序模型(DIN / DCN)
  • 梯度提升树与特征工程
  • 时序预测与需求建模
  • 多目标与多任务学习

数据与 ML 工程

把实验性的代码变成可持续运行、可监控的生产管道。

  • Spark 大规模特征计算
  • Airflow 调度与依赖管理
  • 特征平台与在线服务
  • 模型监控与自动回滚

实验与因果推断

用严谨的统计方法回答"这个改动到底带来了什么"。

  • A/B 实验设计与功效分析
  • Uplift 与异质处理效应
  • 双重差分 / 合成控制
  • 实验平台指标体系建设
EDUCATION

教育经历

2015 — 2019
中山大学学士 · 统计学

GPA 3.8/4.0,数学建模国赛一等奖,校数据科学实验室研究助理。

2019 — 2022
复旦大学硕士 · 数据科学

研究方向为因果推断与 uplift 建模,发表 KDD workshop 论文一篇。

PROJECTS

项目 / 成果

多目标推荐排序重构2025 · 推荐算法

把单目标 CTR 模型升级为 CTR + CVR + 停留时长的多任务架构,用 PLE 结构缓解任务冲突,并引入去偏采样处理位置偏差与流行度偏差。

+8.7%CTR 相对提升+5.3%GMV 提升46ms推理延迟
Uplift 驱动的优惠券投放2024 · 推荐算法

用两阶段 uplift 模型识别"被券影响才会下单"的人群,替代原有的按购买概率排序的投放逻辑。在预算不变的前提下显著提升了券的增量效率。

+22%券增量 ROI-15%无效发放3期实验验证
仓网需求预测系统2023 · 预测

为 12 个区域仓建立 SKU 级别的日粒度需求预测。融合了促销日历、天气与竞品价格等外生变量,用分层调和保证不同粒度预测的一致性。

-19%预测误差 MAPE-8.4%库存周转天数12仓覆盖范围
特征平台与实验中台2023 · 平台

主导团队特征平台建设,统一离线训练与在线推理的特征口径,彻底解决训练-服务偏斜问题;配套实验平台支持自动功效计算与指标显著性判定。

3天→4h特征上线周期420亿日处理条数0特征不一致事故
CONTACT

欢迎交流算法与研究