Content Exploration Beyond the Feed:创作者供给与共享语料库¶
Content Exploration Beyond the Feed: Creator Supply and the Shared Corpus Yuanyuan Shen, Yiren Yan, Wenjie Li*, Chunhui Zhu — Snap Inc.(New York / Palo Alto),arXiv 2608.29430v1,2026-08-29 类目:cs.IR / cs.LG / econ.EM / stat.AP / stat.ML;关键词:content cold-start、content distribution、creator economy、two-sided platforms、bandits、short-video (*Work done while at Snap Inc.)
这不是一篇"提出新架构 + 刷榜"的论文。它是一份长周期生产实证 + 因果识别理论:作者在一个大型短视频平台上跑了四组随机实验(其中一组创作者侧消融跑了 8 个月,一组观众侧消融跑了一年多),用它们回答一个所有做冷启动探索的团队都会撞上的问题——为什么观众侧 A/B 测出来的探索收益经常是负的,而探索却承担了绝大部分新内容的分发? 答案是:观众侧 A/B 在结构上(不是在噪声上)看不见探索的大部分价值,而剩下那部分价值又慢到任何可行长度的实验都读不出来。
研究动机与背景¶
短视频平台每天接收海量新投稿,其中绝大多数一开始触达不到几个观众。排序模型偏好已经有观测反馈的内容,因此新视频缺少与老内容竞争所需的历史。探索(exploration) 就是给它们初始曝光的机制。作者强调:在很多短视频平台上,探索是绝大多数新视频的主要分发渠道,而不是一个边角料的补充通道。
工业界的通行做法是:给每个新视频一个曝光预算,用早期表现决定是否释放更多曝光(作者引用了 Kuaishou 的冷启系统 [10]、Pinterest 的 PinEqualizer [16]、Epinet for Content Cold Start [19]、Alibaba 的 AliBoost [28]、Item-Level Exploration Traffic Allocation [33])。本文研究的是在视频探索期结束前分阶段分配曝光的系统:过了早期门槛的视频拿到更多曝光,没过的退出探索池。
这个设计带来一个评估问题:
观众侧 A/B 测试常常给出混合甚至负向的消费结果,尽管探索供给了绝大部分新内容分发。相关系统报告了同样的短窗口模式 [11, 30]。而更长的单侧测试并不能解决问题——两臂共享同一个语料库,它的贡献在每一个视野下都被抵消。
这句话是全文的枢纽。它把"测不准"从一个统计功效问题重新诊断为一个识别问题:不是样本不够,而是被测量的通道在实验对比里恒等于零。
论文进一步指出一个文献层面的空白:作者综述的所有已发表冷启预算目标函数,没有一个在预算目标里包含创作者随后的投稿响应。Wang et al. [33] 最大化"探索后变得可发现"的物品数;分层系统按预测 CTR 定预算、按实测 CTR 决定是否升级。而 feed ranking 领域早在 2019 年就有工作建模创作者激励(LinkedIn 的 Feedback Shaping [32])。作者认为这个空白是结构性的而非疏忽:feed ranking 可以对长期结果自适应,而冷启预算必须在一个有界窗口内设定、升级、撤回,其退出门槛又只能回到观众侧的快速证据——而 Theorem 1 会证明,恰恰是这些快速表达的量,对创作者供给通道和语料存量通道完全盲视。

三个贡献:
- 有符号的创作者响应:8 个月的生产探索消融,相对于一个最小保底(minimal floor),人均发布视频数 +8.55%,至少发布过一次的创作者数 +7.10%。综述过的冷启预算目标全部忽略了这个响应。另有一个预算匹配的再分配实验,在不产生可检测的短期观众侧代价的前提下提高了创作者参与度。
- 价值与识别:把一次投放的价值拆成"即时观看""organic take-up""诱发的创作者供给"三个通道,并把每个通道映射到能识别它的随机化设计。增益为 $\mathcal{R}$ 的投稿回路把投稿放大 $1/(1-\mathcal{R})$ 倍。单侧设计能识别 direct 与 supply 通道,但在构造上排除了共享语料库通道。
- 语料视野:只有隔离 cell 才能在对比中保留语料贡献,而它必须等语料自己换手。在换手率 $\omega$ 的单调存量转移下,一个 $t$ 周期的实验最多表达渐近效应的 $\omega t$。加用户能降噪,但推不动这个转移。三周探针恰好落在预测的估计地板上。
相关工作定位¶
- 冷启动:协同过滤最古老的问题之一 [20, 22, 27],在视频平台上以"进入完整推荐前的专门探索期"的形式出现 [12]。本文把这个阶段当作一等公民的分发渠道,同时承载观众价值与创作者价值。
- 长期 / 慢表达效应:已有方法包括 user learning 的 cohort 与 stepped-wedge 设计 [17]、surrogate index [2]、处理 carryover 的时序设计 [4]。这些工作把"慢"当成用户侧现象去绕过估计。本文的慢是结构性的:一个带语料存量的两侧供给回路,问题变成"长期效应究竟在什么时候才可观测"。增益-弛豫关系在 Markov mixing 与 critical slowing down 里是经典结论;Theorem 2 背后的"置信集无有限直径"现象在弱识别模型里也是经典的 [14, 15]。本文的贡献是把它们特化到指数逼近族,导出一个可操作的曲率常数与视野定律。
- 工业冷启分配:五个已发表系统共享两个特征——新物品拿到 per-item 曝光配额,后续曝光按早期表现开闸。本文分析的完整机制额外带一个有界投放窗口 + 升级 + 撤回。
- 最接近的两项前置工作:Su et al. [30](YouTube, WSDM'24)用用户 + 语料联合 co-diversion 证明探索扩大了可发现语料,并用随机稀释语料证明缩小语料会减少满意用户数,收益在数月尺度上累积;Shen et al. [29](同一组作者的姊妹论文,arXiv 2608.04432《The Price of Isolation》)刻画 co-diversion 本身施加的生态成本。本文在此之上识别标准预算机制的创作者供给响应,把结构性抵消与视野衰减分开,并导出直接测量语料后果的设计与信息极限。
- 邻近路线:这一族系统过去用 bandit 探索 [11, 21],把一次投放的价值算作"关于臂的信息";预算化分配则把它定价为分发量(Proposition 2)。双边平台的田野实验已经确立曝光会因果地塑造创作者供给:随机流量把产量提高 5.87% [18],额外曝光带来更高质量与更多样的产出 [36],同行奖励也有类似效果 [8]。最接近本文读法的是 Yao et al. [37],在理论与仿真中形式化了这个权衡。本文的差异:它给一个长期运行的生产机制在两侧市场上定价,横跨数月;此前的实验研究的是几周量级的一次性流量赠予。
机制与生态模型¶
预算化探索的工业实践¶
创作者把内容 $s$ 投入探索池 $\mathcal{P}_t$,每个 item 在池中的存活期最长为 $T_{\max}$(TTL)。池子竞争总探索容量 $V_t$ 次曝光。投放预算 $B(s) \in \mathbb{Z}_{\ge 0}$ 是在 TTL 内要投给 $s$ 的目标探索曝光数。
定义 1(预算化探索问题):给定池 $\mathcal{P}_t$、容量 $V_t$、以及"给 item $s$ 投 $B$ 次曝光"的价值函数 $U(s, B)$,选择预算使
$$\max_{\{B(s)\}_{s\in\mathcal{P}_t}} \sum_{s\in\mathcal{P}_t} U(s, B(s)) \quad \text{s.t.} \quad \sum_{s\in\mathcal{P}_t} B(s) \le V_t,\quad B_{\min} \le B(s) \le B_{\max}\ \ \forall s \tag{1}$$
其中 $B_{\min}$ 是每个 item 都拿得到的最小预算保证(冷启曝光),$B_{\max}$ 是单 item 上限。
工业实践对(1)的解法是通用的三段式:每个合格 item 在任何观众反馈存在之前先拿到保底 $B_{\min}$;保底之上的曝光(escalation,升级)以窗口内的早期反馈为条件;剩余投放在预算耗尽、过期、或反复未达观众反馈标准时停止(withdrawal,撤回)。两个决策都只能依赖表达最快的量——而这正是 Theorem 1 要打击的地方。
一个重要的工程解耦:预算分配与投放实现解耦。契约只要求每个 item 在 TTL 内从相关观众处拿到目标曝光数;专用漏斗、排序加权、配额、保量投放 pacing 都能等价地履约,因此本文的估值与评估结论可迁移到任何一种实现。理论只对给定预算做条件推断,消融实验对比的是"机制 vs 不存在 / 最小保底",所以估计量对分配器细节不变。
生态模型:供给回路与语料存量¶
离散时间,一个周期 = 一次"投稿-反馈"循环(含投稿、TTL 内的探索曝光、创作者的下一次发布决策),其日历长度是平台属性、外生于模型。两个状态变量:$\Lambda_t$ 是新投稿率(供给),$K_t$ 是organic 语料(走完探索窗口后仍在 organic 分发中的 item 存量)。
六个模型成分:基线投稿率 $\Lambda_0$;创作者响应 $g(\cdot)$ 把收到的曝光数映射为期望的下一期投稿数(递增且凹,与田野实验报告的饱和响应一致 [18, 36]);期望总曝光 $\bar{V}(B) = B + q(B)\,V_{\mathrm{org}}$($B$ 次投放的探索曝光,加上以 organic take-up 概率 $q(B)$ 获得的 $V_{\mathrm{org}}$ 次 organic 曝光);语料按每期 $\omega \in (0,1)$ 的比率换手;观众价值为每单位语料每期 $\eta$,于是总消费局部仿射于存量:$E_t = \eta K_t + \text{const}$。归一化取 $\eta/\omega = \eta_o V_{\mathrm{org}}$(两边都是一个被 take-up 的 item 的终身 organic 价值)。
动力学是一对线性递推:
$$\Lambda_{t+1} = \Lambda_0 + \mathcal{R}\,\Lambda_t, \qquad K_{t+1} = (1-\omega)\,K_t + q(B)\,\Lambda_t \tag{2}$$
第一式说下一期供给 = 基线 + 本期供给的反馈份额;第二式说语料保留 $1-\omega$ 的比例,并获得新投稿中被 take-up 的那部分。
命题 1(探索乘数):对 $\mathcal{R} < 1$,(2) 收敛到
$$\Lambda^* = \frac{\Lambda_0}{1-\mathcal{R}}, \qquad K^* = \frac{q(B)}{\omega}\,\Lambda^* \tag{3}$$
且一次额外投放产生 $\delta/(1-\mathcal{R})$ 次累计额外投稿。证明是几何级数:一次边际曝光诱发 $\delta$ 次投稿,它们又诱发 $\delta\mathcal{R}$、$\delta\mathcal{R}^2$……
两个必须分清的量:回路增益 $\mathcal{R} \triangleq g(\bar V(B))$ 是"一次投稿诱发的进一步投稿数",也是供给递推的特征值;敏感度 $\delta \triangleq g'(\bar V(B))$ 是"一次额外投放的边际投稿响应",是给一次曝光定价的量。健康平台是亚临界的($\mathcal{R} < 1$),预算 $B$ 就是平台设定 $\mathcal{R}$ 的杠杆。
把状态叠成 $x_t = (\Lambda_t, K_t)$,递推读作 $x_{t+1} = M x_t + u$,两个特征值 $\mathcal{R}$(供给回路)与 $1-\omega$(语料存量)分工完全不同:
供给回路决定一次曝光值多少钱;语料存量决定一个实验要跑多久这笔钱才看得见。
关键的技术细节:Theorem 1 不要求语料比供给回路更慢——因为 $1-\omega$ 是纯机械换手、完全不含 $g$,视野界对任意创作者响应、任意两个特征值的排序都成立。
Remark 1(固定容量是自阻尼的):固定 per-item 预算与有限容量并不矛盾。在(1)下更大的池会通过 $V/\Lambda$ 降低每 item 曝光,引入负反馈。附录给出局部弹性推导:令 $u = V/\Lambda$ 为 per-item 曝光,诱发投稿映射是 $\varphi(\Lambda) = \Lambda\,g(V/\Lambda)$($g$ 的透视变换),求导得
$$\varphi'(\Lambda) = g(u) - u\,g'(u) = \mathcal{R}\left[1 - \frac{u\,g'(u)}{g(u)}\right] \tag{4}$$
方括号里减去的是响应在 $u$ 处的局部弹性,凹性加 $g(0)\ge 0$ 把它锁在 $(0,1)$ 内,于是 $\varphi'(\Lambda) < \mathcal{R}$ 严格成立。固定容量因此降低回路增益与乘数 $1/(1-\mathcal{R})$,忽略这种拥塞会高估供给乘数;但它不动 $\omega$,所以时序结论原封不动。对数式的饱和响应弹性随曝光水平上升而下降,阻尼在 per-item 曝光最稀薄处最强。
Remark 2(线性模型的适用范围):(2) 是亚临界生态在稳态处的切线描述。乘数结论只在该稳态附近局部成立;Theorem 1 的界没有这个限制。$\eta$ 是毛价值,而开关式对比测的是扣除被挤占曝光后的净差——这恰恰是决策相关的量。任何额外的非负反馈只会抬高 $M$ 的谱半径(观众侧回路:更丰富的语料吸引更多观看、从而更多可投放容量;曝光积累粉丝;更厚的语料匹配得更好),所以省略它们对本文结论是保守的。反号反馈(crowd-out、质量稀释)会压低谱半径,明确在模型之外。
一次投放的价值分解¶
乘数给的是整个供给回路的价值,但分配器需要更细的东西:多给某一个 item 一次曝光值多少。
命题 2(一次曝光的边际价值):在(2)下,给创作者 $c$ 的 item $s$(预算 $B(s)$)多投一次曝光,其累计消费价值为
$$\mathrm{MV}(s) = \underbrace{\delta_c v^*}_{\text{直接创作者通道}} + \underbrace{\eta_e}_{\text{曝光本身}} + \underbrace{q'_s(B)\,V_{\mathrm{org}}\left(\eta_o + \delta_c v^*\right)}_{\text{take-up 通道}} \tag{5}$$
其中 $\eta_o, \eta_e$ 分别是 organic 与探索投放的毛单次曝光消费价值,
$$v^* = \frac{\eta_o \bar q V_{\mathrm{org}} + \eta_e \bar B}{1-\mathcal{R}} \tag{6}$$
是一次投稿的总消费价值($\bar q, \bar B$ 是池内均值)。证明要点:$v^*$ 满足 $v^* = \eta_e \bar B + \eta_o \bar q V_{\mathrm{org}} + \mathcal{R}v^*$,即 $v^*$ 本身已经把整条后代链求和了,不能再乘一次乘数。
take-up 项的物理含义是"小概率变化 × 大回报":多一次曝光几乎不改变被 organic take-up 的概率,但一旦被 take-up,该 item 期望多拿 $V_{\mathrm{org}}$ 次 organic 曝光。
两个后续要用的读法:
- 预算尺度 vs 排序:在本文识别到的分辨率上,一个池级的创作者敏感度只能重定预算的影子价值,不提供池内排序信号。要做创作者项的重排序,需要 $\delta_c$ 在 item 间的异质性,而本文任何设计都识别不了它。命题 2 指出异质性会从哪里进来:曝光本身那一项没有 item 下标、会从分配器的比较中消掉;变化的项正比于 $q'_s$ 与 $\delta_c$。一次曝光在 take-up 边际附近最值钱($q'_s$ 最大处),以及条件 organic 触达更大时更值钱。当 organic 分发已经覆盖几乎每个 item 时,$q'_s \to 0$,多一次曝光除了它自己什么也买不到。
- 符号:随机化对比测的是扣除被挤占曝光后的净值,所以一个负的实测 direct 效应与 $\eta_e > 0$ 完全相容。从每个候选里减掉同样的机会成本不改变排序,但让这个成本在候选间变化就会改变排序。

数值上(附录 D.4):$\mathcal{R} = 0$ 时创作者通道占总价值的 46%,$\mathcal{R} = 0.7$ 时升到 70%,$\mathcal{R} = 0.95$ 时升到 87%。把 take-up 通道里依赖 $\delta$ 的部分也算进去,被这一族已发表预算目标忽略的边际价值份额,在同一区间上从 50% 到 95%。$\mathcal{R} \to 1$ 时曝光本身那一项的份额趋于零,创作者通道趋于 $1/(1+q'V_{\mathrm{org}})$(此处 91%)。
设计论证:把这个图与 Corollary 1 一起读,就是全文的核心张力——被忽略的通道在高 $\mathcal{R}$ 时占主导,而那恰恰是它最慢、最测不出来的地方。一个只用观众侧信号打分的分配器,在损失最大的地方丢掉了大部分边际价值,而机制自己的反馈永远揭示不了这个损失。
可测量性的信息极限¶
这一节是论文的理论骨干,回答"为什么加钱加流量都救不了"。
Theorem 1:视野盲区¶
在 $t=0$ 从均衡处关掉探索,记 $E^*$ 为切换前的均衡消费。消费仿射于语料存量,则差距分解为 $E^* - E_t = \Delta_{\text{direct}} + \Delta_{\text{corpus}}F(t)$,其中 direct 项从第一期就在。若语料每期保留 $1-\omega$,且切换后流入不低于其最终水平,则
$$F(t) \le 1 - (1-\omega)^t \le \omega t \qquad \forall\, t \ge 1 \tag{7}$$
证明思路:在满足该条件的流入路径中,"立刻跳到最终流入水平"在每个日期最大化语料差距;迭代存量递推得归一化差距 $1-(1-\omega)^t$,再用 Bernoulli 不等式得第二个界。
这个界的操作性含义:在视野 $t$ 上,即使完全无噪声,最终语料差距也最多表达出 $\omega t$ 的份额。作者特别强调这个界不需要线性模型:设语料是任意"每期保留 $1-\omega$、流入 $I_t$"的存量,记 $D_t = K_t - K_\infty$,则 $D_{t+1} = (1-\omega)D_t + (I_t - I_\infty)$;若 $I_t \ge I_\infty$ 则 $D_t \ge (1-\omega)^t D_0$,界立即成立,完全不用到 $g$ 的任何性质,因此覆盖非线性创作者响应;而且这是逐条样本路径成立的不等式,允许随机流入与随机换手;换手率随时间变化时界变成 $F(t) \le 1 - \prod_{s<t}(1-\omega_s) \le \sum_{s<t}\omega_s$。
附录给出闭式解。记 $\Lambda^*_{\text{off}}, K^*_{\text{off}}$ 为切换后均衡,$\Delta_s = \Lambda^* - \Lambda^*_{\text{off}}$,$q_{\text{off}} = q(0)$,则 $\Lambda_t = \Lambda^*_{\text{off}} + \Delta_s(\mathcal{R}_{\text{off}})^t$,代入语料递推得
$$F(t) = \left[1-(1-\omega)^t\right] - c\left[(1-\omega)^t - (\mathcal{R}_{\text{off}})^t\right], \qquad c \triangleq \frac{\kappa}{K^*-K^*_{\text{off}}},\ \ \kappa = \frac{q_{\text{off}}\Delta_s}{1-\omega-\mathcal{R}_{\text{off}}} \tag{8}$$
$c$ 的可行区间是 $[0,\ \omega/(1-\omega-\mathcal{R}_{\text{off}})]$,它精确地刻画了延迟:
- $c = 0$(take-up 独立于投稿变化而下降,例如探索窗口信号本身停止维持 organic take-up):$F(1) = \omega$,纯语料响应,无延迟,从第一期起线性;
- $c = c_{\max}$(切换只动供给回路:take-up 率不变、只有投稿量下降):$F(1) = 0$ 精确成立,首期什么都不表达,起步是二次的——机械读法是"在喂养语料的投稿自己降下来之前,语料根本没法开始变薄"。此时 ramp 外推回零点恰在 $t_0 = 1/(1-\mathcal{R}_{\text{off}}) = A(\mathcal{R}_{\text{off}})$,即一个供给回路乘数,四位小数精确。

规划上的两个相反推论:规划视野不需要估计 $c$(视野由 $\omega$ 决定,用换手数据就能离线估);但读一个短实验必须知道 $c$(衰减因子依赖它,而模型不指定它)——这正是 §5.5 要从数据里拟合延迟起步的原因。
Corollary 1:价值与可测性的对偶¶
对特征值 $\lambda \in (0,1)$ 的反馈回路,定义均衡乘数 $A(\lambda) \triangleq 1/(1-\lambda)$ 与弛豫时间 $\tau(\lambda) \triangleq 1/\ln(1/\lambda)$。则
$$\tau(\lambda) \le A(\lambda) \le \tau(\lambda) + 1, \qquad t_\varepsilon = \ln(1/\varepsilon)\,\tau(\lambda), \qquad \sum_{k<t}\lambda^k \le t \tag{9}$$
"乘数是靠慢换来的":更强的反馈同时意味着更慢的遗忘,两者在一个周期以内重合。因此一个长度 $t$ 的实验读到的部分和被它自己的时长上界住,不管真实乘数多大——settle 在 $\Delta_\infty$ 的差距早期读出来就是 $\Delta_\infty \omega t$。语料存量在 $\lambda = 1-\omega$ 处实例化了这个推论:它的增益是 $1/\omega$,弛豫时间在其一个周期以内。语料越"常青",一单位流入买到的存量越多,任何测试要看到固定份额所需的时间也越长。

附录 D.2 把它当成研究计划的可行性检查:想证明的乘数从纵轴读起,找到交付该乘数的 $\lambda$,读出 $t_{90\%}$,那就是最短的诚实研究时长。"在一轮语料换手内证明 50 倍生态乘数"这种计划是内部矛盾的。$\lambda = 0.9$ 给 10 倍乘数、9.5 期表达 63%、21.9 期表达 90%;$\lambda = 0.99$ 给 100 倍、分别要 99.5 与 229 期。
Proposition 3:样本量买不来视野¶
对每臂 $N$ 用户的开关实验,在早期区间 $\omega t \ll 1$ 读一个语料存量指标(渐近差距 $\Delta_\infty$):
$$\text{(i)}\ \ \frac{\Delta(t)}{\Delta_\infty} \approx \omega t \ \ \text{与 } N \text{ 无关}; \qquad \text{(ii)}\ \ t_{\det}^{\text{snap}} = \frac{z\sigma\sqrt{2/N}}{\Delta_\infty \omega} \propto N^{-1/2},\quad t_{\det}^{\text{cum}} = \left(\frac{2\sqrt2 z\sigma}{\Delta_\infty \omega \sqrt N}\right)^{2/3} \propto N^{-1/3} \tag{10}$$
(i) 直接来自 Theorem 1(其陈述里根本没有 $N$);(ii) 把差距 $\Delta_\infty\omega t$(快照)或其滑动均值(累计,标准误 $\sigma\sqrt{2/(Nt)}$)与 $z$ 倍标准误相等求解。更大的样本只是把同一个被衰减的数字估得更准。

附录 D.3 给出定价:十倍流量最多把所需视野缩短 $3.2\times$(快照检测)、$2.2\times$(累计检测)、$1.6\times$(估计渐近值);把视野减半分别要 $4\times$ / $8\times$ / $32\times$ 的流量。"把 1% 实验扩到 10%"这种标准提案,只有在估计目标仅仅是"检测一个被衰减的差距"时才买得到 3.2 倍;若目标是渐近乘数,只买到 1.6 倍。指数才是约束,剩下的杠杆只有日历时间,或一个外部的 $\omega$ 估计。
Theorem 2 / Theorem 3:估计地板(不可能性结果)¶
设观测到的臂间对比为
$$y_t = c + \Delta_\infty\left(1 - e^{-\omega t}\right) + \varepsilon_t, \qquad \varepsilon_t \stackrel{iid}{\sim} N(0, s^2),\ \ s^2 = \frac{2\sigma_{\text{eff}}^2}{N},\ \ t = 1,\dots,T \tag{11}$$
其中水平 $c$ 与速率 $\omega$ 都是未知讨厌参数。定义曲率信噪比
$$\mathcal{C} = \frac{\Delta_\infty \omega^2 \sqrt{S_4}}{2s}, \qquad S_4 = \sum_{t\le T} t^4 \tag{12}$$
只要 $\mathcal{C} \le 1$,任何对 $\Delta_\infty$ 在正幅度与正速率上一致覆盖 $1-\alpha$ 的置信过程,返回无限上端点的概率至少是 $\tfrac12 - \alpha$。 提高 $N$ 只以 $T \propto N^{-1/5}$ 的速度移动 $\mathcal{C}=1$ 的临界点;若 $\omega$ 能从辅助数据估出来,改善到 $N^{-1/3}$。
证明是两点全变差不可区分性论证:构造匹配乘积族 $(\Delta_{\text{direct}}, M, \omega_M)$,$\omega_M = \omega_0\Delta_0/M$($M=\infty$ 即直线 $\Delta_{\text{direct}} + \Delta_0\omega_0 t$)。固定早期斜率 $\Delta_0\omega_0$,同时让 $\omega\to0$、$\Delta_\infty\to\infty$,用 $|1-e^{-x} - x\phi(x)|$ 的二阶估计得 $D_M^2 \le \tfrac14\Delta_0^2\omega_0^4 S_4 = \mathcal{C}^2 s^2 \le s^2$,于是 $\mathrm{KL} \le \tfrac12$、$\mathrm{TV}\le\tfrac12$,覆盖转移即得。通俗地说:在轨迹肉眼可见地"弯"起来之前,数据无法区分"一个不大但很快的效应"和"一个任意大但很慢的效应"。
Corollary 2 给出信息量与速率:profile 掉截距与 $\omega$ 后,Gaussian Fisher 信息剩下
$$I^*(\Delta_{\text{corpus}}) = \frac{\omega^4 T^5}{720\,s^2}\left(1 + O(\omega T)\right) \tag{13}$$
任何估计量在某个与真值 TV 距离 $\le\tfrac12$ 的参数上误差 $\gtrsim s/(\omega^2 T^{5/2})$,profile 极大似然渐近达到该率,反演得 $T\propto N^{-1/5}$;已知 $\omega$ 时斜率信息是 $\omega^2T^3/(12s^2)$,两者误差比 $\sqrt{720/12}/(\omega T)\approx 7.7/(\omega T)$,这正是外部 $\omega$ 估计能消掉的膨胀。
Lemma 1(面板归约)——为什么可以把对比序列当成单一噪声尺度的独立抽样:
- (i) 因为 $\mathbf{1}$ 是持久成分的特征向量,只要 profile 掉包含截距 $\Delta_{\text{direct}}$ 的讨厌参数集,所有信息量都与 $\sigma_\alpha^2$ 无关(Sherman–Morrison 直接算出 $P_{\Sigma_a} = P_{\Sigma_0}$ 恒等于 $a$);未 profile 的量则因 $\Sigma_a \succeq \Sigma_0$ 只会让信息缩小、扩大不可能区域。
- (ii) AR(1) 瞬态噪声用 $\sigma_{\text{eff}}^2 = \sigma^2(1+\rho)/(1-\rho)$ 吸收,相对误差 $O(\rho/((1-\rho)T))$。
- (iii) 平稳性是必需的:随机游走漂移下 $T^5$ 的信息累积退化成 $T^3$,因为单位根会冒充 ramp。诊断办法是在对数尺度上检查"用户均值中心化后的结果方差不随窗口增长"。
这就是 §5 报告平稳性检验而不是直接假定它的原因。

作者还诚实地指出认证常数在两处是保守的(可移除):用精确高斯 TV 替代 Pinsker 可把结论推到 $\mathcal{C}\le 2\Phi^{-1}(3/4)\approx 1.35$;允许备择重新 profile 水平与斜率会进一步缩小 $D_M$。因此校准 Monte Carlo 把实际可估性转折点放在认证阈值之上约一个数量级。
漂移:变化的环境移动稳态,但不改变时序与识别。Theorem 1 只用到语料存量的保留率,在时变换手下逐路径成立;增益-弛豫关系因两者对同一个 $\lambda$ 单调而保留;Proposition 3 的指数只来自这套代数。未建模的漂移只会扩大"无有限上界"的区域。每个设计都在同一日期对比两臂,所以观众口味与语料的共同变化会消掉。
每种设计能识别什么¶
命题 4(各随机化设计的识别):设实验把市场一侧的份额 $p$ 置于被扰动条件(floored arm)。把即时的 feed 内替代算作 direct 通道的一部分,其余 organic 消费变化由共享语料状态中介,则:
(i) 观众侧:在入组用户的 feed 里关掉探索投放,在每个视野与每个臂规模上精确识别 direct 通道。语料中介的消费对两臂是共同的,被抵消。(代数:$E^a_t = \eta_e X^a_t + \eta K_t$,入组只把总量扰动 $O(p)$,而 $K_t$ 对两臂完全相同,相减即得 $\eta_e(X^{\text{ctrl}}_t - X^{\text{abl}}_t) = \Delta_{\text{direct}}$。)
(ii) 创作者侧:把入组创作者的内容压在保底上,识别在被扰动总量处的均衡供给响应
$$\Lambda_0\left[(1-\mathcal{R})^{-1} - (1-\mathcal{R}_f)^{-1}\right] + \epsilon(p) \tag{14}$$
其中 $\mathcal{R}_f$ 是 floored 臂的回路增益。$\epsilon(p) \ge 0$ 是"容量释放"干扰项:被压掉的保底之上的预算回到共享容量池、在剩下的 $1-p$ 份额上重新分配,使生产臂的 per-item 投放相对全量上线上升了 $O(p/(1-p))$ 的量级;由于 $g$ 递增,这会抬高实测对比。它随 floored 市场份额缩放,在 co-diverted 设计里不存在(隔离子市场与平台不交换容量)。诱发语料产生的消费同样对两臂共同、被抵消。
(iii) Co-diverted(共同分流):隔离匹配的创作者与观众子市场,在对比中保留语料中介成分,但按 Theorem 1 的 $F(t)$ 衰减。给子市场自己的创作者压保底会降低它自己的供给,所以该 cell 坐在定理的延迟端。
总结:语料通道不进入任何单侧对比,无论视野多长、样本多大。它只在 co-diversion 下进入,且在 $1/\omega$ 量级的视野上才表达出固定份额。
表 1:四种随机化设计的识别图
| 目标 | 设计 | 所需视野 | $N$ 的速率 |
|---|---|---|---|
| Direct 效应 | 观众消融 | 立即 | $N^{-1/2}$ |
| 供给响应 | 创作者消融 | 供给回路 $\tau(\mathcal{R})$ | $N^{-1/2}$ |
| 分配响应 | 预算再分配 | 供给回路 $\tau(\mathcal{R})$ | $N^{-1/2}$ |
| 语料 ramp | Co-diversion | 早期 ramp | $N^{-1/3}$ |
| 语料渐近值 | Co-diversion | 曲率阈值 | $N^{-1/5}$ |
对快通道,$N$ 的速率是在固定视野上把估计磨锐;对语料两行,它设定的是所需视野。这些设计识别的都是总体聚合量;per-item 的 $q'_s$ 与 $\delta_c$ 仍未识别。
实验设置¶
四个实验分别检验表 1 分配给它的通道与时间路径。共同的统计口径:
- 两个长期单侧消融中,随机化单元与分析单元一致,因此效应是"随机化单元层面的窗口聚合均值之差",用单元级标准误,不做聚类。
- 入组在随机化时固定(fixed enrollment)。
- 用到方差缩减处,把结果对其实验前取值回归(CUPED [13])。
- 创作者第一阶段是机械的:per-video 探索曝光按"预算-保底"的差额上升(绝对量级因保密隐去)。
- 臂份额一致到百分点的百分之几,无 sample-ratio mismatch。
- 报告效应量与 95% 区间;列出的行是各分析完整结果族的一个子集。
- 每个 co-diverted 实验只实现了一对匹配子市场,因此其区间以该对为条件。
主要实验结果¶
观众消融:direct 通道(§5.2)¶
跑了一年多,入组 8% 的用户,随机分到"生产探索"与"完全关闭"两臂。创作者对两臂共同,所以每臂从周边创作者群体供给的同一个语料库取内容——对比因而隔离出 direct 通道(入组观众 feed 内替代之后的探索投放效应),排除语料效应。它的长度把持续响应与上线新奇效应分开,并覆盖一个完整季节周期。
表 2 Panel A:观众消融(相对变化 %,95% CI,正值有利于生产)
| 指标 | 相对变化 (%) | 95% CI |
|---|---|---|
| Video views | +1.74 | [+1.57, +1.90] |
| View time | −2.13 | [−2.28, −1.98] |
| Views under 1.5s | +7.49 | [+7.28, +7.70] |
| Video favorites | −2.32 | [−2.72, −1.92] |
结论分析(why):这是一个混合的 direct 效应——探索在这个操作点上提高了观看启动次数、却降低了观看时长:观看数 +1.74%,观看时长 −2.13%,而 1.5 秒以下的短观看 +7.49%,说明观看构成明显向"短暂观看"偏移;收藏与观看时长同向(−2.32%)。这就是分配问题的 direct 分量,而命题 2 还需要创作者响应才完整。
时间路径是识别论证的一半。作者用七个累计估计与它们差分出的六个非重叠期间估计(Figure 4)来读形状,公式为
$$\Delta_{(t_1,t_2]} = \frac{c_2 t_2 - c_1 t_1}{t_2 - t_1} \tag{15}$$
(在"累计分母按经过时间成比例增长"即每期曝光稳定时精确成立;臂平衡、成员固定、等长窗口下偏差是二阶的)。三个特征:
- 无符号翻转、无 ramp:两条序列在七个估计上都保持符号,都没有持续上升的 ramp。一个增长的语料贡献会在换手时间尺度上单调累积(Theorem 1),这里什么都没有——这正是 §5.2 用来把这个差距读作 direct、per-user 效应的依据。
- 累计读数掩盖了衰减:Video views 从 +2.02% 升到第七个月前后的峰值 +2.32%,再落到 +1.74%。累计序列因为每个估计都包含之前所有估计而在构造上是平滑的,是判断形状的错误仪器。差分成六个不共享数据的期间后,video views 前三期稳在 +2.27% 到 +2.45%,随后掉到 +0.13%;view time 先加深到 −2.87% 再衰减到 −1.14%。真实运动比累计序列显示的大好几倍。
- 精度提高但不收敛:置信带随累计样本单调收窄(video views 从 ±0.23 到 ±0.16 个百分点),但点估计在同一窗口内的移动大于这个收窄幅度——这是 Proposition 3(i) 的微缩版:更多数据把"测量时刻的系统状态"测得更准,却钉不住一个本身在漂移的量。
衰减的原因:与同期探索在 feed 消费中份额的下降重合。消融的效应量随它移除的投放份额缩放,而这个份额是运营选择。因此这些数字报告的是一个操作点的价格,不是结构参数。


独立见证:同期的创作者消融随机化的是另一个总体,但它的消费变化在同一个日历边界上换号(该边界前最后一期 video views 为 +1.11%,见 Figure 5)。由于两个实验相隔数月开始,同一日历日期上的断裂指示一次共同的操作点漂移;由于两个设计都排除语料项(命题 4(i)–(ii)),这个同步运动同时提供了 §5.5 要导入的漂移估计。

创作者消融:内容供给(§5.3)¶
跑了 8 个月,入组平台 8% 的创作者,每臂约 4%。这个份额同时定出干扰项量级:$p/(1-p) \approx 0.04$。floored 臂的创作者每个视频拿到最小探索预算,其视频仍可被 organic 检索;生产臂的创作者拿生产探索预算(绝对量级因保密隐去)。这是一个双剂量(two-dose)对比而非严格开关,但直接测到了供给响应;两臂之间只有"保底之上的预算"不同。
表 2 Panel B:创作者消融
| 指标 | 相对变化 (%) | 95% CI |
|---|---|---|
| Videos posted per creator | +8.55 | [+7.14, +9.96] |
| Creators posting at least once | +7.10 | [+6.60, +7.59] |
结论分析(why):两个结果分别识别总量供给响应与外延边际(extensive margin)供给响应——后者说明有一部分响应发生在"发不发"这个离散决策上,而不只是"多发几条"。首个测量期上人均发布效应是 +5.9% ± 3.4,低于全窗口均值 +8.55%,与 Figure 2b 的平台期一起,符合一个起步期(onset)的形态——与 Theorem 1 关于供给回路以 $\tau(\mathcal{R})$ 弛豫的预测一致。
与既有田野实验的关键差异:这不是几周的一次性流量赠予,而是把长期运行的生产机制与最小保底对比了 8 个月。
作者自己给出的偏倚方向:因为两臂创作者在共享市场里竞争,命题 4(ii) 意味着存在 $O(p/(1-p))$ 量级的容量释放膨胀,所以 +8.55% 是全量上线效应在该操作点上的上界,而不是无偏估计。要恢复保底本身的总价值,需要一个零探索的创作者臂。
预算匹配的曝光再分配(§5.4)¶
消融识别的是"探索存在与否"的效应;命题 2 还刻画了固定预算下的分配。一个两周的 co-diverted 实验在匹配 cell 中保持名义总预算不变,把曝光摊到更多视频上(由晋升阈值实现)。由凹性,较低曝光处的边际发布响应更大。倒数第二天的花费诊断显示两臂实际 per-creator 预算相差约 3%,且再分配臂略低,因此任何残余剂量不平衡都会向下偏倚它的发布响应(保守方向)。
表 2 Panel C:预算匹配再分配(正值有利于再分配)
| 指标 | 相对变化 (%) | 95% CI |
|---|---|---|
| Creators posting at least once | +0.77 | [+0.35, +1.19] |
| Videos posted per creator | +0.92 | [+0.05, +1.79] |
| View time | +0.01 | [−0.14, +0.16] |
| Video views | −0.06 | [−0.21, +0.09] |
| Video favorites | +0.15 | [−0.44, +0.74] |
结论分析(why):观众侧每个区间都包含零,创作者侧两个指标都显著为正。这正是理论预测的签名——在固定名义预算下,仅仅改变分配就能提高创作者参与度,且没有可检测的短期观众代价。它把"分配"确立为一个独立的实验边际(experimental margin),与"探索存不存在"是两回事。两周窗口只覆盖快速供给边际;由 Theorem 1,被诱发供给的语料后果在这个窗口内被衰减、渐近值不可识别。
一个值得记录的流程细节:原设计中的第二个再分配臂被剔除,原因是配置审计发现它没有实现预期的预算匹配对比,而这个剔除在看结果之前由干预配置本身决定。
Co-diverted 探针:语料响应(§5.5)¶
探针把观众与创作者共同分流到隔离的生产与 floored 子市场 [6, 23]。消费用观众级均值,发布用创作者级均值;每臂一个分区,区间以这些子市场为条件。匹配隔离抵消了共同的消费成本,同时让 cell 趋向不同的稳态 [29]。
实验只跑三周——不是懒,而是平台政策把匹配子市场隔离封在三周,因为其生态成本随时长增长 [29]。语料估计量舍弃前七天,因为已在探索窗口中的视频只部分暴露于干预。在这个视野上,Theorem 2 预测direct step 可识别、语料渐近值可能无法定号。
表 3:三周 co-diverted 读数(相对变化,95% CI)
| 量 | 估计 |
|---|---|
| Panel A:Direct step | |
| Video views | +0.43 [+0.30, +0.57] |
| View time | −1.02 [−1.14, −0.89] |
| Video favorites / delivered view | −0.87 [−1.21, −0.53] |
| Panel B:按换手时间尺度的语料渐近值 | |
| Video views,36 天尺度 | [−0.28, +0.70] |
| View time,36 天尺度 | [−0.93, +0.30] |
| Video views,360 天尺度 | [−2.77, +7.04] |
| View time,360 天尺度 | [−9.30, +2.95] |
| Panel C:可行视野内的语料流量 | |
| Cohort 切片内的 organic view time | +37.9 [+37.1, +38.7] |
| 推算的整 cell 贡献 | +0.1 ~ +0.2 pp |
| Panel D:匹配 21 天视野下的人均发布 | |
| In-cell 设计 | +0.63 ± 0.44 |
| 单侧设计 | +2.79 ± 0.89 |
结论分析(why):
- Panel A:direct step 重复了观众消融的符号但幅度更小,与探针所处的更晚操作点一致。"每次投放的收藏数"这个指标同时混合了接受度与内容构成。由于切换前 video views 与 favorites 已不平衡,估计使用等长的前期差分。
- Panel B — 论文最诚实的一段:不固定换手时间尺度时,无论是 ramp 拟合还是形状稳健增量,都给不出语料渐近值的有限双侧上界。固定 36 天(实测 kernel 的单速率等价)时,辅助分析排除了大到足以抵消 direct 观看时长代价的语料收益;固定 360 天(合格期视野)时,两个符号都还可能。三周下总语料渐近值仍未定号——完全符合 Theorem 2 的预测(21 天窗口 $\mathcal{C}\approx2$,有限端点概率 0.21,Figure 3)。
- Panel C — 可行视野内的毛语料流量:在轨迹弯起来之前,理论指示的目标是"在视野 $t$ 上表达出来的效应",外推渐近值是不成熟的。作者做了一个 cohort 分解:只看实验期内发布、且在其探索窗口之后才被 organic 服务的视频(构造上探索已经无法投放它们)。在匹配 cell 中,organic view time 高出 37.9% [37.1, 38.7],video views 高出 41.7%;该切片占一个 cell 消费的 0.3–0.5%,因此对整 cell 对比的贡献约 0.1–0.2 个百分点——与整 cell 的零结果量级自洽。此外 in-cell 视频的每观众收藏数 +29.8% [24.3, 35.3];按每次观看算,边际语料视频拿到在位内容 ≈0.91 倍的观看时长与 ≈0.71 倍的收藏率(所有 in-cell 视频合计占 cell 消费的 8–14%)。
- Panel D — in-cell 供给只有单侧的四分之一:在可比的探索第一阶段、同样的视野与工具下,in-cell 发布响应大约是单侧响应的 1/4(+0.63 vs +2.79)。作者明确说这个比值是描述性的,因为总体、季节、触达与曝光构成都不同,它留下 $\epsilon(p)$ 与全量上线渐近值未识别。
![Figure 6: cell 内 organic video views 与 view time——实验期内发布、在其探索窗口之后被观看的视频,生产 cell vs floored cell,按日给出 95% 区间(用户级样本)。合并的全量 view time 对比是 +37.9% [37.1, 38.7]。灰带是实验前发布视频构成的安慰剂区间。](figures/fig_06.png)
安慰剂:实验之前发布的视频在排除前七天后无可检测差异(后续所有估计都在 ±3% 内),这构成 Figure 6 的灰色安慰剂带;而包含探索窗口期的合并读数落在该带之外——两个版本作者都报告了。
推断状态的自我降级:这个分解是在 1% 用户探索样本里发现的;把同样的端点、估计量与窗口应用到全量总体只是复现了数值模式,并不构成一个独立的确认性检验,因此作者保留其 exploratory 状态。净渐近值(扣除挤占之后)仍未解决。
四个实验各自确立了什么(表 4)¶
| 实验 | 已识别的发现 | 留下的问题 |
|---|---|---|
| 观众消融 | Direct feed 权衡:views +,time − | 共享语料效应 |
| 创作者消融 | 供给响应:发布 + | 全量上线幅度、语料价值 |
| 预算再分配 | 再分配对比:参与度 +;观众侧 CI 跨零 | 广度弹性、长期语料价值 |
| Co-diverted | Direct step 混合;探索性的毛 cohort 流量 + | 三周下的净语料渐近值 |
估计器与稳健性(附录 B.2 / C.3)¶
主文的 co-diverted 分析不用单速率指数族,而是从历史平台数据钉住响应形状:
$$y_t = c + \delta_t + \Delta_{\text{direct}}\mathbf{1}\{t\ge0\} + \Delta_{\text{corpus}}\,(k_{\text{emp}} * \pi)(t) + \varepsilon_t \tag{16}$$
其中 $k_{\text{emp}}$ 是实测的 age–yield kernel,$\pi$ 是实测的 in-cell 发布路径(归一到单位长期水平),$\delta_t$ 是从同期单侧消融导入的漂移。十一个月度横截面给出归一化累计响应
$$F_{\text{emp}}(7) = 0.471,\quad F_{\text{emp}}(21) = 0.583,\quad F_{\text{emp}}(90) = 0.755 \tag{17}$$
这个前置密集(front-loaded)、非指数的形状就是主文 36 天单速率等价的来源。
把 $k_{\text{emp}}$ 当作干预响应用到了四条假设:(A1) 探索投放的变化只缩放 cohort 流入、不改变归一化的 age–yield 形状;(A2) 在探针的扰动量级下,cohort 间的 ranker 竞争不改变该形状;(A3) 历史横截面可迁移到 cell(两者都跑生产 ranker,十一个横截面的离散度进入方差);(A4) 观测到的 in-cell 发布路径就是相关的干预输入。作者明确说 (A1)–(A2) 要等 ramp 可估之后才能通过比较 cell 自己的 age profile 与 $k_{\text{emp}}$ 来评估。
不确定性按独立来源方差相加:(i) 抽样误差(非重叠窗口视作独立,并用残差序列的滞后一阶自相关膨胀方差作为检查);(ii) kernel 不确定性(十一个横截面 kernel 视作抽样,逐 kernel 重拟合,把 $\hat\Delta_{\text{corpus}}$ 的跨 kernel 方差加进去);(iii) 漂移作为以导入序列为中心的高斯先验传播。合成数据覆盖率检验:每个非退化情景 300 次重复,合并差距覆盖率 93.7%(MC 标准误 1.4 个百分点),下界构造有效率 96–97%;若发布路径恰好为零、供给回归元被丢弃,覆盖率掉到 89.0%。
一个被自己点破的脆弱点:所用非零路径设定的 kernel–supply 回归元相关系数是 0.994,勉强通过估计前就定死的 0.995 共线性阈值;而且主区间包含零、大而互相抵消的 step 与 ramp 系数暴露了 intercept–kernel 的近共线。预设的联合规则因此拒绝了双侧上限估计,主文改报条件良好的稳健性区间。
形状稳健的增量:对探索窗口之后的两个视野 $t_1 < t_2$,漂移调整后的增量均值是 $\Delta_{\text{corpus}}[F(t_2)-F(t_1)]$,direct step 与水平项从差分中消掉;存量模型下 $F$ 非降且 $F\le1$,所以 $0 \le F(t_2)-F(t_1) \le 1$ 对任意可行响应形状成立,增量与 $\Delta_{\text{corpus}}$ 同号且不超过其绝对值。非负存量模型对毛流量目标施加 $\Delta_{\text{corpus}}\ge0$——这个方向在 ramp 可估之前就已固定,且只用于模型受限的下界;主文报告的政策相关净渐近值不加这个约束,因而仍未定号。
面向实践的六条设计建议¶
- 混合的观众 A/B 只识别 direct 权衡——观众侧对比在构造上排除创作者响应。在被研究平台上,生产探索让人均发布 +8.55%、至少发布一次的创作者 +7.10%。
- 中性结果并不解决共享语料价值——单侧观众对比中语料项被抵消;短 co-diverted 对比只识别有限视野增量,渐近值仍未解决。两个结果单独都不识别总价值。
- 离线估计慢因子并导入——流量救不了门槛的短窗口(Proposition 3)。预算策略有规划周期,可以纳入历史随机 cohort 或准实验变异的离线估计;按视频年龄的产出历史数据可以估计语料换手率。
- 让设计匹配通道——观众侧随机化测 direct,创作者侧随机化测被测操作点上的总供给响应,只有 co-diversion 保留语料通道。
- 按日历时间规划——十倍用户最多把所需视野缩短 3.2 倍;在曲率阈值以下,用有限视野增量与任何模型受限的下界作为报告端点,用换手率、效应量、噪声三个输入来规划视野。
- 把分配当作独立的实验边际——在固定名义预算下,再分配提高创作者参与度且无可检测的观众侧变化。
核心贡献总结¶
- 对创作者供给响应的有符号、长周期因果量化:8 个月生产消融给出 +8.55% / +7.10%,并明确标注它是全量上线效应的上界(容量释放偏倚方向已知)。这是本文最硬的经验资产:综述过的所有已发表冷启预算目标都没有这一项,而数值示意表明它占一次曝光边际价值的 46%–87%。
- 把"测不准"从统计问题重述为识别问题:命题 4 证明共享语料通道在任何单侧对比里恒为零,与视野长度和样本量无关。这一步把工业界大量"跑久一点就好了"的直觉证伪了。
- 视野盲区界 $F(t)\le 1-(1-\omega)^t\le\omega t$,且不依赖线性模型、逐样本路径成立、允许时变换手。配合 Corollary 1 的"乘数即弛豫时间"对偶,得到一条可用于研究计划可行性审查的判据。
- 估计地板的不可能性定理:$\mathcal{C}\le1$ 时任何一致覆盖过程返回无限上端点的概率 $\ge \tfrac12-\alpha$;$T\propto N^{-1/5}$(有外部 $\omega$ 时 $N^{-1/3}$)。这把"加流量"的常见提案定了价。
- 一张可直接照抄的识别图(表 1):目标通道 → 随机化设计 → 所需视野 → $N$ 的速率。
- 四组真实生产实验的完整读法,包括非重叠期间差分、两个独立随机化实验对同一操作点漂移的交叉见证、安慰剂 cohort、覆盖率模拟、以及对自身共线性与 exploratory 状态的坦白。
与已归档相关工作的对比¶
PinEqualizer PinEqualizer: Full Funnel Content Exploration and Debiasing System at Pinterest (Pinterest, 2026-07-24)¶
关系:显式引用但原文未展开对比(仅在 §1 的"平台通常给新内容曝光预算"引文列表 [10, 16, 19, 28, 33] 中出现一个引文号,全文再无方法或指标层讨论)· 已加载对方精读
- 共同关注的问题:两篇论文撞上的是同一个 root cause,而且用了几乎相同的措辞。PinEqualizer 明确写道:"user-segmented A/B 实验无法评估内容级指标,因为实验两臂之间共享内容语料(content-level leakage)";本文把同一件事升格为命题 4(i):语料状态 $K_t$ 对两臂完全相同、相减即消,因此语料通道在任何单侧对比里恒为零,与视野和样本量无关。两者还共享同一个前置祖先——Su et al. 的《Long-Term Value of Exploration》(YouTube, WSDM'24;本文编号 [30],PinEqualizer 编号 [17]),并且都以"要不要采用它的 user-corpus co-diverted 设计"作为自己方案的分水岭。
- 相近的技术骨架:两篇的解法流程图都不是模型,而是一条度量/识别阶梯:先用一个长视野的隔离对照拿到 ground truth(PinEqualizer 的 long-term fresh content holdout:treatment 冻结实验前语料,control 按 content-ID hash 随机移除等量内容以消除"更大候选池"的固有优势;本文的一年期观众消融与 8 个月创作者消融),再用一个语料状态代理缩短反馈延迟(PinEqualizer 的 content graduation:摄入后 $Y$ 天累计 $X$ 次正向 engagement,$X$ 取 engagement rate 方差显著下降处;本文用实测 age–yield kernel $k_{\text{emp}}$ 把语料响应形状从历史数据钉住),最后用一个能在标准 user A/B 里快速跑的替代端点维持实验吞吐(PinEqualizer 的 under-explored content engagement volume;本文的建议 3"离线估计慢因子并导入")。
- 本文的差异与推进:PinEqualizer 评估了 co-diverted 设计并明确拒绝了它,理由是三条生产工程约束——多产品面多候选生成器下全局切分语料成本极高、只在 $x\%$ 语料上做实验无法准确测用户级指标、限制语料会伤用户指标从而拖慢实验吞吐;它转而接受"内容级泄漏很小"的经验判断(论证是:treatment 加速毕业后次日就不再计入该指标,且低流量下两臂用户看到的内容通常不同)。本文则把 co-diversion 真的跑了,并给出 PinEqualizer 没有的那半个答案:即便你付得起隔离的代价,三周也不够——$\mathcal{C}\approx2$ 时有限上端点概率只有 0.21,语料渐近值在 36 天与 360 天两个换手情景下给出相反符号的结论。换句话说,PinEqualizer 的三条拒绝理由是成本论证,本文补上的是一条信息论证:即使成本可接受,可行视野内的信息也不足以给渐近值定号。更关键的分歧在创作者侧:PinEqualizer 把"成功内容提供者 +99%"当作生态健康的结果指标报告,而本文把创作者供给建模成一个带增益 $\mathcal{R}$ 的均衡回路、并用 8 个月的创作者侧随机化直接识别它的响应,同时指出所有此类系统的预算目标里都没有这一项。
- 可比的方法 / 实验差异:PinEqualizer 的证据是两年迭代部署的累计效果(fresh content holdout 增量 session 北美 +24% / 国际 +49%,购物 session +63% / +29%,28 天毕业语料 +41%,成功内容提供者 +99%,三大面 under-explored engagement +13%~+37%),是多次上线叠加的年同比读数,无法把单个机制的因果贡献拆出来;本文的证据是单一机制 vs 最小保底的随机对照(人均发布 +8.55% [+7.14, +9.96],观看数 +1.74%,观看时长 −2.13%),因果归属干净得多但外部效度局限在一个平台的一个操作点,且绝对预算量级全部保密。两者对"显式探索 vs 去偏"的态度也相反:PinEqualizer 的核心立场是"去偏优先于显式探索"(因为 UCB/Thompson 要付短期 engagement 折损),本文则不碰算法设计、只问"这个已经在跑的预算机制到底值多少、怎么才能测出来"。两篇合起来读,是同一个结构性问题在两家平台上的成本侧与信息侧两半。
讨论与局限性¶
实验设计与因果识别的评估¶
随机对照还是观察性? 四个实验全部是随机对照,不是观察性研究,也不是准实验:观众消融随机化 8% 用户(生产 vs 完全关闭,跑了一年多);创作者消融随机化 8% 创作者(每臂约 4%,生产预算 vs 最小保底,跑了 8 个月);预算匹配再分配与 co-diverted 探针都是共同分流的多重随机化设计(引用 Masoero et al. 2026 JRSS-B 的 multiple randomization designs 与 Brennan et al. WWW'25 的 symbiosis bias)。随机化单元与分析单元一致、不做聚类、固定入组、CUPED 降方差、SRM 检查通过。因此本文不需要平行趋势假设——这一点上它比绝大多数"长周期生态实证"扎实得多。
创作者侧的均衡效应有没有被处理? 这是本文的核心而非盲点。作者不仅测了,还把它形式化成一个特征值为 $\mathcal{R}$ 的供给回路,并给出三条彼此独立的处理:(a) 把均衡响应写成 $\Lambda_0[(1-\mathcal{R})^{-1}-(1-\mathcal{R}_f)^{-1}]$,明确所测的是均衡量而非瞬时量;(b) 用 8 个月的视野匹配 $\tau(\mathcal{R})$,并从"首期 +5.9% < 全窗口 +8.55% + Figure 2b 的平台期"读出起步期已经走完、回路已经 settle;(c) 用 Theorem 1 证明决策必须依赖的快速信号在结构上对这个通道盲视,从而解释了为什么"短期 A/B 测不出创作者响应"不是运气问题。凹性与亚临界性也被明确当作假设写出来,并给出线性化误差的符号(对预算上升高估、对下降低估)。
SUTVA 违背有没有被处理? 处理得比绝大多数工业论文都硬核,而且是把违背当作研究对象而不是当作噪声。 具体到三层:
- 共享语料库造成的干扰被显式建模,而不是假设掉。 命题 4(i) 不是说"干扰很小可以忽略",而是说干扰的后果是精确抵消:$K_t$ 同时进入两臂,相减恒等于零。这把 SUTVA 违背从"偏倚"重新定性为"估计量的改变"——观众侧对比不再是"有偏的总效应",而是"无偏的 direct 效应",代价是总效应根本不在它的射程内。这是一个比"我们检查了干扰、量级很小"高一个层级的论证。
- 创作者侧的干扰量级被算出来并给出符号。 命题 4(ii) 的 $\epsilon(p)$ 来自容量释放:floored 臂让出的保底之上预算回到共享容量池,抬高生产臂的 per-item 投放。量级 $O(p/(1-p))\approx 0.04$(8% 创作者、每臂 4%),符号非负,因此 +8.55% 被明确标注为全量上线效应的上界。作者没有把它写成"稳健性讨论"里的一句话,而是写进了主结论的限定条件。
- Co-diversion 是针对 SUTVA 违背的设计手段,而它的代价也被量化过。 隔离匹配的创作者与观众子市场让每个 cell 有自己的 $K_t$,从而把语料通道保留在对比里。代价是同组作者的姊妹论文 [29]《The Price of Isolation》专门量化了隔离本身的生态成本,而平台政策据此把隔离窗口封在三周。Panel D 的 in-cell 发布响应只有单侧的四分之一(+0.63 vs +2.79),作者没有把它解释成"$\epsilon(p)$ 的量级",而是明确说该比值是描述性的(总体、季节、触达、曝光构成都不同),$\epsilon(p)$ 与全量上线渐近值仍未识别。
残余的干扰是作者没有完全排除的:co-diverted cell 之间仍可能通过共享的 ranker 训练数据、全局容量与运营策略互相影响;(A2) 明确假设"cohort 间的 ranker 竞争在探针扰动量级下不改变 age–yield 形状",而这条要等 ramp 可估之后才能验证。
稳健性论证的成色:
- 安慰剂检验:有,且做在正确的位置。 Figure 6 的灰带是"实验前发布的视频"构成的安慰剂区间;实验期发布的视频 organic view time +37.9%,而实验前发布的视频在排除探索窗口期后所有后续估计都在 ±3% 内。作者还诚实报告了包含探索窗口期的合并读数落在安慰剂带之外,并解释了为什么该期必须排除(干预仍能影响投放),两个版本都给出。
- 代替平行趋势的东西更强:两个独立随机化、相隔数月启动的实验在同一个日历日期上同时换号(Figure 4 vs Figure 5),这作为"共同操作点漂移"的双重见证,比单一实验的前趋势检查更有说服力,而且它同时被用作探针的漂移导入源。
- 形状读法的方法论自觉:明确指出累计序列"在构造上平滑、是判断形状的错误仪器",改用六个不共享数据的非重叠期间差分(式(15)),并主动标注 band 是近似上界(嵌套增量没有闭式边际)。同时点破"置信带在收窄而点估计移动更大"这一现象是 Proposition 3(i) 的微缩版。
- 平稳性检验:Lemma 1(iii) 给出了为什么必须做(单位根会把 $T^5$ 的信息累积退化成 $T^3$、并冒充 ramp),以及怎么做(用户均值中心化后的方差不随窗口增长)。
- 预设规则与事前排除:共线性阈值 0.995 在估计前定死;方向性约束 $\Delta_{\text{corpus}}\ge0$ 在 ramp 可估之前定死且只用于下界;再分配实验的第二个臂因配置审计在看结果之前被排除。
- 覆盖率模拟:300 次重复,合并差距覆盖率 93.7%(MC 标准误 1.4pp),下界 96–97%,退化情形 89.0%——连覆盖率不足的情形都报出来了。
- 推断状态的自我降级:cohort 分解发现于 1% 探索样本,全量复算不构成独立确认性检验,保留 exploratory 状态。
季节性、产品迭代与外部事件的混入:这是长周期生产数据最容易翻车的地方,本文的防线是"随机化 + 同期对比"(每个设计在同一日期对比两臂,共同的口味与语料变化被差分掉),因此季节性与外部事件在原理上不构成混淆。真正的问题不是混淆而是外部效度:一年期观众消融本身观测到探索在 feed 消费中的份额下降,导致效应从 +2.4% 衰减到 +0.13%;作者明确把这些数字定性为"一个操作点的价格"而非结构参数。这是诚实的,但也意味着 +1.74% / −2.13% / +8.55% 这些数不能被外部读者当成可迁移的常数。
值得借鉴的设计¶
- 把"测不准"先做识别性诊断再做功效诊断。命题 4 的抵消论证只需要一行代数,却能立刻判定"跑久一点/放大流量"这条路是不是死的。任何做长期价值度量的团队都应该先做这一步。
- 用"乘数 = 弛豫时间"做研究计划的可行性审查(Figure 8):想证明的乘数决定了最短的诚实研究时长,两者不可分离。
- 把慢因子离线估计后导入预算目标,而不是指望在线实验解决——因为预算规划有自己的节奏,而门槛没有。
- 区分"探索存不存在"与"预算怎么分配"两个实验边际:后者在固定名义预算下就能拿到创作者参与度收益且无可检测观众代价,是一个成本低得多的杠杆。
- 报告形状时用非重叠期间差分而不是累计序列,并明确标注 band 的近似性质。
局限与争议¶
- 总价值仍未识别,这是论文自己的结论而非我的指摘。观众侧的单位是观看数/观看时长,创作者侧的单位是投稿数,没有共同尺度;净语料渐近值在三周内不可定号,且 36 天与 360 天两个换手情景给出相反的实践结论。因此这篇论文不能回答"这个探索预算值不值",它只能回答"你现在的实验为什么答不了这个问题、要答需要什么设计与多长时间"。
- 换手率 $\omega$ 是外生输入而非被识别的参数。Panel B 的结论完全由假定的时间尺度驱动,而 36 天等价值来自历史 age–yield kernel,依赖 (A1)–(A4) 四条未被验证的假设(作者承认 A1–A2 要等 ramp 可估才能查)。这是整条推理链上最软的一环。
- 共线性 0.994 vs 阈值 0.995 是擦边过关。作者自己指出主区间包含零、大而互相抵消的 step 与 ramp 系数暴露 intercept–kernel 近共线,因而预设联合规则拒绝了双侧上限估计。这意味着 Panel B 的区间本身是在一个已知条件不良的拟合上得到的稳健性替代品。
- 创作者消融是双剂量而非开关,无法恢复保底本身的总价值;要恢复需要一个零探索创作者臂,而那在生产上大概率不可接受。
- 线性均值场模型的分辨率不够改进分配器。$\delta$ 与 $q$ 都是总体平均,per-item 的 $\delta_c$ 与 $q'_s$ 全部未识别,所以命题 2 只能重定预算的影子价值,给不出池内排序信号。论文明确把算法设计排除在 scope 之外——这既是诚实,也意味着它对"下一步怎么改分配器"只给出了原则性建议(把慢因子离线估计后作为先验导入),没有可落地的方法。
- 单平台、绝对量级全部保密、不可复现。所有预算水平、语料规模、$\omega$ 的生产取值都被隐去,附录 D 的数值示意明确声明"每个参数都是为了可读性选的、与生产值不同"。外部读者只能验证推理,不能验证数字。
- 反号反馈明确在模型之外。crowd-out 与质量稀释会压低谱半径,作者只处理了固定容量这一条负反馈(Remark 1),其余非负反馈的省略被论证为"对本文结论保守",但这个保守性只对乘数成立,对净价值符号不成立——挤占效应恰恰是让净语料渐近值可能为负的机制。
综合评价(reading_score = 8):这是一篇罕见的、把工业生产实验做到能支撑因果识别论证的论文。它的经验资产(8 个月创作者消融 + 一年期观众消融 + 两个共同分流实验)在公开文献里几乎没有对手,理论部分(视野盲区界、估计地板不可能性、识别图)不是装饰而是真的在约束实验解读,方法论自觉(非重叠期间差分、双实验交叉见证、安慰剂 cohort、覆盖率模拟、共线性自曝、exploratory 状态保留)也远超工业论文的平均水平。按本库"工业系统介绍/经验分享类若披露真实架构设计、踩坑经验、规模化细节可以给高分"的标准,它披露的是度量与实验设计层面的踩坑经验,价值同样成立。扣分的地方也很实在:核心问题(探索的总价值、语料渐近值符号)明确未解决;关键结论依赖一个未被识别、假设未验证的换手率;主拟合条件不良、靠预设规则降级为稳健区间;对下游分配器只给原则不给算法;单平台单操作点、绝对量级保密使外部效度与可复现性都受限。因此是"扎实工作"分段的上沿而非"开创性工作"。