2026-07-06 日报
主题: 快手异构生成式推送落地,学术侧聚焦用户建模边界
标签: semantic-id · industrial · inference-serving · rl · pretrained-lm
📊 统计: 共 5 篇 · 精读 1 · 🏢 工业界 1 · 🎓 学术 4 · generative-rec 1 · llm 1 · discriminative-rec 1 · other 2
综述
当日入选 5 篇,生成式推荐、判别式推荐、LLM 各 1 篇,其他 2 篇;工业工作只有快手 1 篇,其余均为学术,但那篇工业论文分量很重。HGenPush 用一条 decoder-only 主干融合 feed 长短期与推送点击、下发行为,在序列尾部挂两个 cls 锚点分别驱动视频与作者双分支;作者侧先用 InfoNCE 把作者表征对齐到用户兴趣,再经 RQ-Kmeans 离散化,并与目标视频首层语义 ID 拼成混合语义 ID,使作者级推荐直接产出可下发候选。解码侧以 Chained-MTP 取代自回归,靠兴趣锚点加前序语义 ID 的累加 embedding 保留层级依赖,命中率仅比 DeepSeek-MTP 低 0.99% 而单卡吞吐高 33.86%,再用 GSISPO 以点击后消费奖励做偏好对齐,线上转发率提升 7.57%,全量部署后日活提升 0.181%。学术侧则分别探讨模型对沟通意图的表征强于其行动、把画像写入与交互预测解耦的写入门控,以及针对稠密检索的句级黑盒攻击。生成式推荐的重心正从效果转向解码效率与可服务性。
重点论文
HGenPush · ⭐ 7/10
🏢 Kuaishou · 生成式推荐
HGenPush 用一条 decoder-only 主干融合 feed 长短期与 push click/send 多视角行为,在序列尾部挂 [cls]_a / [cls]_v 两个锚点驱动作者与视频双分支异构生成(作者侧用 InfoNCE 对齐用户兴趣后经 SimVQ 稳定的 RQ-Kmeans 离散化,并与目标视频首层 SID 拼成混合语义 ID 直接产出可下发候选),并用 Chained-MTP——以兴趣锚点为稳定上下文、加上前序语义 ID 的累加 embedding、每层独立 FFN 头并行出 token——取代自回归解码,HitRate@100 仅比 DeepSeek-MTP 低 0.99%(0.3915 vs 0.3954)而单卡最大 QPS 高 33.86%(1.70k vs 1.27k),再以点击后 session 消费奖励经 GSISPO(GSPO 序列级重要性采样 + CISPO 权重裁剪、不加 KL)做偏好对齐,代价 1.24% HitRate 换来线上转发率 +7.57%,全量部署于快手推送系统取得 DAU +0.181%(p=0.04)、CTR +1.577%(p=0.11)、App 使用时长 +0.148%(p=0.75)。
They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It · ⭐ 6/10
🎓 学术 · LLM
论文指出语言模型常常回应消息的字面而非发送者的用意(分享成品被评代码、深夜随手一句被做心理健康检查),并把这归因为读出失败而非表征缺失:线性探针能从默认前向的隐状态里干净且与表面无关地解码出发送者是想被“认可”还是被“评价”,跨 6 个模型 4 个家族乃至基座 checkpoint 都成立,还能推广到只能语用推断的意图与另一组词面干净的意图(支持 vs 帮助)。行为侧显示读出在模型内部落后于表征若干层,跨模型是否默认按意图行动则呈现模型特异的分层;作者进一步找到与该表征紧密相关的判别方向作为因果把手,仅靠 steering 就能在零提示下恢复目标行为、效果与显式指令相当,且该方向与“是否提供反馈”这一轴近似正交。
SPW-Gate · ⭐ 6/10
Prediction Is Not Memory: Dual-Timescale Gated Profile Writing for Persistent User Modeling
🎓 学术 · 判别式推荐
持久用户画像正越来越多地充当推荐系统的可复用记忆,但常见更新流程把“预测一次交互”和“这次交互是否该写进画像”混为一谈——观察到交互就当作更新长期状态的证据,而当该事件只反映临时情境、探索、曝光或短期满足而非稳定偏好形成时,这种写入是有害的。论文把这一边界形式化为选择性画像写入控制,并提出按时间切分的 near/far 离线协议:近未来证据提供弱写入风险监督、远未来证据保留作评测。控制器 SPW-Gate 是一个基于长期、短期与候选画像漂移特征的轻量写入风险门;在 MicroLens-100K 上,全写策略在 22.45% 的测试样例里损害了远未来画像对齐,SPW-Gate 把这一比例降到约 14.5% 且保留约 77% 的写入覆盖率,配套的等覆盖率对照与预测置信度基线说明收益不是单纯少写造成的,next-item 置信度也不足以充当写入有效性的代理。
SentAttack · ⭐ 5/10
SentAttack: A Sentence-Level Black-Box Adversarial Attack Method for Dense Retrieval Models
🎓 学术 · 其他
RAG 系统通常由稠密检索模型初检加神经排序模型精排组成,现有鲁棒性研究多集中在排序模型,对稠密检索的攻击又基本停留在词级扰动,对与查询无关的低排名目标文档难以显著提权。论文提出句级黑盒攻击 SentAttack:第一阶段通过迭代检索与黑盒 RAG 系统交互,收集排序文档与排名信息训练代理稠密检索模型;第二阶段用代理模型编码并聚类与目标查询相关的文档得到多个簇质心,把质心以句子粒度拼接到目标文档形成初始对抗候选,再用查询与质心引导的目标函数结合梯度引导 beam search 优化,实验显示其优于已有攻击、在低排名文档上尤为突出。
全部论文
| 模型 | 标题 | 类别 | 公司 | 摘要分 | 精读分 |
|---|---|---|---|---|---|
| HGenPush | HGenPush: A Heterogeneous Generative Recommendation Architecture for Industrial Push Notification Systems | 生成式 | 🏢 Kuaishou | 8 | 7 |
| — | They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It | LLM | 🎓 学术 | 6 | — |
| SPW-Gate | Prediction Is Not Memory: Dual-Timescale Gated Profile Writing for Persistent User Modeling | 判别式 | 🎓 学术 | 6 | — |
| SentAttack | SentAttack: A Sentence-Level Black-Box Adversarial Attack Method for Dense Retrieval Models | 其他 | 🎓 学术 | 5 | — |
| — | Personalized Causal Recourse: A Human-In-The-Loop Approach | 其他 | 🎓 学术 | 4 | — |