小红书新笔记冷启动实战:从Look-Alike召回原理到向量工程实现
新发布的笔记在小红书平台上如何快速获得曝光?这可能是每个内容创作者和算法工程师都在思考的问题。想象一下,你刚发布了一篇关于"城市咖啡探店"的笔记,系统需要快速判断哪些用户可能对这类内容感兴趣。传统的内容匹配方法往往需要积累足够的用户行为数据才能做出准确推荐,而Look-Alike技术则提供了一种更聪明的解决方案——通过种子用户的行为数据,快速找到相似兴趣的用户群体。
1. Look-Alike技术在小红书冷启动中的应用原理
Look-Alike技术的核心思想可以类比为社交网络中的"朋友的朋友"概念。当一篇新笔记获得少量用户的积极互动(点击、点赞、收藏等),这些用户就成为"种子用户"。系统会认为:与这些种子用户相似的其他用户,也可能对同一篇笔记感兴趣。
这种技术特别适合解决内容平台的"冷启动"问题。新发布的笔记缺乏历史交互数据,传统推荐算法难以准确评估其受众群体。而Look-Alike方法能够:
- 快速响应:只要有少量用户互动,系统就能立即开始扩散推荐
- 精准定位:基于用户向量相似度,而非简单的内容标签匹配
- 动态调整:随着更多用户互动,笔记的受众画像会不断优化
在实际工程实现中,小红书采用双塔模型生成用户向量。当新笔记获得种子用户后,系统会计算这些用户向量的均值,作为该笔记的临时表征向量。这个向量本质上反映了"什么样的用户群体喜欢这篇笔记"。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 种子用户Embedding提取与均值计算
种子用户的选择和处理是Look-Alike召回的关键第一步。在小红书的实现中,任何对笔记产生正向交互(点击、点赞、收藏、转发)的用户都会被纳入种子用户集合。
用户Embedding提取流程:
- 实时监控用户对新笔记的交互行为
- 从双塔模型的用户塔中查询相应用户的Embedding向量
- 将符合条件的用户向量加入种子集合
种子用户向量的均值计算并非简单的算术平均。工程实践中需要考虑以下因素:
| 权重因素 | 说明 | 典型取值 |
|---|---|---|
| 行为类型 | 不同行为代表不同兴趣强度 | 点击:1, 点赞:2, 收藏:3, 转发:4 |
| 时间衰减 | 近期行为更有参考价值 |
