AI个性化推荐在视频平台的应用从召回、排序到重排的全链路优化一、背景与问题定义推荐系统是视频平台的核心引擎。一个千万 DAU 的平台每天产生数十亿次推荐请求每次请求需要在 200ms 内从数百万候选视频中筛选出 20~40 个结果。这背后的核心挑战不是算得准而是算得快且准——延迟约束下模型的复杂度有硬上限。推荐系统的标准架构分为三层召回从百万到千、排序从千到百、重排从百到几十。每一层都有独特的约束条件和优化目标不可混为一谈。本文从工程实现的角度复盘三层架构的设计细节并重点讨论冷启动的解决策略。二、全链路推荐架构召回层的多路设计3.1 协同过滤召回经典的 ItemCF基于用户的历史观看行为构建视频与视频的共现矩阵。两个视频被同一用户观看的时间间隔越短共现权重越高。工程实现上共现矩阵离线计算Spark 每日更新在线服务通过 Hologres阿里云实时数仓的向量检索接口查询Service public class CollaborativeRecallChannel { Autowired private HologresClient hologresClient; public ListRecallItem recall(long userId, int recallSize) { // 1. 查询用户最近观看的 Top N 视频 ListUserHistoryItem recentHistory historyService.getRecentViews(userId, 20); if (recentHistory.isEmpty()) { return Collections.emptyList(); } // 2. 对每个历史视频查询其 Top K 相似视频 SetLong recallSet new LinkedHashSet(); for (UserHistoryItem item : recentHistory) { ListLong similarVideos hologresClient.querySimilarVideos( item.getVideoId(), 30); recallSet.addAll(similarVideos); } // 3. 去重并截断 return recallSet.stream() .limit(recallSize) .map(vid - new RecallItem(vid, RecallChannelType.COLLABORATIVE, 0.0)) .collect(Collectors.toList()); } }3.2 内容标签召回利用视频的 AI 标签参见第 4 篇文章将用户历史观看视频的标签构建为兴趣向量然后检索标签相似度最高的视频。这里的关键是标签衰减——用户 30 天前看过的美食视频其兴趣权重应该衰减到 10%。public class ContentTagRecallChannel { public ListRecallItem recall(long userId, int recallSize) { // 构建用户的兴趣标签向量时间衰减加权 MapString, Double interestVector buildInterestVector(userId); // 对每个高权重标签检索 Top K 视频 ListRecallItem results new ArrayList(); for (Map.EntryString, Double entry : interestVector.entrySet()) { if (entry.getValue() 0.1) continue; // 低权重标签跳过 ListLong videos esSearchClient.searchByTag( entry.getKey(), 20); for (Long vid : videos) { results.add(new RecallItem(vid, RecallChannelType.CONTENT_TAG, entry.getValue())); } } return results.stream() .distinct() .sorted(Comparator.comparingDouble(RecallItem::getScore).reversed()) .limit(recallSize) .collect(Collectors.toList()); } private MapString, Double buildInterestVector(long userId) { ListUserHistoryItem history historyService.getRecentViews(userId, 200); MapString, Double vector new HashMap(); long now System.currentTimeMillis(); for (UserHistoryItem item : history) { double daysAgo (now - item.getTimestamp()) / (1000.0 * 86400); double decay Math.exp(-0.05 * daysAgo); // 指数衰减 for (String tag : item.getTags()) { vector.merge(tag, decay, Double::sum); } } return vector; } }3.3 实时行为召回用户在当前会话中刚看完了一个视频下一步推荐什么实时行为召回关注的是会话级别的即时兴趣信号——用户刚看完一个足球视频短时间内推荐更多足球相关内容。3.4 多路合并与去重四路召回的结果在内存中合并、去重、并统一赋予初始分按通道权重加权。协同过滤得分 ×0.4 内容标签得分 ×0.3 实时行为得分 ×0.2 热度兜底得分 ×0.1。去重后的候选集约 1500~2000 条送入精排层。三、精排模型与特征工程精排模型采用 DeepFM 架构核心优势是同时建模低阶特征交互FM 部分和高阶特征交互DNN 部分。特征分为四组特征组示例维度用户侧特征年龄、性别、注册天数、活跃等级、兴趣标签向量~256 维视频侧特征时长、品类、标签、CTR、完播率、发布时间~128 维上下文特征时刻早/中/晚、设备、网络类型、请求位置~32 维交叉特征用户-品类交互、用户-时长偏好~64 维所有特征通过统一的 Feature Store 获取推理延迟约束在 50ms 以内。模型使用 TensorFlow Serving 部署每个请求走一次前向推理产出 200 个视频的预估 CTR。四、重排层的多样性控制精排的 Top 200 结果可能存在信息茧房——全是同一品类、同一作者的视频。重排层通过 MMRMaximal Marginal Relevance算法做多样性打散public class RerankService { public ListVideoItem rerank(ListVideoItem candidates, UserProfile user, int resultSize) { ListVideoItem selected new ArrayList(); ListVideoItem remaining new ArrayList(candidates); double lambda 0.6; // 相关性 vs 多样性权衡 for (int i 0; i resultSize !remaining.isEmpty(); i) { VideoItem best null; double bestScore Double.NEGATIVE_INFINITY; for (VideoItem item : remaining) { double relevance item.getCtrScore(); double diversity 1.0 - maxSimilarity(item, selected); double mmrScore lambda * relevance (1 - lambda) * diversity; // 新鲜度奖金24小时内发布的视频 0.05 if (isRecent(item, 24)) { mmrScore 0.05; } if (mmrScore bestScore) { bestScore mmrScore; best item; } } selected.add(best); remaining.remove(best); } return selected; } private double maxSimilarity(VideoItem item, ListVideoItem selected) { if (selected.isEmpty()) return 0.0; return selected.stream() .mapToDouble(s - cosineSimilarity(item.getEmbedding(), s.getEmbedding())) .max() .orElse(0.0); } }冷启动用户的处理新用户无历史数据采用试探→反馈→调整的策略。初次推荐时20% 的位置给热门视频探针60% 给所在地区/年龄段的热门视频人群统计20% 给随机品类视频发现新兴趣。后续根据用户对三类内容的完播率和互动率逐步调整比例。五、总结推荐系统的全链路优化是木桶效应的典型场景召回覆盖不够精排再准也没用重排缺乏多样性用户刷几条就审美疲劳。三层架构的设计让每层聚焦各自的约束条件——召回追求覆盖率精排追求准确性重排追求体验多样性。后续方向引入多目标优化同时优化 CTR、完播率、关注转化率利用强化学习建模长期用户满意度而非单次点击以及构建实时特征更新通道将特征从 T1 更新提升到分钟级缩小离线训练与在线服务的 gap。
AI个性化推荐在视频平台的应用:从召回、排序到重排的全链路优化
AI个性化推荐在视频平台的应用从召回、排序到重排的全链路优化一、背景与问题定义推荐系统是视频平台的核心引擎。一个千万 DAU 的平台每天产生数十亿次推荐请求每次请求需要在 200ms 内从数百万候选视频中筛选出 20~40 个结果。这背后的核心挑战不是算得准而是算得快且准——延迟约束下模型的复杂度有硬上限。推荐系统的标准架构分为三层召回从百万到千、排序从千到百、重排从百到几十。每一层都有独特的约束条件和优化目标不可混为一谈。本文从工程实现的角度复盘三层架构的设计细节并重点讨论冷启动的解决策略。二、全链路推荐架构召回层的多路设计3.1 协同过滤召回经典的 ItemCF基于用户的历史观看行为构建视频与视频的共现矩阵。两个视频被同一用户观看的时间间隔越短共现权重越高。工程实现上共现矩阵离线计算Spark 每日更新在线服务通过 Hologres阿里云实时数仓的向量检索接口查询Service public class CollaborativeRecallChannel { Autowired private HologresClient hologresClient; public ListRecallItem recall(long userId, int recallSize) { // 1. 查询用户最近观看的 Top N 视频 ListUserHistoryItem recentHistory historyService.getRecentViews(userId, 20); if (recentHistory.isEmpty()) { return Collections.emptyList(); } // 2. 对每个历史视频查询其 Top K 相似视频 SetLong recallSet new LinkedHashSet(); for (UserHistoryItem item : recentHistory) { ListLong similarVideos hologresClient.querySimilarVideos( item.getVideoId(), 30); recallSet.addAll(similarVideos); } // 3. 去重并截断 return recallSet.stream() .limit(recallSize) .map(vid - new RecallItem(vid, RecallChannelType.COLLABORATIVE, 0.0)) .collect(Collectors.toList()); } }3.2 内容标签召回利用视频的 AI 标签参见第 4 篇文章将用户历史观看视频的标签构建为兴趣向量然后检索标签相似度最高的视频。这里的关键是标签衰减——用户 30 天前看过的美食视频其兴趣权重应该衰减到 10%。public class ContentTagRecallChannel { public ListRecallItem recall(long userId, int recallSize) { // 构建用户的兴趣标签向量时间衰减加权 MapString, Double interestVector buildInterestVector(userId); // 对每个高权重标签检索 Top K 视频 ListRecallItem results new ArrayList(); for (Map.EntryString, Double entry : interestVector.entrySet()) { if (entry.getValue() 0.1) continue; // 低权重标签跳过 ListLong videos esSearchClient.searchByTag( entry.getKey(), 20); for (Long vid : videos) { results.add(new RecallItem(vid, RecallChannelType.CONTENT_TAG, entry.getValue())); } } return results.stream() .distinct() .sorted(Comparator.comparingDouble(RecallItem::getScore).reversed()) .limit(recallSize) .collect(Collectors.toList()); } private MapString, Double buildInterestVector(long userId) { ListUserHistoryItem history historyService.getRecentViews(userId, 200); MapString, Double vector new HashMap(); long now System.currentTimeMillis(); for (UserHistoryItem item : history) { double daysAgo (now - item.getTimestamp()) / (1000.0 * 86400); double decay Math.exp(-0.05 * daysAgo); // 指数衰减 for (String tag : item.getTags()) { vector.merge(tag, decay, Double::sum); } } return vector; } }3.3 实时行为召回用户在当前会话中刚看完了一个视频下一步推荐什么实时行为召回关注的是会话级别的即时兴趣信号——用户刚看完一个足球视频短时间内推荐更多足球相关内容。3.4 多路合并与去重四路召回的结果在内存中合并、去重、并统一赋予初始分按通道权重加权。协同过滤得分 ×0.4 内容标签得分 ×0.3 实时行为得分 ×0.2 热度兜底得分 ×0.1。去重后的候选集约 1500~2000 条送入精排层。三、精排模型与特征工程精排模型采用 DeepFM 架构核心优势是同时建模低阶特征交互FM 部分和高阶特征交互DNN 部分。特征分为四组特征组示例维度用户侧特征年龄、性别、注册天数、活跃等级、兴趣标签向量~256 维视频侧特征时长、品类、标签、CTR、完播率、发布时间~128 维上下文特征时刻早/中/晚、设备、网络类型、请求位置~32 维交叉特征用户-品类交互、用户-时长偏好~64 维所有特征通过统一的 Feature Store 获取推理延迟约束在 50ms 以内。模型使用 TensorFlow Serving 部署每个请求走一次前向推理产出 200 个视频的预估 CTR。四、重排层的多样性控制精排的 Top 200 结果可能存在信息茧房——全是同一品类、同一作者的视频。重排层通过 MMRMaximal Marginal Relevance算法做多样性打散public class RerankService { public ListVideoItem rerank(ListVideoItem candidates, UserProfile user, int resultSize) { ListVideoItem selected new ArrayList(); ListVideoItem remaining new ArrayList(candidates); double lambda 0.6; // 相关性 vs 多样性权衡 for (int i 0; i resultSize !remaining.isEmpty(); i) { VideoItem best null; double bestScore Double.NEGATIVE_INFINITY; for (VideoItem item : remaining) { double relevance item.getCtrScore(); double diversity 1.0 - maxSimilarity(item, selected); double mmrScore lambda * relevance (1 - lambda) * diversity; // 新鲜度奖金24小时内发布的视频 0.05 if (isRecent(item, 24)) { mmrScore 0.05; } if (mmrScore bestScore) { bestScore mmrScore; best item; } } selected.add(best); remaining.remove(best); } return selected; } private double maxSimilarity(VideoItem item, ListVideoItem selected) { if (selected.isEmpty()) return 0.0; return selected.stream() .mapToDouble(s - cosineSimilarity(item.getEmbedding(), s.getEmbedding())) .max() .orElse(0.0); } }冷启动用户的处理新用户无历史数据采用试探→反馈→调整的策略。初次推荐时20% 的位置给热门视频探针60% 给所在地区/年龄段的热门视频人群统计20% 给随机品类视频发现新兴趣。后续根据用户对三类内容的完播率和互动率逐步调整比例。五、总结推荐系统的全链路优化是木桶效应的典型场景召回覆盖不够精排再准也没用重排缺乏多样性用户刷几条就审美疲劳。三层架构的设计让每层聚焦各自的约束条件——召回追求覆盖率精排追求准确性重排追求体验多样性。后续方向引入多目标优化同时优化 CTR、完播率、关注转化率利用强化学习建模长期用户满意度而非单次点击以及构建实时特征更新通道将特征从 T1 更新提升到分钟级缩小离线训练与在线服务的 gap。