1. 贝壳DMP平台建设背景与核心价值
在房产交易这个低频高价的垂直领域,用户决策周期长、行为路径复杂。贝壳作为居住服务平台,每天产生数以亿计的用户行为数据,但传统的数据管理方式存在三大痛点:数据孤岛严重、用户画像单薄、营销资源浪费。我们建设的DMP(Data Management Platform)平台,本质上是要解决"数据资产化"和"智能应用"两个核心问题。
从技术视角看,贝壳DMP区别于通用型DMP的关键特征在于:
- 行业专属数据维度(如房源带看轨迹、学区偏好、贷款资质预判)
- 超长周期行为建模(房产决策周期通常3-6个月)
- 线上线下数据融合(连接4000+线下门店的带看记录)
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 平台架构设计与技术选型
2.1 分层架构实现
采用Lambda架构处理实时+离线数据流:
code复制实时层:
Flink消费Kafka日志流 → 实时特征计算 → Redis/HBase
离线层:
Spark处理HDFS原始数据 → Hive数仓分层 → 特征集市
选择Flink而非Storm的考量:
- 精确一次处理(exactly-once)保证佣金结算等财务场景需求
- 自带状态管理适合用户连续行为会话(session)分析
- 与YARN/K8s的深度集成符合贝壳混合云部署现状
2.2 用户标识体系设计
房产行业的ID-Mapping特殊挑战:
- 跨端识别:APP/小程序/PC官网/线下POS机多端数据
- 家庭单位识别:夫妻共同看房场景需建立家庭图谱
- 经纪人关联:带看行为需绑定经纪人ID
我们的解决方案:
python复制class IDGraphBuilder:
def __init__(self):
self.graph = Graph()
def add_edge(self, id_type1, id1, id_type2, id2):
# 使用概率图模型处理弱关联
self.graph.add_probabilistic_edge(id1, id2, confidence=0.8)
def resolve_household(self):
# 基于共同看房记录、贷款申请人
