去哪儿网端智能架构设计和实践
原创 陈军 2025-12-10 18:00 北京
文章概览
- 背景
- 架构设计
业务实战:用户流失预测挽留场景深度剖析
未来规划
作者介绍:
陈军,2024年加入去哪儿网,目前在大前端中心基础框架团队,主要负责大前端技术架构工作。
一、背景
移动互联网时代,传统业务模式是端来负责内容呈现,云端进行推荐和决策。近年来随着终端算力的持续提高使得边缘计算成为可能,通过边缘计算提升整体业务服务的实时性,算力与存储能力为用户打造更好的体验,并且边缘计算主要的数据在端内存储可以更好的保护用户隐私。围绕端智能这个前沿课题,去哪儿建设了以数据为中心的端AI解决方案,让端具备实时感知、计算、决策的能力,为端上智能场景提供统一可复用的的平台基建。
1.1 什么是端智能
简单说就是在端侧(如手机)进行机器学习或深度学习模型的推理及上层应用。得益于现代硬件(CPU/GPU)的发展,我们可以将计算工作保留在客户端进行,让端具备实时感知、计算、决策的能力。与云计算模型相比,端智能将计算、存储和分析功能移到更接近数据源的地方,具有以下优势:
极致实时性:在端上进行实时决策,我们能对用户的操作进行毫秒级的响应,同时不受网络环境的影响,即便弱网环境下也能保障用户体验。
个性化增强:考虑到通信成本,对于端上一些超高频的行为事件如快速滑动等,并不会全部上报,但端上可以直接对这些事件进行计算与加工,使之成为额外的特征输入。
云资源成本节约:计算本地化减少云计算过载,数据本地化以减少云存储压力,使得端与云的通信成本大大降低。
隐私性保障:用户数据在本地处理,避免数据上传,无隐私合规风险。
1.2 为什么要做端智能
端智能技术的引入,是去哪儿旅行 App 在日益激烈的竞争中,寻求卓越用户体验和高质量增长的必然选择。它主要解决了传统云端模型面临的两大核心瓶颈:
瓶颈一:网络延迟与用户体验时效性挑战
传统云端模型存在数百毫秒乃至秒级以上延迟。由于用户有效注意力窗口可能是秒级的,高延迟会直接导致策略触发滞后。以列表重排为例,当策略结果返回时,用户已大概率离开当前列表页面,使得旨在提升转化的策略彻底失效,直接造成关键转化时机的流失。端智能将推理决策能力下沉至本地,实现了毫秒级响应,能够确保在转化窗口关闭前完成策略的触发,最大限度地挽留用户。
瓶颈二:用户隐私保护与合规性要求
随着用户对个人数据隐私保护意识的提高和相关法规的日益完善,将所有用户行为数据上传至云端进行处理,带来了潜在的隐私泄露风险和合规性挑战。
二、架构设计
为支撑端智能的规模化应用与快速迭代,我们设计并构建了一套分层解耦、端云协同的智能基础设施。整体架构旨在提供一个高性能、高复用性、易接入的基础设施平台,持续驱动业务创新,整体架构设计如下:
端智能架构图
整体架构主要由引擎层、基建层、应用层构成,其中引擎层主要负责为模型的推理提供引擎支持;基建层主要负责端上用户行为的实时采集、特征管理、模型管理以及相关监控等;应用层业务通过调用基建层提供的推理API,实时识别出用户真实意图,并根据推理结果及时作出干预。
2.1 引擎层
引擎在底层架构上实现了对多种主流模型类型的深度支持。它不仅高效兼容传统的机器学习模型,如我们在业务中应用的 XGBoost 和 LightGBM(适用于高精度排序和分类任务),同时也能稳定运行复杂的深度学习模型,包括 RNN、CNN、Transformer 架构,为未来向更复杂的模型迁移预留了通道。业务方可以根据场景需求和对性能、复杂度的要求,灵活选择最合适的模型类型。同时引擎库本身不仅被设计得很轻量,对 App 的包体大小影响很小,而且解决了模型在终端设备上高效、稳定运行的挑战。
毫秒级推理性能: 基于轻量化推理引擎,实现了模型的加载、执行和推理,将单次推理耗时严格控制在毫秒级,保障了对用户操作的即时响应。
高稳定与高兼容: 引擎层实现了跨平台兼容(iOS/Android),确保了模型在不同硬件上具有稳定且高性能的表现,保持 99.9% 的推理成功率。
2.2 基建层
2.2.1 行为中心:特征中枢与数据准备
机器学习领域有句话:“数据和特征决定了上限,而算法和模型只是逼近这个上限而已”,对于端智能,自然也不能违背这个定律,为了更好地应对数据方面的问题,我们提出了端上行为中心,行为中心不仅承担了实时采集端侧特征的职责,更是一个集实时感知、特征工程、数据管理于一体的智能中枢。
行为中心架构图
作为特征中枢,行为中心是模型训练和端侧推理的数据准备核心,其功能覆盖了特征的采集、处理与价值评估的全过程:
实时特征收集:通过 Hook 埋点引擎,无侵入式地实时收集用户的微观行为、设备上下文信息等复杂多源特征。
特征处理与汇聚:具备轻量级实时特征计算能力,能够基于原始日志实时生成模型所需的统计特征和序列特征,提供高质量、高时效性的模型数据源。通过特征处理得到了一系列我们认为对当前的问题有意义的特征后,我们还需要进一步分析每个特征的价值大小。这里的价值指的是这些特征对模型的价值,进而我们才能够在获取这些特征的成本以及效果的收益上来做一个权衡。
分析特征对模型的价值通常有以下方法:
pearson、spearman、cohen's kappa等相关性系数方法
Lasso、Ridge等正则化方法
距离相关系数方法
决策树特征排序方法
这些方法各自有自己的适用场景,这里就不再赘述。特征分析除了对模型效果进行先验预估外,还可以帮助我们筛选出对当前场景最有价值的特征。因为增加特征通常来说是有附带成本的。
作为在客户端上运行的模型,为了更好的实时响应能力,我们需要尽可能地降低整个链路的耗时以及模型大小,也能更好的保证端上智能的效果。
2.2.2 模型管理平台:构建自动化迭代能力
为确保端上模型的迭代效率和稳定性,我们构建了一套自动化的模型管理体系,负责模型从训练到端上使用的的完整生命周期管理
自动化模型训练与迭代:平台构建了高效的模型训练调度能力,以支撑持续集成与交付。模型首次验证后,系统会自动拉取线上实时数据进行增量训练和周期性重训,从而保证模型的新鲜度和高精度。整个过程通过“数据到模型”自动化管道实现全流程管理。训练后的新模型将自动推送至模型版本库集中管理,为后续的灰度发布和快速回滚提供支撑。
自动化模型校验:在模型部署之前,会进行多维度的自动化校验。这包括离线指标评估(如 AUC、NDCG)、离线效果预估、以及至关重要的端侧兼容性),确保模型满足上线标准。
自动化模型下发与部署:平台支持模型的热更新和分批灰度下发机制。新的模型版本可以精准投放到特定用户群进行小流量测试,并通过远程配置进行动态切换。一旦发现问题,支持秒级回滚到稳定版本,最大程度保障线上服务的稳定性和用户体验。
模型应用(场景应用):模型的最终价值通过端侧实时推理实现,并结合上报分析形成持续优化的闭环 。
实时推理与执行: 客户端利用轻量化的推理引擎进行模型推理。整个推理过程实现了毫秒级的单次推理耗时,保持 99.9% 的推理成功率。
效果闭环评估: 模型干预结果及用户后续行为数据将进行上报分析和结果评估。评估结果将再次反馈到“数据准备”和“模型训练”阶段,驱动持续优化 。
实时效果监控:除此之外,我们还部署了一套实时效果监控系统。用来实时观测模型的效果、性能和稳定性等关键指标,并在未来模型因为用户群体改变或场景改变效果下降时来进行及时报警。
2.3 应用层
应用层承载端智能的最终业务价值,实现了流程中的场景应用
业务接入与执行: 通过统一的接口,将引擎层的实时推理能力导入到具体的业务场景中(如酒店列表重排),实现模型推理结果的业务化应用。
效果闭环评估: 模型干预结果及用户后续行为数据将进行上报分析和结果评估。评估结果会再次反馈到模型训练阶段,完成一个完整的效果闭环,持续驱动业务价值增长。
整体架构旨在提供一个高性能、高复用性、易接入的基础设施平台,持续驱动业务创新 。基于此,模型迭代闭环体系的建成,为端智能能力的规模化落地奠定了坚实基础。
接下来,我们将以用户流失风险预测挽留场景为例,深度剖析我们如何利用端智能架构的极致实时性和特征感知能力,成功解决传统云端决策在捕捉用户瞬时意图时的核心瓶颈,并实现的业务价值。
三、业务实战:用户流失预测挽留场景深度剖析
3.1 业务场景痛点
在传统的云端流失预测挽留模式下,存在以下核心瓶颈,导致流失预测与干预的效率低下:
实时特征滞后: 用户的“流失前兆”往往体现在一系列高频、微观、负向的行为上(如快速切换、频繁返回、无效搜索)。这些瞬时行为信号由于网络成本高昂,无法及时完整地上报至云端。云端模型只能依赖滞后的历史数据和宏观画像,导致对用户当前会话中的脱离意图感知滞后。
干预时机错失: 云端模型通常只能在用户完成会话、甚至次日才能识别出流失风险。当预测结果出来时,最佳的挽留窗口(即用户仍在App内或刚刚离开)已经关闭,导致挽留策略的效率大打折扣。
弱网环境的预测失效: 在用户网络环境不佳时,任何基于云端服务的预测都会失败或产生高延迟,使得在用户体验最差、最易流失的环境下,预测能力完全缺失
3.2 解决方案
通过在端侧部署模型,实时捕捉用户的瞬时行为特征进行推理,从而有效识别出高风险流失用户,进而进行干预挽留,有效提升用户转化。
具体来说,我们方案围绕实时特征捕捉、模型推理两个核心环节展开:
实时特征捕捉与多维挖掘:我们从用户行为、浏览深度、上下文环境等多个维度进行了深入的特征挖掘。关键在于,端侧模型能够直接获取并利用云端难以实时获取的实时、微观行为特征。云端用的是“过去的数据”,而端上用的是“此时此刻的数据”。
毫秒级实时推理与偏好建模:这些与用户“瞬时意图”强相关的核心特征被用作模型训练,在客户端,利用架构中轻量级推理引擎的支撑,我们实现了对用户意图的毫秒级响应,它无需依赖网络请求,能够利用用户的最新行为特征进行实时推理,将单次推理耗时严格控制在毫秒级( ≤10ms) ,实时计算出用户的流失风险值。
3.2.1 挑战与应对
挑战一:端侧复杂多源特征的实时整合与一致性保障
在用户流失预测场景中,用户行为特征呈现出显著的碎片化、实时性要求高且来源多样(跨业务)的特点。主要挑战有:
特征来源分散: 用户在酒店业务的无目的浏览、快滑等瞬时行为,以及在平台其他业务线(如机票、门票)产生的瞬时行为,甚至设备本身的上下文信息(地理位置、网络状态),都可能影响流失风险的预测。这些数据分布在不同的业务模块和生命周期中,难以进行统一、实时的收集与聚合。
实时性与完整性冲突: 为满足端侧毫秒级预测需求,需要极致的实时特征。然而,将所有高频、分散的行为特征如果实时上传至云端进行计算,不仅会导致巨大的网络传输开销和延迟,也难以保证特征的完整性和新鲜度
跨业务特征协同难题: 平台内部的跨业务用户行为(如用户在机票业务中搜索高端酒店目的地)对于酒店推荐具有重要价值。但如何在端侧高效、安全地获取、融合并利用这些跨业务特征,同时避免数据孤岛和隐私风险,是一个复杂的系统性挑战。
应对方法:构建端侧行为数据中心,实现特征的实时聚合与共享
针对上述挑战,我们创新性地在端侧构建了统一的行为数据中心,并结合Hook 埋点引擎,实现了特征的实时整合与高效利用:
统一特征汇聚与管理:在端侧,通过Hook 埋点引擎,我们能够无侵入式地拦截并实时收集所有业务方上报的埋点数据。这些数据经过标准化处理后,在数据中心内进行统一存储、管理和实时聚合,形成用户在端侧的全景行为画像。这解决了特征来源分散的问题,确保了所有相关业务数据(包括跨业务数据)都能被实时、完整地收集到端侧。
实时特征计算与共享:数据中心具备轻量级实时特征计算能力,能够基于汇聚的原始行为日志,实时生成模型所需的统计特征、序列特征等。这些特征通过统一接口供所有端侧模型进行查询和调用,避免了重复计算和特征不一致的问题。满足了重排场景对特征实时性的极致要求,并实现了特征的“生产-消费”高效协同。
通过构建端侧行为数据中心,我们有效解决了用户流失预测场景下复杂多源特征的实时整合难题,显著提升了模型的实时性、准确性,并为端侧智能决策提供了坚实的数据基础。
挑战二:稀疏数据场景下的模型选择困境
在用户量相对有限的一些的细分业务场景中,我们面临着典型的数据稀疏性问题。初期尝试采用了深度学习模型进行训练时,由于有效样本不足以支撑深度模型的复杂性学习能力,导致模型过拟合或泛化能力差,最终在线下验证和早期线上尝试中表现出准确率偏低,且业务效果不明显。这暴露出深度模型在数据量不足时,其强大的特征抽象能力反而成为劣势,难以从有限数据中捕获稳定、鲁棒的模式。此外,深度模型的“黑盒”特性也使其在效果不佳时,难以进行有效的归因分析和策略优化。
应对方法:
分阶段模型复杂度策略 :针对数据稀疏或冷启动场景,我们优先采用了具有强解释性和较少参数的传统机器学习模型,选择了梯度提升树(XGBoost)。这类模型对数据量要求相对较低,通过特征重要性、SHAP 值等工具,能够提供高可解释性,便于业务方理解决策逻辑,从而辅助快速进行归因分析和特征工程迭代。通过快速验证模型的可行性,并为业务方提供清晰的决策依据,加速早期策略调整和效果提升。
特征工程精细化与增强: 即使使用树模型,也需持续深化特征工程。结合酒店业务特性,从用户画像、历史行为(跨领域特征)、上下文信息、实时环境(如设备、网络状态)等多个维度挖掘特征。对于稀疏特征,采用Embedding 技术进行降维和密集化表示。通过高质量特征弥补数据量不足的劣势,增强模型的学习能力,确保模型能在有限数据下捕捉到核心用户意图。
模型迭代与效果监控闭环:建立快速的模型迭代机制,基于线上小流量 A/B 实验和离线回测,持续优化模型。同时,构建完善的线上效果监控仪表盘,实时追踪关键指标(准确率、召回率、转化率等),并设定预警机制。确保模型性能稳定,并能及时响应数据分布变化。当业务积累了足够的用户量和数据后,可以逐步探索更复杂的模型(如浅层神经网络),实现模型的渐进式升级,从而在不同发展阶段匹配最合适的模型复杂度。
最终,经线上实际推理数据验证,模型预测准确率较天然不下单概率相对提升了12%。
四、未来规划
目前,去哪儿的几个核心场景的端智能化已初见成效,但仍有更多的场景等待挖掘。接下来,我们将围绕平台赋能、深度感知、前沿探索 三大方向持续发力:
平台赋能与规模化落地:持续打磨框架与工具链,优化平台稳定性、易用性,并完善对多点位推理的支持能力,以支撑更复杂的业务场景。最终目标是助力业务上更多场景实现端智能的规模化落地。
深化用户行为与意图理解:进一步研究端上用户行为模式,结合行为中心提供的瞬时信号,挖掘更深层、更具时效性的用户意图特征,实现更精准、更具前瞻性的用户感知,从而洞察用户兴趣并持续提升用户体验。
布局端侧复杂能力:探索研究端上轻量化大模型的部署和应用,直接利用端侧大模型提供的复杂推理能力为业务赋能。同时,探索更多的端云协同范式,如端云协同训练,千机千模等。