
简介
数据产品一向是 Airbnb 办事的重要构成部分,不过我们很早就意识到开辟一款数据产品的成本是很高的。例如,个性化搜刮排序可以让客户更轻易发明中意的房屋,智能订价可以让房主设定更具竞争力的价格。然而,须要很多半据科学家和工程师付出很多时光和精力才能做出这些产品。
在本文中,我将介绍这些对象是若何协同运作来加快建模速度,大年夜而降低开辟 LTV 模型(猜测 Airbnb 平易近宿价格)总体成本的。
数据科学家们平日比较熟悉和机械进修义务相干的器械,例如特点工程、原型制造、模型选择等。然而,要将一个模型原型投入临盆情况中须要的是一系列数据工程技巧,他们可能对此不太闇练。
什么是 LTV?
LTV 全称 Customer Lifetime Value,意为“客户毕生价值”,是电子商务、市场公司中很风行的一种概念。它定义了在将来一个时光段内用户预期为公司带来的收益,平日以美元为单位。
在一些例如 Spotify 或者 Netflix 之类的电子商务公司里,LTV 平日用于制订产品订价(例如订阅费等)。而在 Airbnb 之类的市场公司里,知晓用户的 LTV 将有助于我们更有效地分派营销渠道的预算,更明白地根据关键字做在线营销报价,以及做更好的类目细分。
位于希腊爱琴海伊莫洛维里的一个 Airbnb 平易近宿的好梦风景
我们可以根据以前的数据来计算汗青值,当然也可以进一步应用机械进修来猜测新挂号房屋的 LTV。

不过荣幸的是,我们有相干的机械进修对象,可以将具体的临盆安排工作流大年夜机械进修模型的分析建立平分别出来。如不雅没有这些神奇的对象,我们就无法轻松地将模型应用于临盆情况。下面精晓过 4 个主题来分别介绍我们的工作流以及各自用到的对象:
- 特点工程:定义相干特点
- 原型设计与练习:练习一个模型原型
- 模型选择与验证:选择模型以及调参
- 临盆安排:将选择好的模型原型投入临盆情况应用
特点工程
应用对象:Airbnb 内部特点库 — Zipline
任何监督进修衔目标第一步都是去找到会影响到结不雅的相干特点,章一?过程被称为特点工程。例如在猜测 LTV 时,特点可所以某个房源房屋在接下来 180 天内的可应用天数所占百分比,或者也可所以其与同市场其它房屋订价的差别。
在 Airbnb 中,要做特点工程一般得大年夜头开端写 Hive 萌芽语句来创建特点。然则这个工作相当无聊,并且须要花费很多时光。因为它须要一些特定的范畴常识和营业逻辑,也是以这些特点 pipeline 并不轻易共享或复竽暌姑。为了让这项工作更具可扩大性,我们开辟了 Zipline—— 一个练习特点库。它可以供给不合粒度级别(例如房主、客户、房源房屋及市场级别)的特点。
这个内部对象“多源共享”的特点让数据科学家们可以在以前的项目中找出大年夜量高质量、经由审查的特点。如不雅没有找到欲望提取的特点,用户也可以写一个设备文件来创建他本身须要的特点:
- source: {
- type: hive
- query:"""
- SELECT
- id_listing as listing
- , dim_city as city
- , dim_country as country
- , dim_is_active as is_active
- , CONCAT(ds, ' 23:59:59.999') as ts
- FROM
- core_data.dim_listings
- WHERE
- ds BETWEEN '{{ start_date }}' AND '{{ end_date }}'
- """
- dependencies: [core_data.dim_listings]
推荐阅读
据火币区块链研究中间编译,以前几年来,人们一向在谈论数字资产和区块链。区块链的立异正在赓续进行改进,平>>>详细阅读
本文标题:在Airbnb使用机器学习预测房源的价格
地址:http://www.17bianji.com/lsqh/37197.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示