沙龙文库 · 历年文章

如何作大死地为你的创业公司招聘第一位数据科学家

来自知乎 前两天读了一篇文章,讲一个创业公司招收第一位数据科学家的虚构故事,充满雷坑,让人读起来妙趣横生。在数据方面工作两年,感觉深有同感,因为原文是英文,在这里简单翻译,与大家分享。有能力的还是读原文:来自 Monica Rogati 的 How not to hire your first data scientist - Hacker Noon 以下是正文: 你,是一个创业公司的创始人。你内心深处深深地了解,为了跟上创业的潮流,需要搞一搞“大数据计划”(甚至“人工智能计划”)。你的投资者和客户都在跟你不停地谈论机器学习(甚至深度学习)。你已经意识到,这不是一个为什么要做的问题,而是一个何时完成的问题。

所以,你打算招聘你的第一位数据科学家,一个应届生(毕竟有工作经验的极难招聘,并且太贵)。这人有博士学位(所以你还可以在跟客户和投资人谈话的不经意间提提“我们有巨牛的博士在搞算法”)。博士们对于即将开始完成的机器学习项目充满了兴奋!当然,你也是!你觉得一切都会顺风顺水。

你的数据科学家开始他的工作了,准备好收集公司的数据,并且建立模型,这一切正如你期待的那样。在学校的时候,这些博士生使用的都是已经整理好、沿用了多年的数据。他们当然知道现在情况不一样了,需要自己准备数据了,但这完全不是问题。你的公司已经有长达一年的日志数据存在 S3 上,可以拿来当做数据源,进行挖掘和训练模型。

(图)如何思考数据科学的韦恩图 然而……你的公司完全没有为数据分析准备的基础软件架构,所以一切都得从零做起。你的数据科学家正在试着安装各种与公司技术栈不太统一的工具和软件。此时此刻,为了解决任何一个数据分析上的需求,都需要重新解析一遍日志文件。你的工程师团队对于数据的获取有些担心,特别是对于让他直接获取生产环境上的业务数据,于是提供了一份业务数据的线下备份。

啊哈 ,你对着你的数据科学家说, 你现在已经有了你要的所有数据啦!

但是……那份线下存储的业务数据备份,当然,并不是按照适合数据分析的格式所存储的,甚至想要与日志文件一一对应起来都不容易。不少数据看起来并没有什么意义,或者丢失了几周的,唯一有图表的数据都是与运维相关的。因为缺乏基础架构,甚至连最简单的查询,都似乎永远跑不完。

每个人都很沮丧 你的数据科学家,当然是希望把时间花在做机器学习的算法上,毕竟他们之前大部分的学习时间都在思考这些优雅的算法,以及发表论文。他们也知道,肯定需要花费一些额外的时间,来收集和清洗数据。但他们从来没有意料到会如此艰难,数据难以理解、杂乱、有缺失,甚至获取不到。他们也从来没有意料到他们要花如此多的时间来开会,或者在 Slack 上询问,数据是如何收集的,那些 json 数据中具体的含义是什么。他们也没有意料到整个公司似乎对于数据毫不关心,没有人意识到每一次的重构可能都会带来数据的改变,导致业务数据中月与月的比较发生不匹配。科学家们也没有意料到,从来不会有人,把用户点击时所看到的所有选择,而不仅仅是点击的那一项,都存入日志,更不用说点击时的 UI 设计,所以一整年的数据并不能直接当做模型的训练数据。

你招聘了一个数据科学家,期待他来做机器学习。他们已经被警告过需要花费80%的时间来清洗数据,但这个现在看起来也不太现实了,实际上,他们80%的时间都花在了乞求,乞求合适的数据可以被创建、获取、移动到合适的位置、或者获得解释。剩下20%的时间,都在游说公司的人员使用更加适合数据分析的工具,建立更适合数据获取的安全政策和软件基础架构,亦或者试着找一份新的工作。

你的工程师团队也很沮丧。他们不得不从他们正常工作的时间中抽出额外的时间,来协助坐在旁边的新来的科学家,完成大量吃力不讨好工作,并且认为这些数据科学家什么都没完成,却还不断地抱怨数据仍然不够好。

你,作为公司的创始人,更加沮丧。已经两个月了,这位数据科学家甚至连一个像样的数据表盘都没有做出来,更不用说大家都更期待更炫酷的机器学习了。并且,这些数据科学家们似乎也不太能够融进公司的文化中,还使得所有人的工作进展都慢了不少。内心深处,你已经开始觉得机器学习可能只是一种骗人的噱头,人工智能也只是一种毫无产出的短期狂热。

当然,你也只是在自己内心深处这么想一想。在面对你的客户和投资人时,你依然大谈特谈你的人工智能计划,以及你超级聪明的博士数据科学家正兴奋地做着炫酷的机器学习…… 如果你想了解如何避免这样的情形,Quora 上有一个问题应该有所帮助: What are the challenges of building a data team at a startup? 一点感想 文章写得非常现实,每一个中小型公司里的数据科学家,不论是做数据分析,还是机器学习建模,都需要面临大量的数据基础设施建设问题。格式良好、适合分析的数据不会从天而降,而需要与大量的部门合作,中间一定会经历大量的挫折,但基础设施的建设过程不可能省去,对于一个数据驱动的公司必须要跨过这个坑。

之前有个问题讨论 Kaggle 的比赛在 Machine Learning 领域中属于什么地位?

我提到,事实上单做机器学习的实验本身,比如像 Kaggle 中的问题一样,已经是非常明确的任务了。但是为了达到这一步,��有大量的其他任务需要完成,而我们大量的时间其实都花在了完成其他那些琐碎的事情上。甚至为了让我们设计的功能能够上线,我们还需要反反复复组织活动给大家普及 AI 的知识,组织 Data Science Lunch 之类的活动,正如我在 做底层 AI 框架和做上层 AI 应用,哪个对自己的学术水平(或综合能力)促进更大?

中详细描述的。

互联网创业公司如何从零开始建立第一个专门负责数据的团队?会面临什么样的挑战?有哪些坑可以避免?有哪些是核心职能?哪些工具适合使用?需要招收什么样的人员?欢迎大家移步这个问题充分讨论: 互联网创业公司如何建立数据团队? - 知乎 ---- @陈然 管理新知 创业公司 互联网 创始人 科技 数据科学家 您可能感兴趣的文章 How to Improve Your Recruiting Batting Average

25 Points 2014-06-13 Generation U: Too Many Underemployed College Grads 2013-07-30 How to Stay Motivated at Work 2012-11-13 最近文章 TEST 2018年01月15日 嫖娼被抓不属无故旷工,公司解雇赔4万!(法院判决) 2018年01月15日 如何判断你是否具有HRBP胜任力?

2018年01月15日 阿里为什么不去清华招人?

2018年01月15日 因利益冲突,Facebook COO和Twitter CEO退出迪士尼董事会 2018年01月15日 热门文章 嫖娼被抓不属无故旷工,公司解雇赔4万!(法院判决) 2018年01月15日 如何判断你是否具有HRBP胜任力?

2018年01月15日 阿里为什么不去清华招人?

2018年01月15日 2017年度职场出差行程调查,出差最多的居然是他们!!

2018年01月12日 员工在自己QQ空间评论HR经理吃屎,可辞退他吗?

2018年01月11日 扫一扫 加微信【已隐去】 关于沙龙 顾问委员 广告推广 隐私安全 联系我们 申请vip会员 支付方式 市场合作或广告投放 电话:【电话已隐去】 邮件:【邮箱已隐去】 在线QQ【已隐去】 VIP会员 企业VIP会员 机构VIP会员 广告刊例 商务合作 Follow HRSalon