膳绫擎的代码示例给我们展示了注释和文档。要真正成为一个被同事爱好的法度榜样猿,并进步本身作为一名数据科学家的效力,就要会写竽暌剐用的简明扼要的注释。这不仅应当包含关于代码段的注释,还包含其输入和输出。
此外,关于docstrings可能最酷的是,它们可以经由过程大年夜多半说话的库转换为文档。例如Python有一个名为Sphinx的看维可以让你将docstrings转换成完全的文档。
你如今可能知道你的代码是什么,但当你测验测验调试或添加函数时,你和其他人将异常高兴有注释。

无论你应用什么竽暌癸言编写代码,请记得应用异常处理,并为你本身,同事和最终用户留下有效的缺点信息。膳绫擎的代码显示了一个停止函数,可以或许传递来自正在调用的API的缺点消息。
- stop(paste0(“Make sure all your inputs are strings: ”, e))

以上示例来自“Hitchhikers Guide to Python”,它应用Python测试库Pytest。
尽管编写测试单位对于开辟人员来说相当广泛,但这在数据科学范畴却很少应用。当然,你可以应用交叉验证,混淆矩阵和其他办法来验证你的模型。 然则,你是否测试了正在为你获取数据的萌芽? 你应用的各类办法是若何清理和转换数据的,你的模型须要它们吗? 这些方面对于安然防备“Garbage in, garbage out”(小编注:这两个单词典意思是,如不雅将缺点的、无意义的数据输入计算机体系,计算机天然也必定会输掉足误、无意义的结不雅。)至关重要。 当你测试代码时,不仅这两个将来的证据可以反竽暌钩可能惹人缺点的变更,并且当你有才能本身给本身检查代码时,每小我都邑认为你就像一个摇滚明星一样刺眼,因为一旦代码被用于实际临盆就会发明bug异常少。

然则不要仅仅止步于写一些只做一件工作的小函数,请务必抽象你的函数,以便从新应用它们 - 如许有助于降低代码冗余度,并能加快你的开辟时光,如许做下去至少让你成为一个2x 法度榜样猿。
为你的项目应用版本控制是成为10x数据科学家的重要一步。这最明显的好处是保存模型的不合版本,既可以轻松地进行团队工作,也可以经由过程在存储库中应用版本控制进行备份,防止在标记本电脑被盗或硬盘驱动器坠毁的情况下损掉工作。
在beta版中,有一个名为Data Version Control的开源数据版本控制项目,对于数据科学工作流程来说看着很有欲望。 它依附Git,并许可经由过程构建数据依附图来跨团队重现项目。你的数据会与你的模型分开保存,它与其他版本控件一样工作,许可你回滚到以前保存的备份。

10x开辟人员知道应用精确的对象来完成工作,无论是应用库来节俭时光,切换说话以实现机能,照样应用API,而不是本身大年夜头构建解决筹划。
比方说你如今有一些Twitter或其他社交数据要用来进行情感分析。一个选择是本身标注数据,练习本身的模型,另一个则是应用预先练习的模型。不去本身建立每个数据模型来从新造轮子是很薄的。应用最合适工作的对象,即使这意味着应用你没有构建过的对象。

我们都写过一个与Cron工作配对的Bash脚本来主动化一些申报,然则,在你花费一些时光测验测验调试由Cron主动履行的其他人撰写的申报时,你甚至不知道它在哪里运行,你会心识到必须有更好的办法才行。经由过程应用主动化对象,如Puppet,Chef,Ansible或任何其他风行的主动化对象,你就可以大年夜集中的地位运行你的工作,是声调试他人(或你本身)的工作就能快很多。

有时你可能找不到一个团队来负责你设计的模型,这个时刻就须要知道若何本身安排本身的模型。
固然膳绫擎那副图中的供给商之间有很多差别,但它们包含了大年夜难以置信的易用性到你须要的更多的设置和常识。本节的内容其实可以零丁成为一个话题。如不雅你想懂得有关模型托管的更多细节,可以查看我们的其他几个不合的申报,分别介绍安排模型(https://blog.algorithmia.com/building-intelligent-applications/ )以及安排和扩大你的深度进修模型(https://blog.algorithmia.com/deploying-deep-learning-cloud-services/)。
可能是致命伤的工作:
- 易用性
- 成本(包含附加组件和隐蔽成本,如托管数据)
推荐阅读
【沙龙】51CTO诚邀您9月23号和多位技巧大年夜咖一路聊智能CDN的优化之路,抓紧时光哦! 今天我们讲讲云厂商的核心好处——若何挣钱。公开谈这类内容须要脱敏,我说起的推导过程和>>>详细阅读
本文标题:如何成为一名顶级战斗力的数据分析师?
地址:http://www.17bianji.com/lsqh/37521.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示