加入收藏 | 设为首页 | 会员中心 | 我要投稿 广元站长网 (https://www.0839zz.com/)- 科技、建站、经验、云计算、5G、大数据,站长网!
当前位置: 首页 > 站长资讯 > 传媒 > 正文

利用物联网提高制造业的质量控制水平

发布时间:2021-02-21 16:17:01 所属栏目:传媒 来源:互联网
导读:换一个角度看数据科学,这是一个实施自动化统计的行业,使用各种模型来进行分类和预测。下面是成为一名数据科学家必备的一些技能: Python 或者 R SQL Jupyter Notebook 算法/建模 (1) Python根据我个人经验,大部分公司倾向于用Python而不是R作为主要编程语

换一个角度看数据科学,这是一个实施自动化统计的行业,使用各种模型来进行分类和预测。下面是成为一名数据科学家必备的一些技能:

  • Python 或者 R
  • SQL
  • Jupyter Notebook
  • 算法/建模

(1) Python——根据我个人经验,大部分公司倾向于用Python而不是R作为主要编程语言。虽然职位描述里可能会同时列出两者;但是,我猜你身边的大多数人——比如机器学习工程师、数据工程师和软件工程师——都不怎么熟悉R。因此,要想成为一名更全面的数据科学家,Python应该更有用。

(2) SQL——乍看之下更像是数据分析师的技能,确实如此,但SQL仍是你从事数据科学必备的技能。工作中数据集往往不会直接发给你的,这跟学术界不同,你需要通过SQL获得自己的数据集。现在有很多SQL的分支,比如PostgreSQL、MySQL、Microsoft SQL Server T-SQL,以及Oracle SQL。它们都属于同一种查询语言,形式接近,但平台不同。因此,会其中任何一种就行,换到另一种SQL很容易。

(3) Jupyter Notebook——数据科学家的游乐场,既可以用于编程也可以建模。你可以把Jupyter当作一个研究工具,你可以编程,写代码,注释掉代码,调用sklearn、pandas和numpy这些库来建模和测试。

(4) 算法——数据科学家的主要职责是用算法来快速准确地预测、分类,以及根据数据来给建议。每当你用新的数据来训练模型,就会得到一些新的结果。关键的算法通常分成两大类:无监督学习(如聚类)和有监督学习(如分类/回归)。

一些具体的关键算法:

  • 随机森林(系综分类)
  • Logistic回归(分类——不是回归)
  • K-Means(聚类)
  • K-最近邻(分类/回归)

总的来说,数据科学家要做很多事,但主要职责是:

  • 与有关部门一起定义要解决的问题
  • 获取数据(使用SQL)
  • 探索性的数据分析、特征工程、模型构建、预测(使用Python、Jupyter Notebook、各种算法)
  • 根据工作场景,将代码编制成.py文件和/或用于部署的模型

数据分析师


 

内存:我的天!难道数据要在我内存中出现两份?

Linux :没错!你不知道,复制数据还得用CPU呢!很费劲的。

helloworld:老大,能不能让我直接访问你Page cache 中的数据?

Linux :那怎么行,你在用户空间,我在内核空间,你要是能访问,在我这里捣乱怎么办?必须禁止!

内存:嗯,有道理,不过,要是还有个程序,也要读取config.txt的前1024个字节,怎么办?

Linux: 那就简单了啊, 我一查就知道数据已经在Page cache中了,不用等几个月从硬盘读了,直接复制到那个程序的缓冲区就行了。

内存:啊?这数据重复太多了吧!


(编辑:广元站长网)

【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容!

    热点阅读