用Python做数据分析之数据处理及数据提取

2023年8月20日下午1:43 • Python • 阅读 43

1、数据预处理

第四部分是数据的预处理，对清洗完的数据进行整理以便后期的统计和分析工作。主要包括数据表的合并，排序，数值分列，数据分组及标记等工作。

1）数据表合并

首先是对不同的数据表进行合并，我们这里创建一个新的数据表 df1，并将 df 和 df1 两个数据表进行合并。在 Excel 中没有直接完成数据表合并的功能，可以通过 VLOOKUP 函数分步实现。在 python 中可以通过 merge 函数一次性实现。

下面建立 df1 数据表，用于和 df 数据表进行合并。

1 #创建 df1 数据表

2 df1=pd.DataFrame({‘id’:[1001,1002,1003,1004,1005,1006,1007,1008],

3 ‘gender’:[‘male’,’female’,’male’,’female’,’male’,’female’,’male’,’female’],

4 ‘pay’:[‘Y’,’N’,’Y’,’Y’,’N’,’Y’,’N’,’Y’,],

5 ‘m-point’:[10,12,20,40,40,40,30,20]})

使用 merge 函数对两个数据表进行合并，合并的方式为 inner，将两个数据表中共有的数据匹配到一起生成新的数据表。并命名为 df_inner。

1#数据表匹配合并，inner 模式

2df_inner=pd.merge(df,df1,how=’inner’)

除了 inner 方式以外，合并的方式还有 left，right 和 outer 方式。这几种方式的差别在我其他的文章中有详细的说明和对比。

1#其他数据表匹配模式

2df_left=pd.merge(df,df1,how=’left’)3df_right=pd.merge(df,df1,how=’right’)4df_outer=pd.merge(df,df1,how=’outer’)

2）设置索引列

完成数据表的合并后，我们对 df_inner 数据表设置索引列，索引列的功能很多，可以进行数据提取，汇总，也可以进行数据筛选等。

设置索引的函数为 set_index。

1#设置索引列

2df_inner.set_index(‘id’)

3）排序(按索引，按数值)

Excel 中可以通过数据目录下的排序按钮直接对数据表进行排序，比较简单。Python 中需要使用 ort_values 函数和 sort_index 函数完成排序。

在 python 中，既可以按索引对数据表进行排序，也可以看制定列的数值进行排序。首先我们按 age 列中用户的年龄对数据表进行排序。

使用的函数为 sort_values。

1#按特定列的值排序

2df_inner.sort_values(by=[‘age’])

函数用来将数据表按索引列的值进行排序。

1#按索引列排序

2df_inner.sort_index()

3）数据分组

Excel 中可以通过 VLOOKUP 函数进行近似匹配来完成对数值的分组，或者使用”数据透视表”来完成分组。相应的 python 中使用 where 函数完成数据分组。

Where 函数用来对数据进行判断和分组，下面的代码中我们对 price 列的值进行判断，将符合条件的分为一组，不符合条件的分为另一组，并使用 group 字段进行标记。

1#如果 price 列的值>3000，group 列显示 high，否则显示 low

2df_inner[‘group’] = np.where(df_inner[‘price’] > 3000,’high’,’low’)

除了 where 函数以外，还可以对多个字段的值进行判断后对数据进行分组，下面的代码中对 city 列等于 beijing 并且 price 列大于等于 4000 的数据标记为 1。

1#对复合多个条件的数据进行分组标记

2df_inner.loc[(df_inner[‘city’] == ‘beijing’) & (df_inner[‘price’] >= 4000), ‘sign’]=1

4）数据分列

与数据分组相反的是对数值进行分列，Excel 中的数据目录下提供”分列”功能。在 python 中使用 split 函数实现分列。

在数据表中 category 列中的数据包含有两个信息，前面的数字为类别 id，后面的字母为 size 值。中间以连字符进行连接。我们使用 split 函数对这个字段进行拆分，并将拆分后的数据表匹配回原数据表中。

1 #对 category 字段的值依次进行分列，并创建数据表，索引值为 df_inner 的索引列，列名称为 category 和 size

2 pd.DataFrame((x.split(‘-‘) for x in df_inner[‘category’]),index

=df_inner.index,columns=[‘category’,’size’])

1#将完成分列后的数据表与原 df_inner 数据表进行匹配

2df_inner=pd.merge(df_inner,split,right_index=True, left_index=True)

2、数据提取

第五部分是数据提取，也是数据分析中最常见的一个工作。这部分主要使用三个函数，loc，iloc 和 ix，loc 函数按标签值进行提取，iloc 按位置进行提取，ix 可以同时按标签和位置进行提取。下面介绍每一种函数的使用方法。

1）按标签提取(loc)

Loc 函数按数据表的索引标签进行提取，下面的代码中提取了索引列为 3 的单条数据。

1#按索引提取单行的数值

2df_inner.loc[3]3id 10044date 2013-01-05 00:00:005city shenzhen6category 110-C7age 328price 54339gender female10m-point 4011pay Y12group high13sign NaN14category_1 11015size C16Name: 3, dtype: object

使用冒号可以限定提取数据的范围，冒号前面为开始的标签值，后面为结束的标签值。下面提取了 0 到 5 的数据行。

1#按索引提取区域行数值

2df_inner.loc[0:5]

Reset_index 函数用于恢复索引，这里我们重新将 date 字段的日期设置为数据表的索引，并按日期进行数据提取。

1#重设索引

2df_inner.reset_index()

1#设置日期为索引

2df_inner=df_inner.set_index(‘date’)

使用冒号限定提取数据的范围，冒号前面为空表示从 0 开始。提取所有 2013 年 1 月 4 日以前的数据。

1#提取 4 日之前的所有数据

2df_inner[:’2013-01-04′]

2）按位置提取(iloc)

使用 iloc 函数按位置对数据表中的数据进行提取，这里冒号前后的数字不再是索引的标签名称，而是数据所在的位置，从 0 开始。

1#使用 iloc 按位置区域提取数据

2df_inner.iloc[:3,:2]

iloc 函数除了可以按区域提取数据，还可以按位置逐条提取，前面方括号中的 0,2,5 表示数据所在行的位置，后面方括号中的数表示所在列的位置。

1#使用 iloc 按位置单独提取数据

2df_inner.iloc[[0,2,5],[4,5]]

3）按标签和位置提取（ix）

ix 是 loc 和 iloc 的混合，既能按索引标签提取，也能按位置进行数据提取。下面代码中行的位置按索引日期设置，列按位置设置。

1#使用 ix 按索引标签和位置混合提取数据

2df_inner.ix[:’2013-01-03′,:4]

4）按条件提取（区域和条件值）

除了按标签和位置提起数据以外，还可以按具体的条件进行数据。下面使用 loc 和 isin 两个函数配合使用，按指定条件对数据进行提取。

使用 isin 函数对 city 中的值是否为 beijing 进行判断。

1 #判断 city 列的值是否为 beijing

2 df_inner[‘city’].isin([‘beijing’])

4 date

5 2013-01-02 True

6 2013-01-05 False

7 2013-01-07 True

8 2013-01-06 False

9 2013-01-03 False

10 2013-01-04 False

11 Name: city, dtype: bool

将 isin 函数嵌套到 loc 的数据提取函数中，将判断结果为 Ture 数据提取出来。这里我们把判断条件改为 city 值是否为 beijing 和 shanghai。如果是就把这条数据提取出来。

1#先判断 city 列里是否包含 beijing 和 shanghai，然后将复合条件的数据提取出来。

2df_inner.loc[df_inner[‘city’].isin([‘beijing’,’shanghai’])]

5）按筛选条件提取

数值提取还可以完成类似数据分列的工作，从合并的数值中提取出制定的数值。

1 category=df_inner[‘category’]

2 0 100-A

3 3 110-C

4 5 130-F

5 4 210-A

6 1 100-B

7 2 110-A

8 Name: category, dtype: object

10 #提取前三个字符，并生成数据表

11pd.DataFrame(category.str[:3])

文章来源：网络版权归原作者所有

上文内容不用于商业目的，如涉及知识产权问题，请权利人联系小编，我们将立即处理

Original: https://blog.csdn.net/xuezhangmen/article/details/119776297
Author: 学掌门
Title: 用Python做数据分析之数据处理及数据提取

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/754858/

转载文章受原作者版权保护。转载请注明原作者出处！

python

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

python模块打包上传pypi-演示pytest hook函数二次开发

python模块打包上传pypi pytest hook函数二次开发修改默认编码显示中文用例名称官方文档 : https://packaging.python.org/en/…

Python 2023年9月12日
0048
【Web开发】Python实现Web服务器（Flask入门）

🍺Web服务器系列相关文章编写如下🍺： 🎈【Web开发】Node.js实现Web服务器（http模块）🎈 🎈【Web开发】Node.js实现Web服务器（express模块）🎈 🎈…

Python 2023年8月9日
0077
Scrapy了解

Scrapy简介 Scrapy是适用于Python的一个快速、高层次的屏幕抓取和web抓取框架，用于抓取web站点并从页面中提取结构化的数据。 1 Scrapy Engine（Sc…

Python 2023年10月6日
0036
django.core.exceptions.ImproperlyConfigured: Requested setting CACHES, but settings are not configured. You must either define the environment variable DJANGO_SETTINGS_MODULE or call settings

django.core.exceptions.ImproperlyConfigured: Requested setting CACHES, but settings are no…

Python 2023年6月10日
0064
python第三方库02：NumPy基础及取值操作

文章目录前言一、NumPy是什么？二、使用步骤 * 1.引入库 2.什么是ndarray对象 3.如何实例化ndarray对象 – 3.1列表实例化 3.2zer…

Python 2023年8月27日
0049
conda 下安装jupyter notebook

conda 下安装jupyter notebook 上一篇因为要安装tensorflow，所以anaconda 安装的是mini 版的，mini版大部分功能都是没有的，相当于装了一…

Python 2023年9月8日
0047
pytest如何执行用例及常见code含义（二）

有两种运行方式，这里要再强调一下，测试的方法必须是test_开头，文件名字是test_.py or _test.py第一种方式，Windows系统通过DOS框，输入命令进入到文件所…

Python 2023年9月12日
0031
学Python爬虫，不看看m3u8文件如何加密？i春秋 m3u8 文件加密解析

⛳️ 实战场景本次实战目标站点为 https://www.ichunqiu.com/courses/qmxc，随机寻找一门课程点击播放，然后通过开发者工具获取视频文件地址。这次…

Python 2023年5月24日
0054
【Django | 安全防护】防止XSS跨站脚本攻击

🤵‍♂️ 个人主页: @计算机魔术师 👨‍💻 作者简介：CSDN内容合伙人，全栈领域优质创作者。 🌐 推荐一款找工作神器网站: 牛客网🎉🎉|笔试题库|面试经验|实习招聘内推 …

Python 2023年5月24日
0066
建议收藏！献给Python初学者的22个入门小项目，练手必备！

Python的各种第三方库，能够完成很多好玩的操作，给大家展现几个Python实现的小玩意，看看大家都做过没~您还可以根据项目的目的和提示构建自己的解决方案，并在评论区进行交流。 …

Python 2023年5月25日
00111
pytest的mark使用

@pytest.mark标签使用 1. @pytest.mark.skip(reason=”)跳过运行 @pytest.mark.skip(reason="r…

Python 2023年9月13日
0044
如何做架构设计？

目录 1、设计很重要 2、架构设计的目的是什么？ 3、架构设计的主要内容是什么？ 4、架构设计有什么原则？ 5、架构师的职责是什么？ 6、架构设计过程如何？全局分析阶段设计方案…

Python 2023年10月1日
0052
JS新年倒计时

✅作者简介：热爱国学的Java后端开发者，修心和技术同步精进。🍎个人主页：Java Fans的博客🍊个人信条：不迁怒，不贰过。小知识，大智慧。💞当前专栏：前端案例分享专栏✨特色专栏…

Python 2023年10月7日
0043
图像灰度化处理

文章目录 1. 图像灰度化 2. 图像灰度化处理方法 * 2.1 最大值法 2.2 平均值法 2.3 加权平均法 3. 图像灰度化处理方法的Python实现 * 3.1 最大值法 …

Python 2023年8月2日
0065
conda命令行常用操作

conda命令行常用操作 1 conda介绍 * 1.1 查看版本 2.1 更新到当前版本 3.1 查看某个命令帮助文档 2 环境 (environment) * 2. 1 查看所…

Python 2023年9月9日
0049
简单的list拆分及文本重组写为Dataframe

import re import csv import pandas as pd data=pd.read_csv(‘/root/divination.csv&#821…

Python 2023年8月9日
0029

2024 年 4 月
一	二	三	四	五	六	日
1	2	3	4	5	6	7
8	9	10	11	12	13	14
15	16	17	18	19	20	21
22	23	24	25	26	27	28
29	30

用Python做数据分析之数据处理及数据提取

大家都在看