【原创好文】当机器学习遇到数据量不够时，这几个Python技巧为你化解难题

2023年7月16日下午3:48 • 人工智能 • 阅读 50

有时候我们在进行模型的训练与优化的时候，是需要基于现有的数据集来操作的，要是数据量比较充足的情况下倒是还好说，但是要是遇到数据量不够的情况，该怎么办呢？今天小编就给大家来介绍几个方法来处理这种情况。

`Faker` 模块

Python当中的 Faker模块主要是用来生成伪数据，包括了城市、姓名等等，并且还支持中文，在开始使用该模块之前我们先用 pip命令来下载安装完成

pip install faker

我们先随机地生成一些中文数据，代码如下

from faker import Faker
fake = Faker(locale='zh_CN')
## 随机生成一个城市
print(fake.city())
## 随机生成一个地址
print(fake.address())

output

柳州市
吉林省兴安盟县华龙任街P座 540041

要是我们想要生成其他语言或者地区表示的数据，只需要传入相对应的地区值，这里例举几个常用的，代码如下

fr_FR - French
es_ES - Spanish (Spain)
en_US - English (United States)
de_DE - German
ja_JP - Japanese
ko_KR - Korean
zh_CN - Chinese (China Mainland)
zh_TW - Chinese (China Taiwan)

我们可以看到填入的值的模式基本上是语种的缩写加上”_”再加上地区的缩写。

除了可以随机生成例如城市名称以及地址之外等模拟数据，还有很多其他方法可用，这些方法分为以下几类

address: 地址
person：人物类：性别、姓名等等
color: 颜色类
currency：货币
phone_number：手机号码类
等等

具体使用的方法大家可以参考其官网，链接是：faker.readthedocs.io/en/master/providers.html

SDV

另外我们也可以通过机器学习算法在基于真实数据的基础上生成合成数据，将后者应用于模型的训练上，例如由MIT的DAI(Data to AI)实验室推出的合成数据开源系统—-Synthetic Data Vault(SDV)，该模块可以从真实数据库中构建一个机器学习模型来捕获多个变量之间的相关性，要是原始的数据库中存在着一些缺失值和一些极值，最后在合成的数据集当中也会有一些缺失值与极值。

而测试表明，合成的数据能够较好地取代真实数据。接下来我们来看一下如何使用吧，首先我们先下载该模块

pip install sdv

我们会用到如下的数据集，

import pandas as pd
data = pd.read_csv('data.csv')
data.head()

output

接下来的步骤和我们使用 sklearn模块时的步骤是类似的，代码如下

from sdv.tabular import GaussianCopula
model = GaussianCopula()
model.fit(data)

无非就是实例化具体的模型，然后将算法模型拟合到数据集中的数据，我们可以尝试生成一些数据

sample = model.sample(200)
sample.head()

output

最后我们想要来评估一下模型的性能，看一下新生成的数据和真实数据相比相似性几何，代码如下

from sdv.evaluation import evaluate
print(evaluate(sample, data))

output

0.533

相似性的指标范围是”0-1″,”0″意味着是 最差的结果，而”1″意味着是 最理想的结果，而针对以上评估出来的结果意味着我们后续还需要进一步的参数调优。

CTGAN

随着相关研究的进一步深入，2019年在温哥华举行的第33届神经信息处理系统会议上，另外的研究员提出了新的神经网络Conditional Tabular Generative Adversarial Networks，简称CTGAN，简而言之就是通过生成对抗网络GAN来建立和完善合成的数据表。

对于生成对抗的神经网络GANs而言，其中第一个网络为 生成器，而第二个网络为 鉴别器，最后生成器产生出来的数据表并没有被鉴别器分辨出其中的差异。接下来我们来看一下其中的步骤。

import pandas as pd
## 这边用到了和前面不一样的数据集
data = pd.read_csv('train.csv')
data.head()

output

针对离散型的特征变量，CTGAN模型也可以合成类似的数据，代码如下

discrete_columns = ['week',
                    'Center_id',
                    'Meal_id',
                    'Emailer_for_promotion',
                    'homepage_featured']
ctgan = CTGANSynthesizer(batch_size=50,epochs=5,verbose=False)
ctgan.fit(data,discrete_columns)
## 将训练好的模型保存下来
ctgan.save('ctgan-food-demand.pkl')
## 生成200条数据集
samples = ctgan.sample(200)
samples.head()

output

我们罗列出需要最后合成来依照的特征变量，上面的例子当中是罗列出了一系列的离散型特征变量，然后我们设定好 batch_size、 epochs以及 verbose参数进行训练，最后我们还是通过相类似的方法来评估模型的性能

from sdv.evaluation import evaluate
evaluate(new_data, data)

总结

本文主要是立足于在机器学习的过程中存在数据量不足的情况，介绍了 Faker模块和 SDV模块，以及 CTGAN模型，通过机器学习和深度学习等手段来生成一些数据供数据科学家使用。因为这些模型也是近年来刚出来属于较为前沿的内容，小编在对其进行表述的时候存在理解有偏差的情况，这里也是建议读者多去上网进行查阅。

NO. 1

往期推荐

Historical articles

分享、收藏、点赞、在看安排一下？

Original: https://blog.csdn.net/weixin_43373042/article/details/124162162
Author: 欣一2002
Title: 【原创好文】当机器学习遇到数据量不够时，这几个Python技巧为你化解难题

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/696711/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

基于word2vec的word相似度

随着人工智能的不断发展，自然语言这门技术也越来越重要，很多人都开启了学习自然语言，本文就介绍了基于word2vec的word相似度。 word2vec是指将文本数据处理成计算机可以…

人工智能 2023年5月27日
0081
一个极简的Http请求client推荐，一行搞玩外部请求

在Java的世界中，Http客户端之前一直是Apache家的HttpClient占据主导，但是由于此包较为庞大，API又比较难用，因此并不使用很多场景。而新兴的OkHttp、Jod…

人工智能 2023年6月26日
0067
多元回归是一种回归算法，用于预测多个相关输出变量之间的关系。它将多个输入特征与多个输出变量之间的关系建模为多元线性方程

详细解决多元回归问题介绍多元回归是一种回归算法，用于预测多个相关输出变量之间的关系。它将多个输入特征与多个输出变量之间的关系建模为多元线性方程的问题。算法原理多元回归基于线…

人工智能 2023年12月31日
0035
QT-Linux安装

1、在虚拟机+Ubuntu的环境安装好之后，详细看： QT Linux环境搭建——VM虚拟机和Ubuntu的安装_sgmcy的博客-CSDN博客下面就可以直接安装linux环境下…

人工智能 2023年7月29日
0058
双目深度算法——基于Cost Volume的方法（GC-Net / PSM-Net / GA-Net）

双目深度算法——基于Cost Volume的方法（GC-Net / PSM-Net / GA-Net）双目深度算法——基于Cost Volume的方法（GC-Net / PSM-…

人工智能 2023年5月26日
0061
.torch.save与torch.jit.save

1.torch.jit.save torch.jit.save用来保存编译后的模型，支持跨平台，要注意模型中只能使用pytorch的函数。 jit.save支持保存script类型…

人工智能 2023年7月22日
0037
Pytorch学习（九）Pytorch中CPU和GPU的Tensor转换，Tensor和ndarray的转换及.cuda(non_blocking=True)的作用

1. 设置训练模型的GPU设备的方式 device = torch.device("cuda:1" ) model = model.to(device) 2. …

人工智能 2023年7月22日
0055
深度学习笔记_Keras六步法搭建网络

深度学习笔记_Keras六步法搭建网络 Keras六步法搭建网络，以MNIST数据集为例 * 一、import加载库二、设置训练集、测试集三、搭建神经网络四、配置神经网络五…

人工智能 2023年5月26日
00103
聚类算法(Clustering Algorithms)之层次聚类(Hierarchical Clustering)

在之前的系列中，大部分都是关于监督学习（除了PCA那一节），接下来的几篇主要分享一下关于非监督学习中的聚类算法（clustering algorithms）。一、先了解一下聚类分…

人工智能 2023年5月31日
0086
实验八项目案例-电商数据分析

任务描述本关任务：根据用户行为数据，编写 MapReduce 程序来统计出用户流失情况。相关知识本实训为中级难度的 MapReduce 程序设计练习，模拟真实场景中电商数据的…

人工智能 2023年7月15日
0056
三行代码实现python链接数据库操作

[ Python_参考手册(第4版) 第一部分 _Python_语言第1章 _Python_简介 2 1.1 运行 _Python 2 1.2 变量和算术表达式 3 1.3 条件…

人工智能 2023年7月8日
0081
调用讯飞平台应用商店技能完成人机交互功能（二）

主程序可以实现人机交互的功能。 [En] The main program can realize the function of human-computer interacti…

人工智能 2023年5月25日
0074
pytorch 神经网络套路实现多维输入特征的二分类

1.数据集：传送门：内含刘老师讲课视频PPT及相关数据集，本文所用数据集名为diabetes.cvs.gz 链接：https://pan.baidu.com/s/1vZ27gKp…

人工智能 2023年7月13日
0058
vue自适应布局（各种浏览器，分辨率）

1.前言 spa页面的layout布局对于前端项目的影响至关重要，在我们进行web端开发的时候，前端的各种大小屏幕，各种内核的浏览器不同，会导致我们的页面呈现出不一样的效果，如何进…

人工智能 2023年6月2日
0072
组织创新丨传统企业敏捷变革的组织基础

在传统组织管理中，平衡思维是一个很常见的理念。但当变革来临，组织要求变得更为敏捷时，对平衡的追求就成为最大的障碍。耗散理论与自组织理论告诉我们，系统应该保持开放、保持不平衡、并且持…

人工智能 2023年6月4日
00107
DAB-DETR深入理解

论文链接：https://arxiv.org/abs/2201.12329 最大的贡献是把DETR的Object Query定义为可学习的 Anchor Anchor-based…

人工智能 2023年6月16日
0097

2024 年 5 月
一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31

【原创好文】当机器学习遇到数据量不够时，这几个Python技巧为你化解难题

Faker 模块

SDV

CTGAN

总结

大家都在看

`Faker` 模块