基于python实现TF-IDF算法

2023年5月28日上午6:51 • 人工智能 • 阅读 97

标签：2021.09.27工作内容
参考资料：TF-IDF算法介绍及实现
声明：本文中大量内容转载至参考资料，仅归纳整理和加入部分个人观点心得，侵删

概念

定义
TF-IDF(term frequency-inverse document frequency)是一种用于信息检索与数据挖掘的常用加权技术，常用于挖掘文章中的关键词。
特点：简单高效，用于最开始的文本数据清洗。
TF-IDF
（1）TF：词频
可以统计到停用词，并把它们过滤，避免对结果造成影响。
e.g.：”的”、”了”、”是”等等
（2）IDF：逆文档频率
在词的频率相同时，不同词的重要性却不同。IDF会给常见的词较小的权重。
e.g.：假设”量化”和”系统”的词频相同，则重要性：”量化” > “系统”
实现方法
当有TF和IDF后，将其相乘，能够得到一个词的TF-IDF的值。某个词在文章中的TF-IDF越大，那么它在文章中的重要性越高。

算法步骤

计算词频
词频 = 某个词在文章中出现的次数 / 文章的总次数
计算逆文档的频率
需要一个语料库（corpus）来模拟语言的使用环境。
逆文档频率 = log(语料库的文档总数 / (包含该词的文档数 + 1))
计算TF-IDF
TF-IDF= TF × IDF
与一个词在文档中出现的次数成正比。
与该词在整个语言中出现的次数成反比。

优缺点

优点
简单高效，容易理解。
缺点
（1）词频衡量此的重要性不够全面，有时重要的词出现得不多
（2）无法体现位置信息=>无法体现该词在上下文中的重要性=>用word2vec算法来支持

python实现TF-IDF算法

自己构建语料库
这个例子比较特殊，dataset既是语料库，可是我们要统计核心词的对象。


from collections import defaultdict
import math
import operator

"""
函数说明:创建数据样本
Returns:
    dataset - 实验样本切分的词条
    classVec - 类别标签向量
"""

def loadDataSet():
    dataset = [['my', 'dog', 'has', 'flea', 'problems', 'help', 'please'],
               ['maybe', 'not', 'take', 'him', 'to', 'dog', 'park', 'stupid'],
               ['my', 'dalmation', 'is', 'so', 'cute', 'I', 'love', 'my'],
               ['stop', 'posting', 'stupid', 'worthless', 'garbage'],
               ['mr', 'licks', 'ate', 'my', 'steak', 'how', 'to', 'stop', 'him'],
               ['quit', 'buying', 'worthless', 'dog', 'food', 'stupid']]
    classVec = [0, 1, 0, 1, 0, 1]
    return dataset, classVec

"""
函数说明：特征选择TF-IDF算法
Parameters:
     list_words:词列表
Returns:
     dict_feature_select:特征选择词字典
"""

def feature_select(dataset):

    doc_frequency = defaultdict(int)
    for file in dataset:
        for word in file:
            doc_frequency[word] += 1

    word_tf = {}
    for i in doc_frequency:
        word_tf[i] = doc_frequency[i] / sum(doc_frequency.values())

    doc_num = len(dataset)
    word_idf = {}
    word_doc = defaultdict(int)
    for word in doc_frequency:
        for file in dataset:
            if word in file:
                word_doc[word] += 1

    for word in doc_frequency:
        word_idf[word] = math.log(doc_num / (word_doc[word] + 1))

    word_tf_idf = {}
    for word in doc_frequency:
        word_tf_idf[word] = word_tf[word] * word_idf[word]

    dict_feature_select = sorted(word_tf_idf.items(), key=operator.itemgetter(1), reverse=True)
    return dict_feature_select

if __name__ == '__main__':
    data_list, label_list = loadDataSet()
    features = feature_select(data_list)
    print(features)

运算结果：

2. NLTK实现TF-IDF算法
由于我的电脑安装了本地代理所以不能下载nltk的语料库，这里只贴代码供大家参考

from nltk.text import TextCollection
from nltk.tokenize import word_tokenize

sents=['this is sentence one','this is sentence two','this is sentence three']
sents=[word_tokenize(sent) for sent in sents]
print(sents)
corpus=TextCollection(sents)
print(corpus)

tf=corpus.tf('one',corpus)
print(tf)

idf=corpus.idf('one')
print(idf)

tf_idf=corpus.tf_idf('one',corpus)
print(tf_idf)

利用sklearn做tf-idf

import sklearn
from sklearn.feature_extraction.text import CountVectorizer
from sklearn.feature_extraction.text import TfidfTransformer

x_train = ['TF-IDF 主要 思想 是', '算法 一个 重要 特点 可以 脱离 语料库 背景',
           '如果 一个 网页 被 很多 其他 网页 链接 说明 网页 重要']
x_test = ['原始 文本 进行 标记', '主要 思想']

vectorizer = CountVectorizer(max_features=10)

tf_idf_transformer = TfidfTransformer()

tf_idf = tf_idf_transformer.fit_transform(vectorizer.fit_transform(x_train))

x_train_weight = tf_idf.toarray()

tf_idf = tf_idf_transformer.transform(vectorizer.transform(x_test))
x_test_weight = tf_idf.toarray()

print('vectorizer.fit_transform(x_train) : ')
print(vectorizer.fit_transform(x_train))
print('输出x_train文本向量：')
print(x_train_weight)
print('输出x_test文本向量：')
print(x_test_weight)

4. 利用Jieba实现tf-idf

import jieba.analyse

text='关键词是能够表达文档中心内容的词语，常用于计算机系统标引论文内容特征、
信息检索、系统汇集以供读者检阅。关键词提取是文本挖掘领域的一个分支，是文本检索、
文档比较、摘要生成、文档分类和聚类等文本挖掘研究的基础性工作'

keywords=jieba.analyse.extract_tags(text, topK=5, withWeight=False, allowPOS=())
print(keywords)

注：

jieba.analyse.extract_tags(sentence, topK=20, withWeight=False, allowPOS=())
sentence 为待提取的文本
topK 为返回几个 TF/IDF 权重最大的关键词，默认值为 20
withWeight 为是否一并返回关键词权重值，默认值为 False
allowPOS 仅包括指定词性的词，默认值为空，即不筛选

运行结果：

（安装不了就pip install jieba; conda install jieba; pip3 install jieba;都尝试一边，我用pip3安装才成功的，如果还不成功可以去jieba官网手动下载后自行配置到anaconda环境）

Original: https://blog.csdn.net/Daisy_Wang777/article/details/120510366
Author: 芊欣欲
Title: 基于python实现TF-IDF算法

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/530295/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

【python数据分析】数据的分组，遍历，统计

数据的分组，遍历，统计俗话说：”人与类聚，物以群分”，到这里我们将学习数据的分组以及分组后统计。Pandas的分组相对于Excel会更加简单和灵活。 1️…

人工智能 2023年6月19日
0077
学习pytorch—-torch、torchvision库的安装

pytorch学习第一课：装torch、torchvision库常规操作：pip install torch、pip install torchvision torchvisio…

人工智能 2023年7月22日
00192
Bert的文本编码tokenizer、分隔符(MASK/CLS/SEP)编码

1.文本编码 bert模型的输入是文本，需要将其编码为模型计算机语言能识别的编码。这里将文本根据词典编码为数字，称之为token embedding；当输入的是两句话时，用SEP标…

人工智能 2023年5月27日
0095
EfficientNetV1简述（图像分类篇）

文章是对博主视频讲解的一些总结。博主链接：https://blog.csdn.net/qq_37541097?spm=1001.2014.3001.5509原论文地址：https:…

人工智能 2023年7月3日
0035
利用Word2Vec在语料中构建种子词集同类词

nlp小白努力探索的第n天…… 今天记录和分享利用gensim.model.word2vec.Word2Vec在语料中构建种子词集同类词先说明任务情况： …

人工智能 2023年5月27日
0075
最强人工智能 OpenAI 极简教程

啊哦~你想找的内容离你而去了哦内容不存在，可能为如下原因导致： ① 内容还在审核中 ② 内容以前存在，但是由于不符合新的规定而被删除 ③ 内容地址错误 ④ 作者删除了内容。可…

人工智能 2023年6月23日
0064
【机器学习】二分类问题中的混淆矩阵、准确率、召回率等 (Python代码实现)

文章目录混淆矩阵召回率与准确率准确度Accuracy sklearn代码示例混淆矩阵混淆矩阵（Confusion Matrix）：将分类问题按照真实情况与判别情况两个维度…

人工智能 2023年6月15日
0076
TDEER: An Efficient Translating Decoding Schema for Joint Extraction of Entities and Relations 论文笔记

TDEER: An Efficient Translating Decoding Schema for Joint Extraction of Entities and Relat…

人工智能 2023年5月28日
0080
如何评估回归算法的性能

问题描述评估回归算法的性能是机器学习任务中的关键步骤。在这里，我们将详细介绍如何评估回归算法的性能并提供相应的算法原理、公式推导、计算步骤和复杂的Python代码示例。算法原理…

人工智能 2023年12月31日
0041
【TS】基础类型

在ts中定义基础类型，语法： let 变量名：数据类型 = 值 let flag : boolean = true flag = false 在赋值的时候，不能赋值定义外的…

人工智能 2023年6月30日
0067
AAAI 2022 论文列表

链接及代码之后会更新 Scaled ReLU Matters for Training Vision TransformersPichao Wang, Xue Wang, Hao …

人工智能 2023年5月26日
0096
谐云课堂 | 浅谈智能语音技术在双录质检中的应用

01 双录质检场景介绍什么是双录？ “双录”是指对银行销售的每笔理财产品的过程进行录音和录像。双录的意义通过双录，可以实现对金融产品和代销的监管不存在真…

人工智能 2023年5月25日
0064
Pandas处理JSON文件read_json()一文详解+代码展示

抵扣说明： 1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。2.余额无法直接购买下载，可以购买VIP、C币套餐、付费专栏及课程。 Original: https:…

人工智能 2023年7月15日
0060
对象的比较（上）PriorityQueue中的底层源码解析

作者：~小明学编程文章专栏：Java数据结构格言：目之所及皆为回忆，心之所想皆为过往目录问题引入 offer() 扩容构造方法 grow() siftUp() siftUpC…

人工智能 2023年6月27日
0057
驾驶员嗜睡分类 – 深度学习

瞌睡检测是一种汽车安全技术，有助于防止驾驶员在驾驶时睡着了造成的事故。根据 NHTSA（美国国家公路交通安全管理局）的数据，警方报告的 91,000 起车祸涉及疲劳驾驶。这些车祸导…

人工智能 2023年7月1日
0055
双目立体视觉摄像头的标定、矫正、世界坐标计算（opencv）

使用opencv对双目立体视觉摄像头进行标定和矫正摄像头标定准备工作摄像头标定摄像头矫正世界坐标计算摄像头标定准备工作使用双目摄像头拍摄贴有棋盘格的平面，拍摄多组图片，…

人工智能 2023年6月18日
0075

2024 年 4 月
一	二	三	四	五	六	日
1	2	3	4	5	6	7
8	9	10	11	12	13	14
15	16	17	18	19	20	21
22	23	24	25	26	27	28
29	30

基于python实现TF-IDF算法

概念

算法步骤

优缺点

python实现TF-IDF算法

大家都在看