特征工程（二）TfidfVectorizer - 代码天地

特征工程（二）TfidfVectorizer

其他 2018-09-24 05:17:25 阅读次数: 0


'''
将原始数据的word特征数字化为tfidf特征，并将结果保存到本地

article特征可做类似处理

'''
import pandas as pd
from sklearn.feature_extraction.text import TfidfVectorizer
import pickle
import time

t_start = time.time()

"""=====================================================================================================================
1 数据预处理
"""
df_train = pd.read_csv('train_set.csv')
df_test = pd.read_csv('test_set.csv')

df_train.drop(columns='article', inplace=True)   #article  word_seg
df_test.drop(columns='article', inplace=True)

df_all = pd.concat(objs=[df_train, df_test], axis=0, sort=True)
y_train = (df_train['class'] - 1).values  # 算法的分类预测结果是从0开始的，所以训练集的分类标签也要从0开始

"""=====================================================================================================================
2 特征工程
"""
vectorizer = TfidfVectorizer(ngram_range=(1, 2), min_df=3, max_df=0.9, sublinear_tf=True)
vectorizer.fit(df_all['word_seg'])
x_train = vectorizer.transform(df_train['word_seg'])
x_test = vectorizer.transform(df_test['word_seg'])

"""=====================================================================================================================
3 保存至本地
"""
data = (x_train, y_train, x_test)
with open('tfidf_word.pkl', 'wb') as f:
	pickle.dump(data, f)

t_end = time.time()
print("共耗时：{}min".format((t_end-t_start)/60))

猜你喜欢

转载自blog.csdn.net/Datawhale/article/details/82824156

特征工程（二）TfidfVectorizer

文本特征抽取TfidfVectorizer(特征工程之特征提取)

【机器学习】特征工程 - 文本特征提取TfidfVectorizer

CountVectorizer与TfidfVectorizer 对文本特征的特征抽取

特征工程二：特征抽象、特征衍生

python学习文本特征提取(二) CountVectorizer TfidfVectorizer 中文处理

特征工程二

特征工程之特征选择（二）

数据挖掘（二）---特征工程

机器学习之路：python 文本特征提取 CountVectorizer, TfidfVectorizer

4.2 文本特征抽取的两种方式CountVectorizer与TfidfVectorizer

机器学习入门（二）：特征工程——特征抽取

特征工程之N-Gram（二）

任务二：Titanic-特征工程

评分卡系列（二）：特征工程

洞见趋势系列(二)特征工程

Python scikit-learn，数据的特征抽取，特征值化，DictVectorizer，CountVectorizer，TfidfVectorizer

特征工程

特征工程——特征转换

特征工程-特征选择

特征工程-特征处理

特征工程的特征选择

【特征工程】特征选择

特征工程_特征理解

特征工程-特征分箱

特征工程：数值特征

特征工程（4）-数据预处理二值化

sklearn的快速使用之二（特征工程）

数据分析基本技巧总结-特征工程（二）

二手车数据挖掘- 特征工程

今日推荐

周排行

Leetcode简单题61~80

解决zookeeper磁盘IO高的问题

多线程相关方法详解

Maven-setting.xml文件详解

Maven 项目的 classpath 理解

渊亭科技大数据笔试题

配置JVM内存分配

计算机网络个人学习笔记（三）网络层：第三部分连载

js中两个等号(==)和三个等号(===)的区别

用C程序自动打开电脑上的程序

每日归档

更多

2024-09-18(0)

2024-09-17(0)

2024-09-16(0)

2024-09-15(0)

2024-09-14(0)

2024-09-13(0)

2024-09-12(0)

2024-09-11(0)

2024-09-10(0)

2024-09-09(0)