机器学习-中文文本特征抽取

对字符串列表 data = ['发表回复这件事', '飞机里面飞一杯飞机专属奶茶', '没有什么比在飞机上喝一杯飞机专属的飞机奶茶要更好了'] 进行中文文本特征抽取import sklearn.feature_extraction.text as textimport jiebatransfer = text.CountVectorizer(stop_words=['vb'])def count_

我有辣条你跟不跟我走_

265人浏览 · 2021-10-21 17:36:57

我有辣条你跟不跟我走_ · 2021-10-21 17:36:57 发布

对字符串列表 data = ['发表回复这件事', '飞机里面飞一杯飞机专属奶茶', '没有什么比在飞机上喝一杯飞机专属的飞机奶茶要更好了'] 进行中文文本特征抽取

import sklearn.feature_extraction.text as text
import jieba


transfer = text.CountVectorizer(stop_words=['vb'])


def count_chinese_demo2():
    data = ['发表回复这件事', '飞机里面飞一杯飞机专属奶茶', '没有什么比在飞机上喝一杯飞机专属的飞机奶茶要更好了']
    data_new = []
    # 中文文本分词
    for send in data:
        data_new.append(' '.join(list(jieba.cut(send))))
    print(data_new)

    # 文本特征提取
    data_final = transfer.fit_transform(data_new)
    print(data_final.toarray())
    print(transfer.get_feature_names())


if __name__ == "__main__":
    count_chinese_demo2()

输出：

['发表回复这件事', '飞机里面飞一杯飞机专属奶茶', '没有什么比在飞机上喝一杯飞机专属的飞机奶茶要更好了']
[[0 0 0 1 0 1 0 0 0 1 0 0]
[1 1 0 0 0 0 1 0 0 0 1 2]
[0 1 1 0 1 0 1 1 1 0 0 3]]
['一杯', '专属', '什么', '发表', '喝一杯', '回复', '奶茶', '更好', '没有', '这件', '里面', '飞机']

技术共进，成长同行——讯飞AI开发者社区

更多推荐

Agentic AI应用架构师，攻克AI应用架构的关键挑战

Agentic AI（智能体式AI）是下一代人工智能系统的核心形态——它打破了传统AI“输入-输出”的被动模式，通过自主感知、目标规划、工具交互、持续学习实现主动决策。认知建模的复杂度（如何让智能体“像人一样思考”）、系统协同的不确定性（多智能体如何高效协作）、鲁棒性与伦理的边界（如何避免失控或偏见）。本文从架构师视角出发，结合第一性原理分析与工业级实践。