文章详情

短信预约-IT技能 免费直播动态提醒

请输入下面的图形验证码

提交验证

短信预约提醒成功

如何进行Python pandas两个表格内容模糊匹配的实现

2023-06-25 14:55

关注

如何进行Python pandas两个表格内容模糊匹配的实现,很多新手对此不是很清楚,为了帮助大家解决这个难题,下面小编将为大家详细讲解,有这方面需求的人可以来学习下,希望你能有所收获。

一、方法2

此方法是两个表构建某一相同字段,然后全连接,在做匹配结果筛选,此方法针对数据量不大的时候,逻辑比较简单,但是内存消耗较大

1. 导入库

import pandas as pdimport numpy as npimport re

2. 构建关键词

#关键词数据df_keyword = pd.DataFrame({    "keyid" : np.arange(5),    "keyword" : ["numpy", "pandas", "matplotlib", "sklearn", "tensorflow"]})df_keyword

如何进行Python pandas两个表格内容模糊匹配的实现

3. 构建句子

df_sentence = pd.DataFrame({    "senid" : np.arange(10,17),    "sentence" : [        "怎样用pandas实现merge?",        "Python之Numpy详细教程",        "怎么使用Pandas批量拆分与合并Excel文件?",        "怎样使用pandas的map和apply函数?",        "深度学习之tensorflow简介",        "tensorflow和numpy的关系",        "基于sklearn的一些机器学习的代码"    ]})df_sentence

如何进行Python pandas两个表格内容模糊匹配的实现 

4. 建立统一索引

df_keyword['match'] = 1df_sentence['match'] = 1

5. 表连接

df_merge = pd.merge(df_keyword, df_sentence)df_merge

如何进行Python pandas两个表格内容模糊匹配的实现

6. 关键词匹配

def match_func(row):    return re.search(row["keyword"], row["sentence"], re.IGNORECASE) is not Nonedf_merge[df_merge.apply(match_func, axis = 1)]

匹配结果如下 

如何进行Python pandas两个表格内容模糊匹配的实现

二、方法2

此方法对编程能力有要求,在大数据集上计算量较方法一小很多

1. 构建字典

key_word_dict = {    row.keyword : row.keyid    for row in df_keyword.itertuples()}key_word_dict
{'numpy': 0, 'pandas': 1, 'matplotlib': 2, 'sklearn': 3, 'tensorflow': 4}

2. 关键词匹配

def merge_func(row):    #新增一列,表示可以匹配的keyid    row["keyids"] = [        keyid        for key_word, keyid in key_word_dict.items()        if re.search(key_word, row["sentence"], re.IGNORECASE)    ]    return rowdf_merge = df_sentence.apply(merge_func, axis = 1)

3. 结果展示

df_merge

如何进行Python pandas两个表格内容模糊匹配的实现

4. 匹配结果展开

df_result = pd.merge(left = df_merge.explode("keyids"),right = df_keyword,left_on = "keyids",right_on = "keyid")df_result

如何进行Python pandas两个表格内容模糊匹配的实现

看完上述内容是否对您有帮助呢?如果还想对相关知识有进一步的了解或阅读更多相关文章,请关注编程网行业资讯频道,感谢您对编程网的支持。

阅读原文内容投诉

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

软考中级精品资料免费领

  • 历年真题答案解析
  • 备考技巧名师总结
  • 高频考点精准押题
  • 2024年上半年信息系统项目管理师第二批次真题及答案解析(完整版)

    难度     813人已做
    查看
  • 【考后总结】2024年5月26日信息系统项目管理师第2批次考情分析

    难度     354人已做
    查看
  • 【考后总结】2024年5月25日信息系统项目管理师第1批次考情分析

    难度     318人已做
    查看
  • 2024年上半年软考高项第一、二批次真题考点汇总(完整版)

    难度     435人已做
    查看
  • 2024年上半年系统架构设计师考试综合知识真题

    难度     224人已做
    查看

相关文章

发现更多好内容

猜你喜欢

AI推送时光机
位置:首页-资讯-后端开发
咦!没有更多了?去看看其它编程学习网 内容吧
首页课程
资料下载
问答资讯