频道导航

python – NLTK停用词删除问题

2019-06-06 Python 前端之家

前端之家收集整理的这篇文章主要介绍了python – NLTK停用词删除问题，前端之家小编觉得挺不错的，现在分享给大家，也给大家做个参考。

我正在尝试做一个document classification,as described in NLTK Chapter 6,而我在删除停用词时遇到了麻烦.当我添加

all_words = (w for w in all_words if w not in nltk.corpus.stopwords.words('english'))

它返回

Traceback (most recent call last):
  File "fiction.py",line 8,in


我猜测停用词代码改变了用于’all_words’的对象类型,使得它们.key()函数无用.如何在使用键功能之前删除停用词而不更改其类型？完整代码如下：

import nltk 
from nltk.corpus import PlaintextCorpusReader

corpus_root = './nltk_data/corpora/fiction'
fiction = PlaintextCorpusReader(corpus_root,'.*')
all_words=nltk.FreqDist(w.lower() for w in fiction.words())
all_words = (w for w in all_words if w not in nltk.corpus.stopwords.words('english'))
word_features = all_words.keys()[:100]

def document_features(document): # [_document-classify-extractor]
    document_words = set(document) # [_document-classify-set]
    features = {}
    for word in word_features:
        features['contains(%s)' % word] = (word in document_words)
    return features

print document_features(fiction.words('fic/11.txt'))


最佳答案
我会通过避免首先将它们添加到FreqDist实例来实现这一点：

all_words=nltk.FreqDist(w.lower() for w in fiction.words() if w.lower() not in nltk.corpus.stopwords.words('english'))

根据你的语料库的大小,我认为你可能会在创建一个停用词集之前获得性能提升：

stopword_set = frozenset(ntlk.corpus.stopwords.words('english'))

如果这不适合您的情况,看起来您可以利用FreqDist继承自dict的事实：

for stopword in nltk.corpus.stopwords.words('english'):
    if stopword in all_words:
        del all_words[stopword]


@H_403_53@ 原文链接：https://www.f2er.com/python/439694.html


      nltk
      
                 
        上一篇：URL可以在浏览器或wget中正常工作,下一篇：python  –  nose运行测试两次


          
          
          
            
              


            
          

          
            
              
                  
    猜你在找的Python相关文章

                                    爬虫实战：探索XPath爬虫技巧之热榜新闻
                                在这篇文章中，我们深入学习了XPath作为一种常见的网络爬虫技巧。XPath是一种用于定位和选...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    谁说后端不能画出美丽的动图？让我来给大家拜个年！
                                祝福大家龙年快乐！愿你们的生活像龙一样充满力量和勇气，愿你们在新的一年里，追逐梦想，...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    爬虫实战：从网页到本地，如何轻松实现小说离线阅读
                                今天在爬虫实战中，除了正常爬取网页数据外，我们还添加了一个下载功能，主要任务是爬取小...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    爬虫实战+数据分析：全国消费支出分析及未来预测
                                完美收官，本文是爬虫实战的最后一章了，所以尽管本文着重呈现爬虫实战，但其中有一大部分...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    Java开发者的Python进修指南：JSON利器之官方json库、demjson和orjson的实用指南
                                JSON是一种流行的数据传输格式，Python中有多种处理JSON的方式。官方的json库是最常用的，...
                                作者：努力的小雨 时间：2024-09-28
                                
                            




                                    使用Python的turtle模块绘制美丽的樱花树
                                通过本文的学习和实践，我们掌握了使用Python的turtle模块来创作樱花树图画的技巧，这个过...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    利用大型语言模型轻松打造浪漫时刻
                                在这篇文章中，我们介绍了如何利用大型语言模型为情人节营造难忘的氛围。通过上传图片并进...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    成为一个合格程序员所必备的三种常见LeetCode排序算法
                                排序算法是一种通过特定的算法因式将一组或多组数据按照既定模式进行重新排序的方法。通过...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    5分钟上手Python爬虫：从干饭开始，轻松掌握技巧
                                本文的重点在于引导读者如何初步掌握爬虫技术。初步掌握爬虫技术并不难，但是在实际操作中...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    AI实用指南：5分钟搭建你自己的LLM聊天应用
                                本文介绍了如何快速搭建一个基于大型语言模型（LLM）的混元聊天应用。强调了开发速度的重要...
                                作者：努力的小雨 时间：2024-09-28


        
        
        
        
          
          
            
              
                编程分类
                PHPJavaJava SEPythonC#C&C++RubyVBasp.NetGoPerlnettyDjangoDelphiJsp.NET CoreSpringFlaskSpringbootSpringMVCLuaLaravelMybatisAspGroovyThinkPHPYiiswoole
                
              
            
          
          
         
          
            
               



              
            
          
          
          
          
          
            
              
                最新文章
                • 爬虫实战：探索XPath爬虫技
• 谁说后端不能画出美丽的动
• 爬虫实战：从网页到本地，
• 爬虫实战+数据分析：全国消
• Java开发者的Python进修指
• Java开发者的Python快速进
• 使用Python的turtle模块绘
• 利用大型语言模型轻松打造
• 成为一个合格程序员所必备
• 5分钟上手Python爬虫：从干

              
            
          
          


          
          
            
              
                热门标签
                  
                    更多 ►
                
                文件时间pythonm相等性PHP Warning时间问题问题解决pcntl_signal采样点wav模块动态文本调用频率限制对外暴露多个访问请求更新数据表模型结构type()方法比较速度手写体sobel算子保存模型Image类nn.Conv2dpytorch1.0kaggleDCGAN交并比range()用法打印模型反卷积卷积



     
    
        
             
                最近更新
· jQuery选择伪元素：after10-20
· JavaScript随机颜色生成器10-20
· JavaScript指数10-20
· addResourceHandlers无法解析静态资源10-20
· 如何将字节数组转换为MultipartFile10-20
· 在java中如何创建一个文件并写入内容？10-20
· 星号*在Python中是什么意思？10-20
· Flask框架：MVC模式10-20
· 在JavaScript对象数组中按ID查找对象10-20
· 使用Javascript / jQuery下载文件10-20

            
           
                好站推荐
 菜鸟教程
 编程之家
 前端之家

            
                商务合作
                联系我们
            

        
        
            Copyright © 2019 前端之家. 当前版本 V7.0.16

            前端之家 版权所有 
            闽ICP备13020303号-10