频道导航

python – 使用scrapy刮掉没有javascript代码的文本

2019-06-04 Python 前端之家

前端之家收集整理的这篇文章主要介绍了python – 使用scrapy刮掉没有javascript代码的文本，前端之家小编觉得挺不错的，现在分享给大家，也给大家做个参考。

我目前正在使用scrapy设置一堆蜘蛛.这些蜘蛛应该只从目标网站中提取文本(文章,论坛帖子,段落等).

问题是：有时,我的目标节点包含< script>标签,因此刮下的文本包含javascript 代码.

Here is a link到我正在使用的一个真实的例子.在这种情况下,我的目标节点是// td [@ id =’contenuStory’].问题是有一个< script>标记在第一个子div中.

我花了很多时间在网上和SO上搜索解决方案,但我找不到任何东西.我希望我没有错过任何明显的东西！

例

HTML响应(仅限目标节点)：


我想要的东西：

Some text
Some other text

我得到了什么：

Some text
var s = 'javascript I don't want';
Some other text

我的代码
给定一个xpath选择器我正在使用以下函数来提取文本：

def getText(hxs):
    if len(hxs) > 0:
        l = hxs.select('string(.)')
        if len(l) > 0:
            s = l[0].extract().encode('utf-8')
        else:
            s = hxs[0].extract().encode('utf-8')
        return s
    else:
        return 0

我尝试过使用XPath轴(像child :: script这样的东西),但无济于事.


最佳答案
尝试使用w3lib.html中的utils函数：

from w3lib.html import remove_tags,remove_tags_with_content

input = hxs.select('//div[@id="content"]').extract()
output = remove_tags(remove_tags_with_content(input,('script',)))


 原文链接：https://www.f2er.com/python/439652.html


      python
      
                 
        上一篇：如何测试matplotlib的show()显示一下一篇：python  – 以解释语言链接和加载


          
          
          
            
              


            
          

          
            
              
                  
    猜你在找的Python相关文章

                                    爬虫实战：探索XPath爬虫技巧之热榜新闻
                                在这篇文章中，我们深入学习了XPath作为一种常见的网络爬虫技巧。XPath是一种用于定位和选...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    谁说后端不能画出美丽的动图？让我来给大家拜个年！
                                祝福大家龙年快乐！愿你们的生活像龙一样充满力量和勇气，愿你们在新的一年里，追逐梦想，...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    爬虫实战：从网页到本地，如何轻松实现小说离线阅读
                                今天在爬虫实战中，除了正常爬取网页数据外，我们还添加了一个下载功能，主要任务是爬取小...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    爬虫实战+数据分析：全国消费支出分析及未来预测
                                完美收官，本文是爬虫实战的最后一章了，所以尽管本文着重呈现爬虫实战，但其中有一大部分...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    Java开发者的Python进修指南：JSON利器之官方json库、demjson和orjson的实用指南
                                JSON是一种流行的数据传输格式，Python中有多种处理JSON的方式。官方的json库是最常用的，...
                                作者：努力的小雨 时间：2024-09-28
                                
                            




                                    使用Python的turtle模块绘制美丽的樱花树
                                通过本文的学习和实践，我们掌握了使用Python的turtle模块来创作樱花树图画的技巧，这个过...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    利用大型语言模型轻松打造浪漫时刻
                                在这篇文章中，我们介绍了如何利用大型语言模型为情人节营造难忘的氛围。通过上传图片并进...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    成为一个合格程序员所必备的三种常见LeetCode排序算法
                                排序算法是一种通过特定的算法因式将一组或多组数据按照既定模式进行重新排序的方法。通过...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    5分钟上手Python爬虫：从干饭开始，轻松掌握技巧
                                本文的重点在于引导读者如何初步掌握爬虫技术。初步掌握爬虫技术并不难，但是在实际操作中...
                                作者：努力的小雨 时间：2024-09-28
                                
                            

                                    AI实用指南：5分钟搭建你自己的LLM聊天应用
                                本文介绍了如何快速搭建一个基于大型语言模型（LLM）的混元聊天应用。强调了开发速度的重要...
                                作者：努力的小雨 时间：2024-09-28


        
        
        
        
          
          
            
              
                编程分类
                PHPJavaJava SEPythonC#C&C++RubyVBasp.NetGoPerlnettyDjangoDelphiJsp.NET CoreSpringFlaskSpringbootSpringMVCLuaLaravelMybatisAspGroovyThinkPHPYiiswoole
                
              
            
          
          
         
          
            
               



              
            
          
          
          
          
          
            
              
                最新文章
                • 爬虫实战：探索XPath爬虫技
• 谁说后端不能画出美丽的动
• 爬虫实战：从网页到本地，
• 爬虫实战+数据分析：全国消
• Java开发者的Python进修指
• Java开发者的Python快速进
• 使用Python的turtle模块绘
• 利用大型语言模型轻松打造
• 成为一个合格程序员所必备
• 5分钟上手Python爬虫：从干

              
            
          
          


          
          
            
              
                热门标签
                  
                    更多 ►
                
                文件时间pythonm相等性PHP Warning时间问题问题解决pcntl_signal采样点wav模块动态文本调用频率限制对外暴露多个访问请求更新数据表模型结构type()方法比较速度手写体sobel算子保存模型Image类nn.Conv2dpytorch1.0kaggleDCGAN交并比range()用法打印模型反卷积卷积



     
    
        
             
                最近更新
· jQuery选择伪元素：after10-20
· JavaScript随机颜色生成器10-20
· JavaScript指数10-20
· addResourceHandlers无法解析静态资源10-20
· 如何将字节数组转换为MultipartFile10-20
· 在java中如何创建一个文件并写入内容？10-20
· 星号*在Python中是什么意思？10-20
· Flask框架：MVC模式10-20
· 在JavaScript对象数组中按ID查找对象10-20
· 使用Javascript / jQuery下载文件10-20

            
           
                好站推荐
 菜鸟教程
 编程之家
 前端之家

            
                商务合作
                联系我们
            

        
        
            Copyright © 2019 前端之家. 当前版本 V7.0.16

            前端之家 版权所有 
            闽ICP备13020303号-10