如何引入ItemLoader和Item预处理函数

发布时间:2021-05-10 16:18:54 作者:Leah
来源:亿速云 阅读:135

今天就跟大家聊聊有关如何引入ItemLoader和Item预处理函数,可能很多人都不太了解,为了让大家更加了解,小编给大家总结了以下内容,希望大家根据这篇文章可以有所收获。

1.引入ItemLoader

class XkdItemLoader(ItemLoader):
    default_output_processor = TakeFirst()

2.修改spider,让itemloader完成素定位和元素解析

def parse_analyse(self, response):
        # 构建loader
        xkd_itemload = MyItemLoader(item=XkdDribbbleSpiderItem(), response=response)
        image_url = response.meta.get('a_image_url')
        # 通过loader定位元素和解析元素
        xkd_itemload.add_css('title', "[role='article'] header h2")
        # 注意这里传递的是一个列表
        xkd_itemload.add_value('image_url', [image_url])
        xkd_itemload.add_value('url', response.url)
        xkd_itemload.add_value('url_id', get_md5(response.url))
        xkd_itemload.add_css('date', 'p span.date::text')
        # 解析元素之后返回item
        xkd_item = xkd_itemload.load_item()
        # 将item返回
        yield xkd_item

3.修改item数据模型

from scrapy.loader.processors import TakeFirst, MapCompose
from datetime import datetime
def str_to_date(str_date):
    str_date = str_date.strip()
    date = datetime.strptime(str_date, '%b %d, %Y').date()
    return date.strftime('%Y-%m-%d')
class XkdDribbbleSpiderItem(scrapy.Item):
    title = scrapy.Field()
    image_url = scrapy.Field(
        output_processor = MapCompose(lambda value: value)
    )
    date = scrapy.Field(
        input_processor = MapCompose(str_to_date)
    )
    image_path = scrapy.Field()
    url = scrapy.Field()
    url_id = scrapy.Field()

看完上述内容,你们对如何引入ItemLoader和Item预处理函数有进一步的了解吗?如果还想了解更多知识或者相关内容,请关注亿速云行业资讯频道,感谢大家的支持。

推荐阅读:
  1. 事件引入和本质
  2. 如何在golang​中引入包、函数和变量

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

item

上一篇:如何在Java 8中引入lambda表达式

下一篇:怎么在springMVC中引入Validation

相关阅读

您好,登录后才能下订单哦!

密码登录
登录注册
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》