火车采集器怎么处理数据 火车采集器数据处理介绍

 我来答
科技阿胡
2022-11-11 · TA获得超过357个赞
知道小有建树答主
回答量:125
采纳率:0%
帮助的人:61.9万
展开全部
  对从内容页面提取的数据进行进一步处理,可以同时添加多个操作,按照从上到下的顺序来执行。

  也就是说,上个步骤的结果会作为下个步骤的参数。

  1)提取内容为空:如果提取内容为空,则使用正则匹配从原始页面中再次提取

  2)内容替换/排除:将采集到的内容进行字符串替换,如需排除,则替换为空字符串即可

  3)html标签过滤:过滤指定html标签,比如<a,<font

  4)字符截取:通过开始和结束字符串对内容进行截取

  5)纯正则替换:通过强大的正则表达式进行复杂的替换。

  6)数据转换:包括将结果简转繁、将结果繁转简、自动转化为拼音和时间修正转化

  7)智能提取:包括提取第一张图片、智能提取时间、智能提取邮箱、智能提取手机号码、智能提取电话号码

  8)高级功能:包括自动摘要、自动分词、Http请求、字符编码转换、同义词替换、空内容缺省值、内容加前后缀、随机插入、运行C#代码、批量内容替换,统计标签字符串长度等一系列功能。

  9)补全单网址:将当前内容作为一个网址进行补全。

  10)文件下载:可以自动探测并下载文件,可设置下载路径和文件名样式。

  11)内容过滤:对于一些不符合条件的记录,可以通过设置内容过滤来删除或标记为未采。
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
推荐律师服务: 若未解决您的问题,请您详细描述您的问题,通过百度律临进行免费专业咨询

为你推荐:

下载百度知道APP,抢鲜体验
使用百度知道APP,立即抢鲜体验。你的手机镜头里或许有别人想知道的答案。
扫描二维码下载
×

类别

我们会通过消息、邮箱等方式尽快将举报结果通知您。

说明

0/200

提交
取消

辅 助

模 式