java 如何爬取百度百科词条内容(java如何使用webmagic爬取百度词条)

这是老师所布置的作业

说一下我这里的爬去并非能把百度词条上的内容一字不漏的取下来（而是它分享链接的一个主要内容概括...）（他的主要内容我爬不到也不想去研究大家有好办法可以call me）

例如 互联网+这个词汇我这里爬的解释为

中文【互联网+_百度百科】“互联网+”是创新2.0下的互联网发展的新业态，是知识社会创新2.0推动下的互联网形态演进及其催生的经济社会发展新形态。“互联网+”是互联网思维的进一步实践成果，推动经济形态不断地发生演变，从而带动社会经济实体的生命力，为改革、创新、发展提供广阔的网络平台。通俗的说，“互联网+”就是“互联网+各个传统行业”，但这并不是简单的两者相加，而是利用信息通信技术以及互联网平台，让互联网与传统行业进行深度融合，创造新的发展生态。它代表一种新的社会形态，即充分发挥互联网在社会资源配置中的优化和集成作用，将互联网的创新成果深度融合于经济、社会各域之中，提升全社会的创新力和生产力，形成更广泛的以互联网为基础设施和实现工具的经济发展新形态。2015年7月4日，国务院印发《国务院关于积极推进“互联网+”行动的指导意见》。2016年5月31日，教育部、国家语委在京发布《中国语言生活状况报告（2016）》。“互联.....（分享自

而不同于百度词条的长篇大论

webmagic 使用不再赘述导入包实现PageProcessor接口

代码如下

 package com.test;

 import java.util.regex.Matcher;

 import java.util.regex.Pattern;

 import us.codecraft.webmagic.Page;

 import us.codecraft.webmagic.Site;

 import us.codecraft.webmagic.Spider;

 import us.codecraft.webmagic.pipeline.ConsolePipeline;

 import us.codecraft.webmagic.processor.PageProcessor;

 /**

  * @author 信1605-1 hjj

  *

  */

 public class PaChong2 implements PageProcessor{

     private Site site = Site.me()

             .setUserAgent("Mozilla/5.0 (Windows NT 10.0; WOW64; rv:56.0) Gecko/20100101 Firefox/56.0")

             .setRetryTimes(3)

             .setSleepTime(1000);

     @Override

     public Site getSite() {

         // TODO Auto-generated method stub

         return site;

     }

     public static void main(String[] args) {

         Spider.create(new PaChong2())

         .addUrl("https://baike.baidu.com/item/互联网+")//这里填写你第一次要爬的网址（后面直接跟你要查的词汇名称把互联网改了就行）

         .addPipeline(new ConsolePipeline())

         .thread(15)

         .run();

 }

     @Override

     public void process(Page page) {

     //这段代码重复获取

         System.out.println(mySplitBaiDu(page));

         System.out.println("中文"+unicodeToString(mySplitBaiDu(page)));

     }

     //爬取百度解释  为unicode文本

         public static String mySplitBaiDu(Page page)

         {

            String wordname=page.getUrl().toString().split("item/")[1];

             String basehtml=page.getJson().toString();

             String content =basehtml.split("bdText: \"")[1].split("@")[0];

             return content;

         }

         //unicode 转中文

         public static String unicodeToString(String str) {

             Pattern pattern = Pattern.compile("(\\\\u(\\p{XDigit}{4}))");

             Matcher matcher = pattern.matcher(str);

             char ch;

             while (matcher.find()) {

                 //group 6728

                 String group = matcher.group(2);

                 //ch:'木' 26408

                 ch = (char) Integer.parseInt(group, 16);

                 //group1 \u6728

                 String group1 = matcher.group(1);

                 str = str.replace(group1, ch + "");

             }

             return str;

         }

 }

结果