HTML 解析_安科网

最近要抓取别的网页的信息，找了一些相关的信息：

jsoup

jsoup 是一款 Java 的HTML 解析器，可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API，可通过DOM，CSS以及类似于JQuery的操作方法来取出和操作数据。

jsoup的主要功能如下：

从一个URL，文件或字符串中解析HTML；
使用DOM或CSS选择器来查找、取出数据；
可操作HTML元素、属性、文本；

EXample：

Document doc = Jsoup.connect("http://en.wikipedia.org/").get();
Elements newsHeadlines = doc.select("#mp-itn b a");

Document doc = Jsoup.connect("http://jsoup.org").get();

Element link = doc.select("a").first();
String relHref = link.attr("href"); // == "/"
String absHref = link.attr("abs:href"); // "http://jsoup.org/"

HtmlParser

网站：http://htmlparser.sourceforge.net/

HTML Parser 是一个对HTML进行分析的快速实时的解析器

NekoHTML

http://nekohtml.sourceforge.net/

NekoHTML是一个Java语言的 HTML扫描器和标签补全器(tag balancer) ,使得程序能解析HTML文档并用标准的XML接口来访问其中的信息

HTML 解析

loverlucky

相关推荐

谈谈html页面的解析(一)

Java实现从html中提取css

iOS抓取HTML ,CSS XPath解析数据