背景:
基于jsoup(v 1.6.3)解析出来的网页内容进行过滤不需要的内容比如<script>
实现:
一种方式是基于tag的白名单,这种方式明显没有黑名单合适,不过jsoup木有提供黑名单功能
直接基于正则,常用的如下:
如:过滤<script>
String reg = "<\\s*?script[^>]*?>[\\s\\S]*?<\\s*?/\\s*?script\\s*?>";Pattern pattern = Pattern.compile(reg);Matcher matcher = pattern.matcher(content.html());articleVo.setContent(matcher.replaceAll(""));