
正文
java获取网站代码 java获取网页源代码
提示:扫一扫查出行【扫一扫了解最新限行尾号】
复制提示
VB或JAVA抓取网页源代码
1、乱码问题,可以设置编码解决。Java一般支持UTF-8 如果不是,你可以多改几个编码看看哪个是中文。你也可以把读取到的字节码显示成二进制看看到底是哪种编码,不同编码很好辨认的。。比如英文的UTF-8 它是高八位全一样。
2、使用Inet控件获取网页源码。Internet Transfer 控件实现了两种广泛使用的 Internet 协议: 超文本传送协议(HyperText Transfer Protocol)(HTTP) 和文件传送协议(File Transfer Protocol) (FTP)。
3、URL 定位的 HTML 文档。然而,如果 URL 被改为指向文本文件,则将获得实 际的文件。
相关问答
Q1: Java访问指定URL并获取网页源代码
1、javascript获取网页源码,测试了能通过的,你试下!你把& l t ; & g t;的空格删了,因为百度不允许那些字符。
2、Java可以通过链接的mime类型来判断源文件的类型,从而得到源文件内容,示例如下:URLConnection提供了两种方法可以猜测(根据实测结果,这个猜测是相当的准)数据的MIME类型。
3、Java访问网络url,获取网页的html代码 方式一:一是使用URL类的openStream()方法:openStream()方法与制定的URL建立连接并返回InputStream类的对象,以从这一连接中读取数据;openStream()方法只能读取网络资源。
4、步骤:使用java.net包下的URL类,可以将一个网页(链接)封装成一个URL对象。
Q2: java中如何根据一个网址获得该网页的源代码?
1、1.编写useSourceViewer 类的基本框架,该类仅包括无返回值的main ()方法,该方法从参数中获取URL,通过输入缓冲和输出缓冲将该URL 原码输出。
2、Java可以通过链接的mime类型来判断源文件的类型,从而得到源文件内容,示例如下:URLConnection提供了两种方法可以猜测(根据实测结果,这个猜测是相当的准)数据的MIME类型。
3、使用正则表达式去匹配就行了。第一步:下载你需要分析的网页的源码 第二步:在程序中使用正则表达式去匹配源码,保存匹配成功的链接地址就行。
4、Java的话可以用Apache HTTP Client编程实现。http://hc.apache.org/httpclient-x/tutorial.html 这是简介和教程。网页上也能找到下载链接。(希望LZ英文还可以~)其他语言应该也有相似的库。
5、网站整个源码肯定是获取不到的。当然,我说的是包括界面和后台程序功能代码。只能获取界面html代码,以及css样式js和一些图片。主要的后台功能代码是获取不到的。
6、swing做前台界面。后台使用java.net中的HTTPConnection下载就OK。下载可以用getInputStream()获取数据,然后写入文件。只提供思路,无代码。
Q3: 求用java实现截取整个网页的代码
1、整个网页的话用iframe 部分网页如果是静态的,可以右键查看网页源码,把要的部分搞下来,记得要同时把css,js,图片等资源下载下来。如果网页是动态的,你又想要其中一部分,那就不呢能了。
2、先通过www来分割不同的新字符串。用字符串截取:subString(startIndex,endIndex);很简单吧。
3、爬虫的原理其实就是获取到网页内容,然后对其进行解析。只不过获取的网页、解析内容的方式多种多样而已。你可以简单的使用httpclient发送get/post请求,获取结果,然后使用截取字符串、正则表达式获取想要的内容。
4、我想你应该是想通过这个页面的url来得到这个网页里面的某些数据把。用HttpClient 。下面我这个方法是得到搜狗页面命中多少条记录的代码。
5、针对得到的html代码,通过使用正则表达式即可得到我们想要的内容。比如,我们如果想得到一个网页上所有包括“java”关键字的文本内容,就可以逐行对网页代码进行正则表达式的匹配。
Q4: java程序读取一个url页面的源代码
1、1.编写useSourceViewer 类的基本框架,该类仅包括无返回值的main ()方法,该方法从参数中获取URL,通过输入缓冲和输出缓冲将该URL 原码输出。
2、Java可以通过链接的mime类型来判断源文件的类型,从而得到源文件内容,示例如下:URLConnection提供了两种方法可以猜测(根据实测结果,这个猜测是相当的准)数据的MIME类型。
3、步骤:使用java.net包下的URL类,可以将一个网页(链接)封装成一个URL对象。
4、java实现网页源码获取的步骤:(1)新建URL对象,表示要访问的网址。如:url=new URL(http://;);(2)建立HTTP连接,返回连接对象urlConnection对象。
Q5: java读取网站内容的两种方法
根据java网络编程相关的内容,使用jdk提供的相关类可以得到url对应网页的html页面代码。针对得到的html代码,通过使用正则表达式即可得到我们想要的内容。
在获取到的页面内容是字符串,这里解析有两个办法,一是通过dom4j把字符串转化为dom进行解析,这样最好,但是对方的页面未必规范,符合dom结构。二是通过解析字符串过滤你想要的内容,该方法比较繁琐,需要一些技巧。
爬虫的原理其实就是获取到网页内容,然后对其进行解析。只不过获取的网页、解析内容的方式多种多样而已。你可以简单的使用httpclient发送get/post请求,获取结果,然后使用截取字符串、正则表达式获取想要的内容。
java获取网站代码的介绍就聊到这里吧,感谢你花时间阅读本站内容,更多关于java获取网页源代码、java获取网站代码的信息别忘了在本站进行查找喔。






