java新闻抓取程序代码
/*我做了个程序把新浪上的天气新闻抓过来存到本地,考虑访问速度问题,新闻中的图片也要保存到本地。
程序如下
*/
package vnet.com.weather1;
import java.io.BufferedReader;
import java.io.ByteArrayOutputStream;
import java.io.File;
import java.io.FileWriter;
import java.io.IOException;
import java.io.InputStream;
import java.io.InputStreamReader;
import java.io.PrintWriter;
import java.net.URL;
import java.net.URLConnection;
import java.util.regex.Matcher;
import java.util.regex.Pattern;
import org.apache.commons.logging.Log;
import org.apache.commons.logging.LogFactory;
import vnet.com.update.Getdata;
/**
* 正则方式抓取新浪天气新闻上的新闻
* 地址http://weather.news.sina.com.cn/weather/news/index.html
* @param args
*/
public class Newlist {
private static final Log log = LogFactory.getLog(Newlist.class);
/**
* 测试
* @param args
*/
public static void main(String args[]){
Newlist n=new Newlist();
String[] k=n.getNewList();
for (int i=0;i<k.length;i++){
System.out.println(k[i].replace("href=\"", "href=\"newinfo2.jsp?url="));
}
String[] m=n.getNewinfo("news/2008/1119/35261.html");
for (int l=0;l<m.length;l++){
System.out.println(m[l]);
}
}
/**
* 由url地址获得新闻内容string[]
* 新闻中的图片下载到本地,文中新闻地址改成本地地址
* @param url
* @return
*/
public String[] getNewinfo(String url){
String URL="http://weather.news.sina.com.cn/"+url;
//30是指取30段满足给出的正则条件的字符串,如果只找出10个,那数组后面的全为null
String[] s = analysis("<p>(.*?)</p>" , getContent(URL) , 30);
for (int i=0;i<s.length;i++){
Pattern sp = Pattern.compile("src=\"(.*?)\"");
Matcher matcher = sp.matcher(s[i]);
if (matcher.find()){
String imageurl=analysis("s
相关文档:
Java Arrays中提供了对所有类型的排序。其中主要分为primitive和Object两大类,分别使用了快速排序与合并排序。本章以int[] 的排序,讲解Java对primitive排序。
首先大家要了解什么是快速排序,它有什么优点,这些我就不累述了,给出地址。http://zh.wikipedia.org/zh/%E5%BF%AB%E9 ......
今天在编写一个快速排序函数,其中想用一个在C++中类似swap功能的函数,结果引发了一系列的问题。
下面是在网上搜到的代码,并在我的本地机上作了运行。
public class ParamTest
{
public static void ......
基于表单的文件上传
如果在表单中使用表单元素 <input type=“file”
/>,浏览器在解析表单时,会自动生成一个输入框和一个按钮,输入框可供用户填写本地文件的文件名和路径名,按钮可以让浏览器打开一个文件选择框供
用户选择文件:
当表单需要上传文件时,需指定表单 enctype 的值为 multipart/fo ......
引言
Java的堆是一个运行时数据区,类的实例(对象)从中分配空间。Java虚拟机(JVM)的堆中储存着正在运行的应用程序所建立的所有对象,这些对象通过new、newarray、anewarray和multianewarray等指令建立,但是它们不需要程序代码来显式地释放。一般来说,堆的是由垃圾回收 来负责的,尽管JVM规范并不要求特殊的垃圾回收 ......