java编个中文分词的程序

我想编个中文分词的程序，大神帮帮忙？... 我想编个中文分词的程序，大神帮帮忙？展开

 我来答

2个回答

#热议# 什么是淋病？哪些行为会感染淋病？

a2040605
2014-03-17 · TA获得超过337个赞

知道小有建树答主

回答量：194

采纳率：100%

帮助的人：136万

我也去答题访问个人页

关注

展开全部

import java.io.Reader;
import java.io.StringReader;
import org.apache.lucene.analysis.*;
import org.apache.lucene.analysis.cjk.CJKAnalyzer;
import org.apache.lucene.analysis.cn.ChineseAnalyzer;
import org.apache.lucene.analysis.standard.StandardAnalyzer;
import org.mira.lucene.analysis.MIK_CAnalyzer;

public class JeAnalyzer {

    public static void testStandard(String testString) {
        try {
            Analyzer analyzer = new StandardAnalyzer();
            Reader r = new StringReader(testString);
            StopFilter sf = (StopFilter) analyzer.tokenStream("", r);
            System.err.println("=====standard analyzer====");
            Token t;
            while ((t = sf.next()) != null) {
                System.out.println(t.termText());
            }
        } catch (Exception e) {
            e.printStackTrace();
        }
    }

    public static void testCJK(String testString) {
        try {
            Analyzer analyzer = new CJKAnalyzer();
            Reader r = new StringReader(testString);
            StopFilter sf = (StopFilter) analyzer.tokenStream("", r);
            System.err.println("=====cjk analyzer====");
            Token t;
            while ((t = sf.next()) != null) {
                System.out.println(t.termText());
            }
        } catch (Exception e) {
            e.printStackTrace();
        }
    }

    public static void testChiniese(String testString) {
        try {
            Analyzer analyzer = new ChineseAnalyzer();
            Reader r = new StringReader(testString);
            TokenFilter tf = (TokenFilter) analyzer.tokenStream("", r);
            System.err.println("=====chinese analyzer====");
            Token t;
            while ((t = tf.next()) != null) {
                System.out.println(t.termText());
            }
        } catch (Exception e) {
            e.printStackTrace();
        }
    }

    public static String transJe(String testString, String c1, String c2) {
        String result = "";
        try {
            Analyzer analyzer = new MIK_CAnalyzer();
            Reader r = new StringReader(testString);
            TokenStream ts = (TokenStream) analyzer.tokenStream("", r);
            Token t;
            while ((t = ts.next()) != null) {
                result += t.termText() + ",";
            }
        } catch (Exception e) {
            e.printStackTrace();
        }
        return result;
    }

    public static void main(String[] args) {
        try {
            String testString = "中文分词的方法其实不局限于中文应用，也被应用到英文处理，如手写识别，单词之间的空格就很清楚，中文分词方法可以帮助判别英文单词的边界";
            System.out.println("测试的语句    "+testString);
            String sResult[] = transJe(testString, "gb2312", "utf-8").split(",");
            for (int i = 0; i < sResult.length; i++) {
                System.out.println(sResult[i]);
            }
        } catch (Exception e) {
            e.printStackTrace();
        }
    }
}

jar包  
lucene-analyzers-2.4.1.jar
lucene-core-2.4.1.jar
IKAnalyzer2.0.2OBF.jar

更多追问追答
追问

只是什么算法实现的啊？
追答

分析方法:字典分词,正反双向搜索
追问

jar包要导入吗？是什么包？
追答

要导   后面 我有说明的  
jar包  
lucene-analyzers-2.4.1.jar
lucene-core-2.4.1.jar
IKAnalyzer2.0.2OBF.jar
追问

哦，怎么导，可以教我吗，给分啊，私信聊
追答

你去把这3个jar包下载下来   你用的什么编译器  添加jar文件就可以   你去网上找找怎么添加jar文件的
追问

找不到这几个包
追答


追问

第一个没有啊
追答
这是所有的jar文件。。。。。

追问

不行啊，运行有很多错误啊，可不可以帮我弄下啊

已赞过 已踩过<

评论收起

kf1815
2014-03-17

知道答主

回答量：4

采纳率：100%

帮助的人：6004

我也去答题访问个人页

关注

展开全部

现有的分词算法可分为三大类：基于字符串匹配的分词方法、基于理解的分词方法和基于统计的分词方法。

从基于字符串匹配的分词方法,中文分词的实现思路如下:
1 提供一个词典
2 在字符串中正向扫描或者反向扫描匹配将字符串中多个字符取出后进行词典匹配

这个是效率最低的方式

另外就是基于统计方式,记录字与字一同出现的频率,实现分词

追问

可以写个程序吗

本回答被网友采纳

已赞过 已踩过<

评论收起

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

您可能关注的内容

Trae AI IDE:AI自动编程，从0到1开发项目

Trae提供基于Agent的AI自动编程能力，从0到1开发项目，AI助手全程支持，开发效率大幅提升!

www.trae.com.cn广告

超级码客~2025版海量5000道Java面试题+笔试题&答案

涵盖java编程题库海量Java面试题#Java语言，多线程，JVM，Spring开发体系，SpringCloud，Dubbo，Java微服务，Java数据结构算法，MyBatis，Hibernate等Java面试题超5000题java编程题库

www.chaojimake.cn广告

java编个中文分词的程序

您可能关注的内容

其他类似问题

为你推荐：