python怎样读取文本文件里的中文

想写一段python代码,能每次只读取文本文件中的下一个中文字符,跳过所有英文数字、符号和换行符,而且还不知道文件的编码是GBK还是Unicode,应该怎样写呢?... 想写一段python代码,能每次只读取文本文件中的下一个中文字符,跳过所有英文数字、符号和换行符,而且还不知道文件的编码是GBK还是Unicode,应该怎样写呢? 展开
 我来答
我心我在
2015-02-26 · TA获得超过2157个赞
知道小有建树答主
回答量:784
采纳率:77%
帮助的人:634万
展开全部
#在Windows 环境下
import sys
reload(sys)
sys.setdefaultencoding("utf-8")
import re
fin = open('in.txt', 'r') #以读的方式打开输入文件
for eachLine in fin: #按行读入文件内容
line = eachLine.strip().decode('gbk', 'utf-8') #处理前进行相关的处理,包括转换成Unicode等
print line #打印原始字符
p2 = re.compile(ur'[^\u4e00-\u9fa5]') #中文的编码范围是:\u4e00到\u9fa5
zh = "".join(p2.split(line)).strip()
#zh = ",".join(zh.split())
print zh ##打印中文字符
追问
想每次只提取一个字,可以吗?
追答
print zh ##打印中文字符
这整个字符都得到了  改成一个一个的提取 应该不难把
百度网友0d7347e
推荐于2016-11-14 · TA获得超过165个赞
知道小有建树答主
回答量:233
采纳率:0%
帮助的人:107万
展开全部
file = open('filename.txt','r')
text = file.read() #读取所有文字
text = file.readline() #读取一行文字
text = file.readlinse() #把每一行变成list的一个元素
如果需要里面中文的话,用正则匹配
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
未央夜幽灵
2015-08-07 · 超过48用户采纳过TA的回答
知道小有建树答主
回答量:176
采纳率:100%
帮助的人:134万
展开全部
读没有问题,主要是输出的问题吧?
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
收起 1条折叠回答
推荐律师服务: 若未解决您的问题,请您详细描述您的问题,通过百度律临进行免费专业咨询

为你推荐:

下载百度知道APP,抢鲜体验
使用百度知道APP,立即抢鲜体验。你的手机镜头里或许有别人想知道的答案。
扫描二维码下载
×

类别

我们会通过消息、邮箱等方式尽快将举报结果通知您。

说明

0/200

提交
取消

辅 助

模 式