CAJ文件的识别
CAJ文件的识别
(2008-03-18 21:14:43)转载很多科技文献,论文,都是用CAJViewer7.0称为“电子阅读器”的一个程序来阅读的。但CAJ文件像PDF文件一样,是些类似图片格式的文本。这些图片格式的文本转换成可编辑的真正文本是有点麻烦的。仅仅用“拷贝,粘贴”的办法,是不行的。需要进行一个格式的转换。
方法1:需要安装一个软件:Office2003,完整版大概680多兆。用CajViewer打开所要转的文件,工具栏里选“文件”——“打印”。
一般机器里安装了Office2003之后,会随着安装一个虚拟打印机MicrosoftOfficeDocumentI
先选打印“全部”,然后点“确定”。最后选择文件保存路径,但这时,保存的这个文件是MDI格式的,打印完后MicrosoftOfficeDocumentI
方法2:从CAJ等文件中提取全文本的方法
现在网上的许多资料都是以CAJ、PDF等文件格式提供的,其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件,但是它们不是效率低,就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJ、PDF等文件中提取全部文本的方法,简便快捷,效率很高。从不同格式的文件中提取文本前需要做好以下准备工作,安装CAJViewer5.5浏览器软件和acrobat5专业版浏览器软件安装Office2003,并完全安装Office工具MicrosoftOfficeDocumentI
。MicrosoftOfficeDocumentImage可以非常准确的全文件识别转化中文、英文、表格。
一、CAJ文件的识别
(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。
(二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。
(三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为MicrosoftOfficeDocumentI
(四)保存打印文件(*.prn)到适当位置。等待打印完成后,MicrosoftOfficeDocumentI
(五)在MicrosoftOfficeDocumentI
(六)选择“工具”下的“将文本发送到word”,最后将把整个CAJ文件识别输出到word文件中。
PDF文件的识别
(一)以文本形式保存的PDF文件,用acrobat5专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。
(二)以图片形式保存的PDF文件,将PDF文件打印到MicrosoftOfficeDocumentI
(三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),2)进行。
(四)繁体PDF文件用上述步骤2)的方法识别到word后,用word中的“工具”→“语言”→“中文繁简转换”
超星文件的识别
(一)全文件识别打印到MicrosoftOfficeDocumentI
(二)超星文件识别相对比较麻烦一些,如果还有问题,可以先把超星打印成完整的PDF文件,然后再用上述识别PDF文件的方法转成Word。
四、后记
经过试验,发现MicrosoftOfficeDocumentI
(caj,PDF,超星,维普............)中文字提取,如大家常用的caj,超星,维普............只需要两个软件VIRTUALPRINTER;尚书六号,先装一个VIRTUALPRINTER(虚拟打印机)打成OCR软件(我用的是尚书六号)可识别的图像格式(如jpg)之后,就可以提取其中的文字了。这个方法尤其对于有些caj(转成PDF什么也看不清楚的caj)特别有效。从不同格式的文件中提取文本前需要做好以下准备工作,安装CAJViewer5.5浏览器软件和acrobat5专业版浏览器软件安装Office2003,并完全安装Office工具MicrosoftOfficeDocumentI
使用MicrosoftOfficeDocumentImageWriter虚拟打印机
1、前提需要完全安装Office2003-Office工具-MicrosoftOfficeDocumentI
完全安装方法:在添加删除程序里,选择office2003,点击更改,出现了office2003安装修改界面,选择-更改删除-下一步-高级选项-office工具里找到MicrosoftOfficeDocumentI
2、以最麻烦的超星文件为例。(建议安装ssreader3.8版本,因为3.9版对虚拟打印有限制)
在3.8版本中使用虚拟打也需要一点前期工作,点击控制面板-打印机,列表中看到MicrosoftOfficeDocumentI
3、在MicrosoftOfficeDocumentImaging打开文件中选择:工具-使用OCR识别文本。注意,如果一次打印的超星页数较多,ocr识别会花较长时间。等待OCR识别完毕,选择:工具-将文本发送到word-保存。
其他:如果是pdf或caj文件,打开文件后直接选择:打印-打印页数……等等同2、3步骤。