Tesseract-OCR支持中文识别,并且开源和提供全套的训练工具,是快速低成本开发的首选。Tess4J则是Tesseract在Java上的应用。Tess4J的官网地址为:/
Tesseract的OCR引擎最先由HP实验室于1985年开始研发,至1995年时已经成为OCR业内最准确的三款识别引擎之一。然而,HP不久便决定放弃OCR业务,Tesseract也从此尘封。
数年以后,HP意识到,与其将Tesseract束之高阁,不如贡献给开源软件业,让其重焕新生--,Tesseract由美国内华达州信息技术研究所获得,并求诸于Google对Tesseract进行改进、消除Bug、优化工作。
tesseract-ocr的训练集可在/tesseract-ocr/tessdata在处进行下载,该训练集在进行图片文字识别时会被使用到