[ 
https://issues.apache.org/jira/browse/TIKA-4903?page=com.atlassian.jira.plugin.system.issuetabpanels:comment-tabpanel&focusedCommentId=18116859#comment-18116859
 ] 

Hudson commented on TIKA-4903:
------------------------------

SUCCESS: Integrated in Jenkins build Tika ยป tika-main-jdk17 #1653 (See 
[https://ci-builds.apache.org/job/Tika/job/tika-main-jdk17/1653/])
TIKA-4903: accept tesseract script models by their bare name (#3194) (github: 
[https://github.com/apache/tika/commit/cbd93cd8e4eb87abd5ae1734af8b7b40772106ff])
* (edit) CHANGES.txt
* (edit) docs/modules/ROOT/pages/configuration/parsers/tesseract-ocr-parser.adoc
* (edit) 
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-ocr-module/src/test/java/org/apache/tika/parser/ocr/TesseractOCRConfigTest.java
* (edit) 
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-ocr-module/src/main/java/org/apache/tika/parser/ocr/TesseractOCRConfig.java


> Extend language options for tesseract
> -------------------------------------
>
>                 Key: TIKA-4903
>                 URL: https://issues.apache.org/jira/browse/TIKA-4903
>             Project: Tika
>          Issue Type: Improvement
>            Reporter: Tim Allison
>            Priority: Trivial
>             Fix For: 4.1.0
>
>
> Tesseract has language families that our current regex does not allow, such 
> as "Latin". We should extend our regexes to cover more options.



--
This message was sent by Atlassian Jira
(v8.20.10#820010)

Reply via email to