[
https://issues.apache.org/jira/browse/TIKA-4903?page=com.atlassian.jira.plugin.system.issuetabpanels:comment-tabpanel&focusedCommentId=18116859#comment-18116859
]
Hudson commented on TIKA-4903:
------------------------------
SUCCESS: Integrated in Jenkins build Tika ยป tika-main-jdk17 #1653 (See
[https://ci-builds.apache.org/job/Tika/job/tika-main-jdk17/1653/])
TIKA-4903: accept tesseract script models by their bare name (#3194) (github:
[https://github.com/apache/tika/commit/cbd93cd8e4eb87abd5ae1734af8b7b40772106ff])
* (edit) CHANGES.txt
* (edit) docs/modules/ROOT/pages/configuration/parsers/tesseract-ocr-parser.adoc
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-ocr-module/src/test/java/org/apache/tika/parser/ocr/TesseractOCRConfigTest.java
* (edit)
tika-parsers/tika-parsers-standard/tika-parsers-standard-modules/tika-parser-ocr-module/src/main/java/org/apache/tika/parser/ocr/TesseractOCRConfig.java
> Extend language options for tesseract
> -------------------------------------
>
> Key: TIKA-4903
> URL: https://issues.apache.org/jira/browse/TIKA-4903
> Project: Tika
> Issue Type: Improvement
> Reporter: Tim Allison
> Priority: Trivial
> Fix For: 4.1.0
>
>
> Tesseract has language families that our current regex does not allow, such
> as "Latin". We should extend our regexes to cover more options.
--
This message was sent by Atlassian Jira
(v8.20.10#820010)