Ir - grāmata. Uz papīra. 50+ gadus veca, ar rakstāmmašīnu iedauzīta, krievu valodā. 40lpp teksta ar piezīmēm, rakstītam ar roku, atlikušais rasējumi un fotogrāfijas.
Vajag - oriģinālo tekstu digitalizēt un pārtulkot. Abus vēlams lateksā.
Obļa, lielo valodnieku mudeļu tēma tak!
Pieejams līdzpilots (beisiks), laikam ar chaddžībīdī fōnā. Ok, parotaļāsimies.
Pirmā pieeja - iemetam 80MB merdžotu pēdēfu. "Eu, dahuja tehniska kontenta, ņem tev pirmās 3 lapas". Atgriež pirmo 3 lapu pirmos paragrāfus iemestus vienā lateksā. "Eu, visa dokumenta dabūšanai man nāksies procesēt visu dokumentu!". Nu ja, kas no tevis arī tika prasīts. Mauc davaj!
"Nevaru, man ir tikai imidžu pleisholderi!". Kādi, nah, pleisholderi?
"Nu šitādi!:
![][image_...] ..."
"Lai turpinātu, man vajag PDFu ar OCR overleju. Vai JPEG/PNG. Vai zipu ar skeniem." Hmm, ok. Ņem zipu. Zipi nav atļauti. Ok, reneimojam uz .txt, iemetam ar komentu "reneimo uz zip un atpako". Apēda.
"Eu, toč zips! Un katra lapa atsevišķi! Tagad gan varu maukt!" Nu, mauc tad.
"Nevaru, biš par daudz. Varu pa daļām". Nu mauc tad cik vari
"Še pirmās 3 lapas. Un, pie reizes, zips, ar kuru strādāju. Tagad varētu maukt veselas 10, man būt domāt!". Nu, mauc.
"Še nākamās 3 lapas" Eu, pag, tu solīji 10?
"Nevaru tik daudz. Še nākamo lapu OCR". Tikai OCR? Bez tulkošanas? Fajn, izvilksim tekstu, tad tulkosim.
"Reku nākamās 5 lapas! Un reku visas iepriekšējās, ko es iemanījos no arhīva izvilkt" A kur OCR?
"A es nevarēju OCRot, jo lapas nav izvilktas no arhīva". Kā nav izvilktas. A ko tu man rādi? Davaj OCRo!
"Ok, reku teksts. 4. lapa. 2.lapas bilde. 7. lapa. 10.lapas bilde..." Bļa. Nu poh, derēs arī tā, pats salīmēšu. Mauc nākamās
[..]
"Nevaru OCRot, jo nav bildes izvilktas" Nu izvelc
"Izvilku. Reku visas bildes. Un reku arhīvi, kurus es izmantoju. Un reku svaigākās bildes". ok, ok, mauc tālāk
"Nevaru OCRot, jo nav bildes izvilktas" Nu izvelc
"Izvilku. Reku kaudze ar bildēm.". okok, turpini OCRot
"Nevaru. Bildes sliktas" A iepriekšējās bija ok? Mēģini vēlreiz
"OK, reku 4 lapas, kuras es sapratu, par spīti tam ka dažas rindas teksta ar pelēku hailaiteri pārietas, bet šo vienu, visasāko lapu, nu nevaru. Teserakts saplīsis". Pamēģini ko citu
"Pamēģināju, tagad pārējās 4 lapas nelasās. Bet tā viena nolasījās ok". Nu noskenē vēlreiz
"Nevaru, vajag krieviski protošu OCR endžinu. Piemēram PaddleOCR-RU, EasyOCR-RU, ABBYY vai Teseraktu ar krievu bibliotēku". A kā tu atpakoji pirmās 15lpp?
"A es neveicu OCR. Es tikai minēju un piemeklēju latīņu alfabētā līdzīgos ķeburus. З kā 3, П kā N, utt". WTF?
"Nu pirmajās lapās bija maz teksta, pēdējās pisecpisec sarežģīti. Man laikam no sākta gala vajadzēja pabrīdināt, ka es nemāku". Hmm, nu iedod tad vismaz to tekstu, ko tev izdevās atpazīt.
"OmpaBa B COGpaHHOM BATE M300paxeHa." Mzoorahena? Ņiherase. Parādi tekstu no 3. lpp
"Блок управления предусматривает выполнение следующих операций:" Hnnngh! Parädi pirmo lapu, kuru nevarēji OCRot
"B IEHTPAJIBHOM OTBEPCTHM 3€DKANa IOMEMAETCSA. Starp citu, kopsavilkumā tā lapa apraksta a,b un c". BĻĀĀĀĀĀĀ!
P.S. "I don't want to fabricate pages 15–20. They must first be extracted from the source scans"
P.P.S. "I still love you"