Dirbtinio intelekto (DI) sugeneruoti atvaizdų aprašymai padeda užtikrinti vaizdinio turinio prieinamumą regos negalią turintiems Lietuvos audiosensorinės bibliotekos vartotojams.
„Neurotechnology“ sukūrė DI paremtą atvaizdų aprašymo sprendimą, padedantį skaitymo sunkumų turintiems žmonėms lengviau naudotis vaizdiniu turiniu skaitmeniniuose Lietuvos audiosensorinės bibliotekos (LAB) leidiniuose.
- 300 000+ potencialių vartotojų su skaitymo negalia Lietuvoje
- DI generuoti aprašai lietuvių kalba
- Platesnis prieinamumas prie švietimo, mokslo ir kultūros leidinių
- Adaptuota ekrano skaitymo programinei įrangai
potencialių vartotojų su skaitymo negalia
Lietuvoje
aprašai lietuvių kalba
prieinamumas prie švietimo, mokslo
ir kultūros leidinių
programinei įrangai
LAB siekė, kad skaitmeninių leidinių vaizdinis turinys taptų suprantamesnis ir prieinamesnis platesniam vartotojų ratui. Nors tekstinį turinį jau gali apdoroti įvairios pagalbinės technologijos, vizualiniai elementai dažnai lieka neprieinami. Taip ribojama prieiga prie edukacinės, mokslinės ir kultūrinės medžiagos.
Pasak LAB, daugiau nei 300 000 Lietuvos gyventojų dėl įvairių sutrikimų negali skaityti įprastai spausdinto teksto, o šiuo metu tik apie 20 proc. per metus šalyje išleidžiamų knygų užtikrina skaitančiųjų poreikius.
„Neurotechnology“ sukurtas sprendimas yra projekto „ELVIS – pritaikytų medijų platforma: prieigos prie įtraukaus kultūros turinio individualių poreikių turintiems vartotojams plėtra“ dalis. Jis integruojamas į LAB valdomą ELVIS sistemą – virtualią biblioteką, siekiant paspartinti prieinamų leidinių rengimą.
Sprendimas, laimėjus Lietuvos audiosensorinės bibliotekos (LAB) viešąjį pirkimą, jau integruojamas į bibliotekos sistemą ir bus teikiamas iki 2031 metų. Automatizavus dalį vaizdų aprašymo proceso, šis sprendimas leidžia sumažinti rankinio darbo apimtį, pagreitinti prieinamų leidinių rengimą ir padėti užtikrinti nuoseklią kokybę.
Prieš vykdydama viešąjį pirkimą, LAB atliko išsamią iliustracijų aprašams generuoti skirtų įrankių analizę.
Lietuvos audiosensorinės bibliotekos direktorės pavaduotoja, projekto vadovė
Kaip kuriami DI paremti aprašai
Šiame sprendime naudojamas kompiuterinio regėjimo, optinio simbolių atpažinimo (angl., Optical Character Recognition, OCR) ir didžiųjų kalbos modelių (angl., Large Language Model, LLM) technologijų derinys. Kompiuterinio regėjimo algoritmai atpažįsta vaizdo elementus, o optinis simbolių atpažinimas išskiria jame esantį tekstą. Vėliau šią informaciją apdoroja kalbos modeliai, kurie sukuria išsamius aprašymus lietuvių kalba.
Sujungus vaizdų analizę ir natūralios kalbos generavimą į vieną procesą, sistema gali automatiškai paversti iliustracijas ir kitą vaizdinį turinį tekstiniais aprašymais, kuriuos gali apdoroti ekrano skaitymo programinė įranga.
Ši technologija taip pat gali padėti skaitytojams, turintiems disleksiją, atpažindama ir išskirdama vaizdiniuose elementuose esantį tekstą, įskaitant pavadinimus ir citatas.
Sistema sukurta apdoroti įvairių tipų vaizdinę medžiagą, įskaitant:
- Iliustracijas – Įrankis atpažįsta pagrindinius objektus, žmones, scenas ir vaizdinius elementus, o tada juos paverčia struktūrizuotu tekstiniu aprašymu.
- Diagramas ir schemas – Dirbtinio intelekto sprendimas gali interpretuoti vaizdines struktūras ir apibūdinti pagrindinius diagramų ar schemų komponentus.
- Žemėlapius ir istorinę vaizdinę medžiagą – Sudėtingą vaizdinę medžiagą, pavyzdžiui, istorinius žemėlapius ar mokomąsias iliustracijas, galima apibūdinti taip, kad vartotojams būtų lengviau suprasti esminę informaciją.
- Meno kūrinius ir kultūrinį turinį – Išsamūs aprašymai gali nurodyti meno kūrinio žanrą, dominuojančias spalvas, nuotaiką ar meninę kryptį.
„Neurotechnology“ NLP komandos vadovas
Taip vaizdinė informacija, kurią anksčiau reikėdavo pritaikyti rankiniu būdu, gali būti automatiškai paverčiama aprašymais lietuvių kalba, didinančiais edukacinio, mokslinio ir kultūrinio turinio prieinamumą.
Pagalba rengiant prieinamas publikacijas
LAB specialistai, jau naudojantys „Neurotechnology“ sprendimą, kaip vieną iš jo privalumų išskiria gebėjimą atsižvelgti į kontekstinę informaciją kuriant iliustracijų aprašymus.
LAB informacinių technologijų specialistas, prieinamumo ekspertas
Prieinamesnis turinys pasitelkiant DI
Projekto su LAB pavyzdys rodo, kaip dirbtinis intelektas gali padėti gerinti informacijos prieinamumą ir kurti įtraukesnę skaitmeninę aplinką.
Projektas atliepia platesnius prieinamumo tikslus Europoje ir Lietuvoje, kur vis didesnis dėmesys skiriamas tam, kad skaitmeninės paslaugos ir elektroniniai leidiniai būtų prieinami visiems vartotojams, nepriklausomai nuo jų individualių poreikių. Nuo 2025 m. birželio 28 d. elektroninėms knygoms Lietuvoje taikomi teisės aktuose nustatyti prieinamumo reikalavimai.
Nors ši sistema sukurta lietuvių kalbai, ta pati technologija gali generuoti aprašymus ir kitomis kalbomis, todėl ji tinka leidėjams ir švietimo turinio teikėjams, veikiantiems skirtingose šalyse.
Viešojo sektoriaus įstaigoms, bibliotekoms ir leidėjams automatizuotas vaizdų aprašymas taip pat gali padėti įgyvendinti skaitmeninio prieinamumo reikalavimus, įskaitant Europos prieinamumo akto ir žiniatinklio turinio prieinamumo gairių (angl., Web Content Accessibility Guidelines, WCAG) reikalavimus.
„Neurotechnology“ kuria viešojo ir privataus sektorių organizacijoms skirtus dirbtinio intelekto sprendimus, paremtus natūralios kalbos apdorojimu, kompiuterine rega ir kitomis DI technologijomis.
Projektas „ELVIS – pritaikytų medijų platforma: prieigos prie įtraukaus kultūros turinio individualių poreikių turintiems vartotojams plėtra“ finansuojamas Ekonomikos gaivinimo ir atsparumo didinimo plano „Naujos kartos Lietuva“ lėšomis.
