Back to Search Start Over

Computational Analysis of Printed Arabic Text Database for Natural Language Processing

Authors :
Bouressace, Hassina
Bouressace, Hassina
Source :
Cognitive Studies | Études cognitives; No. 23 (2023); Cognitive Studies | Études cognitives; Nr 23 (2023); 2392-2397
Publication Year :
2023

Abstract

A frequency dictionary of printed Arabic text is essential for natural language processing. It includes 1,251 XML files of Arabic documents collected from ten newspapers and magazines from different countries and created as the PATD database. A total of 2,344 articles were created with various structures: open vocabulary, multi-font, multi-size, and multi-style text. From these articles, 1,102,078 tokens, 19,926 sentences, and 1,000,000 words were extracted. This dictionary provides detailed information for each word, including English equivalents, usage statistics, usage distribution, and the most widely used terms. A thematic vocabulary list of the top words on various topics is also provided. This frequency dictionary is a useful resource of modern Arabic vocabulary for various specialists, students, and learners. The frequency dictionary is freely available to interested researchers on the webpage.<br />Słownik frekwencyjny bazy danych tekstów drukowanych w języku arabskim jest niezbędny do przetwarzania języka naturalnego. Baza danych tekstów drukowanych w języku arabskim (PATD) zawiera 1251 plików XML różnych dokumentów w języku arabskim pochodzących z dziesięciu gazet i czasopism z kilku krajów. Łącznie utworzono 2 344 artykuły o różnych strukturach: teksty z otwartym słownictwem, z wieloma czcionkami o różnej wielkości i reprezentujące różne style. Z tych artykułów wyodrębniono 1 102 078 tokenów, 19 926 zdań i 1 000 000 leksemów. Słownik frekwencyjny jest przydatnym źródłem współczesnego słownictwa arabskiego dla różnych specjalistów, studentów oraz uczniów. Jest udostępniony bezpłatnie dla zainteresowanych badaczy na stronie internetowej.

Details

Database :
OAIster
Journal :
Cognitive Studies | Études cognitives; No. 23 (2023); Cognitive Studies | Études cognitives; Nr 23 (2023); 2392-2397
Notes :
application/pdf, English
Publication Type :
Electronic Resource
Accession number :
edsoai.on1419247359
Document Type :
Electronic Resource