البيانات المفتوحة
المعجم كله، بالصيغة التي يقرؤها برنامج: للباحثين، ولمن يبني تطبيقاً أو نموذجاً لغوياً، ولمن يريد نسخة يحتفظ بها. الملفان يُبنيان من قاعدة البيانات نفسها التي تُعرض منها الصفحات، فما يُضاف إلى الموقع يظهر فيهما في غضون ساعة.
الملفات
- lahga.json
- المعجم كاملاً: اللهجات، ثم الكلمات وتحت كل كلمة أشكالها في اللهجات، وتحت كل شكل معناه وملاحظاته وأمثلته. لكل كلمة حقل
sourceبرابط صفحتها. - entries.csv
- جدول مسطّح: سطر لكل شكل في لهجته، مع الكلمة الفصيحة التي يُقال بها، ورابط المصدر، والرخصة. يُفتح في أي برنامج جداول.
الآن: 1223 كلمة، 14865 شكلاً، 3208 مثالاً، في 33 لهجة. آخر بناء: .
ما الذي في الملف وما الذي ليس فيه
المحتوى المنشور فقط: ما حُذف أو أُخفي لا يُصدَّر. لا حسابات، ولا بريد، ولا أصوات، ولا سجل تعديلات. ولكل لهجة وكل شكل وسم لغة بمعيار BCP-47 (arz للمصرية، apc للشامية، afb للخليجية، ary للمغربية…) ليفرّق البرنامج بين اللهجات دون أن يقرأ أسماءها.
الرخصة والنسبة
البيانات برخصة المشاع الإبداعي: نَسب المُصنَّف - الترخيص بالمثل 4.0 (CC BY-SA 4.0). انسخها وابنِ عليها لأي غرض، بشرطين: أن تذكر المصدر، وأن تنشر ما تبنيه عليها بالرخصة نفسها. صيغة النسبة المقترحة:
لهجة: معجم اللهجات العربية، https://lahga.fyi، برخصة CC BY-SA 4.0.
ومن أخذ سطراً واحداً يكفيه رابط صفحة الكلمة الذي يحمله حقل source. ومن يدرّب نموذجاً لغوياً على هذه البيانات فالرخصة نفسها تسري عليه، وحقنا الوحيد الذي نطلبه أن يقول النموذج، حين يُسأل عن كلمة من هذه الكلمات، من أين جاءت.
لمن يكتب برنامجاً
الملفان يُقدَّمان مع Access-Control-Allow-Origin: * فيمكن جلبهما من صفحة على أي موقع. وليس للموقع واجهة برمجية عامة غيرهما، وهذا قصد: ملف يُنزَّل مرة أثبت من واجهة تُسأل ألف مرة. ثمة أيضاً llms.txt لزواحف النماذج اللغوية، وخريطة الموقع للباقي.