اسم النموذج: ArCode-BERT v0.1
تم تطويره بواسطة: ArCode-Standard
نوع النموذج: BERT لتصنيف التسلسلات (Sequence Classification)
اللغة: العربية
الترخيص: Apache 2.0
النموذج الأساسي: aubmindlab/bert-base-arabertv2
على Hugging Face: arcode-standard/arcode-bert-v0.1
ArCode-BERT هو نموذج لغة عربية متخصص في المجالات التقنية.
تم ضبطه انطلاقاً من نموذج AraBERTv2 لمهمة تصنيف النصوص متعددة الفئات.
هذا هو الإصدار الأول (v0.1) من النموذج، ويركز على تصنيف النصوص التقنية العربية عبر 18 فئة.
- تصنيف النصوص التقنية العربية
- يمكن استخدامه كأساس لمهام معالجة لغة عربية تقنية أكثر تخصصاً
- يمكن دمجه في أنظمة أكبر
- غير مخصص للنصوص غير العربية
- غير مصمم لمهام توليد النصوص أو الإجابة على الأسئلة
تم تدريب النموذج على مجموعة بيانات عربية متوازنة تحتوي على 18 فئة تقنية.
تم التقييم على مجموعة اختبار متوازنة (1800 عينة):
| المقياس | النتيجة |
|---|---|
| الدقة (Accuracy) | 87.33% |
| F1 Macro | 87.28% |
| Precision Macro | 87.32% |
| Recall Macro | 87.33% |
- معظم الفئات حققت أداءً قوياً (F1 أعلى من 90%)
- الفئات 1 و 8 و 16 أظهرت أداءً أضعف نسبياً، وسيتم التركيز على تحسينها في الإصدارات القادمة
from transformers import AutoModelForSequenceClassification, AutoTokenizer
import torch
model_name = "arcode-standard/arcode-bert-v0.1"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)
text = "نص عربي هنا"
inputs = tokenizer(text, return_tensors="pt", truncation=True, padding=True)
with torch.no_grad():
outputs = model(**inputs)
prediction = torch.argmax(outputs.logits, dim=-1).item()
print("الفئة المتوقعة:", prediction)- يختلف الأداء بين الفئات
- بعض المجالات التقنية ممثلة بشكل أفضل من غيرها
- قد ينخفض الأداء على النصوص الخارجة عن المجال أو النصوص المشوشة