الذكاء الاصطناعي والبياناتمبتدئ
Tokenization
النطقتوكين-آي-زيشن
التعريف
هي عملية تقسيم النصوص الخام إلى وحدات أصغر تُسمى "Tokens" (مثل الكلمات، أجزاء الكلمات، أو الحروف). تُعد هذه الوحدات اللبنات الأساسية التي تستخدمها نماذج الذكاء الاصطناعي اللغوية لمعالجة وفهم البيانات المدخلة.
أين تسمعه؟
في النقاشات المتعلقة بحدود الإدخال في النماذج اللغوية الكبيرة (LLMs)، وخطوات معالجة البيانات، وإعدادات تدريب النماذج.
أمثلة
The model failed because the input text exceeded the maximum tokenization limit.
فشل النموذج لأن النص المدخل تجاوز الحد الأقصى لعملية الـ Tokenization.Our preprocessing script handles tokenization before sending the data to the API.
يقوم سكربت المعالجة المسبقة لدينا بإجراء الـ Tokenization قبل إرسال البيانات إلى الـ API.
خطأ شائع
الاعتقاد بأن الـ Token الواحد يساوي دائماً كلمة واحدة، بينما في الواقع تقوم معظم أدوات الـ Tokenization الحديثة بتقسيم الكلمات إلى أجزاء أصغر للتعامل مع المفردات المعقدة.
واصل الاستكشاف
المزيد في الذكاء الاصطناعي والبيانات