کتاب مهندسی توکن‌سازی برای مدل‌های زبانی بزرگ؛ از طراحی Tokenizer تا بهینه‌سازی هزینه و کیفیت LLM

انتخاب پلن

افزودنی‌های اختیاری

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 62,488 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

🎓 دوره آموزشی جامع

📚 اطلاعات دوره

عنوان دوره: دوره مهندسی توکن‌سازی برای مدل‌های زبانی بزرگ؛ از طراحی Tokenizer تا بهینه‌سازی هزینه و کیفیت LLM

موضوع کلی: هوش مصنوعی و پردازش زبان طبیعی

موضوع میانی: توکن‌سازی و پیش‌پردازش متن برای مدل‌های زبانی بزرگ

📋 سرفصل‌های دوره

  • 1. مفهوم توکن و نقش آن در مدل‌های زبانی بزرگ
  • 2. تفاوت کاراکتر، کلمه، زیرکلمه و توکن
  • 3. چرا LLMها به جای کلمات کامل از Tokenization استفاده می‌کنند
  • 4. تأثیر توکن‌سازی بر کیفیت و عملکرد مدل
  • 5. ساختار Vocabulary در Tokenizerها
  • 6. فرآیند تبدیل متن خام به توکن‌ها
  • 7. تبدیل توکن‌ها به شناسه‌های عددی
  • 8. Decoding و بازسازی متن از توکن‌ها
  • 9. چالش‌های Tokenization در زبان‌های مختلف
  • 10. توکن‌سازی زبان انگلیسی و الگوهای رایج
  • 11. توکن‌سازی زبان فارسی و ویژگی‌های خاص آن
  • 12. نیم‌فاصله و تأثیر آن بر Tokenization فارسی
  • 13. یونی‌کد و نقش آن در پردازش چندزبانه
  • 14. Normalization متن پیش از Tokenization
  • 15. مدیریت حروف بزرگ و کوچک در Tokenizer
  • 16. مدیریت فاصله‌ها، علائم نگارشی و کاراکترهای ویژه
  • 17. پردازش اعداد و رشته‌های عددی
  • 18. توکن‌سازی URL، ایمیل و شناسه‌ها
  • 19. مدیریت Emoji و نمادهای Unicode
  • 20. کنترل کاراکترهای نامرئی و متن‌های مخدوش
  • 21. Subword Tokenization چیست
  • 22. مروری بر الگوریتم BPE
  • 23. پیاده‌سازی و آموزش Tokenizer مبتنی بر BPE
  • 24. Unigram Language Model Tokenization
  • 25. مقایسه BPE، Unigram و روش‌های Subword
  • 26. WordPiece و تفاوت آن با BPE
  • 27. SentencePiece و کاربرد آن در LLMها
  • 28. Byte-Level BPE و مزایای آن
  • 29. Byte Tokenization و پوشش کامل Unicode
  • 30. انتخاب الگوریتم مناسب برای Tokenizer
  • 31. طراحی Vocabulary و تعیین اندازه آن
  • 32. Trade-off بین اندازه Vocabulary و طول توالی
  • 33. مدیریت Unknown Token و توکن‌های ناشناخته
  • 34. Special Tokens و کاربرد آن‌ها در LLM
  • 35. توکن‌های BOS، EOS، PAD و UNK
  • 36. توکن‌های مربوط به نقش‌ها و قالب‌بندی گفتگو
  • 37. Chat Template و ارتباط آن با Tokenization
  • 38. توکن‌سازی پیام‌های چندنقشی در مدل‌های چت
  • 39. Token Budget و محدودیت Context Window
  • 40. محاسبه تعداد توکن‌های یک متن
  • 41. تفاوت تعداد کلمات با تعداد توکن‌ها
  • 42. تأثیر Tokenization بر هزینه API مدل‌های زبانی
  • 43. بهینه‌سازی مصرف توکن در Promptها
  • 44. فشرده‌سازی متن برای کاهش Token Cost
  • 45. توکن‌سازی کدهای برنامه‌نویسی
  • 46. توکن‌سازی JSON و داده‌های ساختاریافته
  • 47. توکن‌سازی داده‌های جدولی
  • 48. توکن‌سازی متون علمی و تخصصی
  • 49. توکن‌سازی نام‌ها، اصطلاحات و موجودیت‌های نادر
  • 50. چالش Tokenization برای زبان‌های کم‌منبع
  • 51. Tokenization چندزبانه و Multilingual LLMs
  • 52. مقایسه کارایی Tokenizer در زبان‌های مختلف
  • 53. اندازه‌گیری Fertility و کارایی توکن‌سازی
  • 54. محاسبه میانگین تعداد توکن به ازای کلمه
  • 55. ارزیابی پوشش Vocabulary
  • 56. تحلیل Out-of-Vocabulary و Unknown Rate
  • 57. بررسی Fragmentation در Tokenization
  • 58. مقایسه Tokenizerها روی دیتاست واقعی
  • 59. طراحی دیتاست مناسب برای آموزش Tokenizer
  • 60. پاک‌سازی و Deduplication داده‌های آموزش Tokenizer
  • 61. تأثیر کیفیت داده بر Vocabulary
  • 62. مدیریت داده‌های چندزبانه در آموزش Tokenizer
  • 63. آموزش یک Tokenizer سفارشی
  • 64. استفاده از کتابخانه Hugging Face Tokenizers
  • 65. ساخت Vocabulary سفارشی با Python
  • 66. ذخیره و بارگذاری Tokenizer
  • 67. سازگاری Tokenizer با مدل زبانی
  • 68. تغییر Tokenizer و پیامدهای آن برای مدل ازپیش‌آموزش‌دیده
  • 69. افزودن توکن‌های جدید به Vocabulary
  • 70. Resize کردن Embeddingها پس از تغییر Vocabulary
  • 71. خطاهای رایج در طراحی Tokenizer
  • 72. Data Leakage در فرایند ساخت Tokenizer
  • 73. جلوگیری از ناسازگاری بین Training و Inference
  • 74. استانداردسازی Tokenization در Pipelineهای تولید
  • 75. تست واحد و تست رگرسیون برای Tokenizer
  • 76. Benchmark کردن سرعت Tokenizer
  • 77. Benchmark کردن مصرف حافظه Tokenizer
  • 78. مقایسه سرعت Tokenizerهای مختلف
  • 79. بهینه‌سازی Tokenizer برای پردازش حجیم
  • 80. Batch Tokenization و پردازش موازی
  • 81. Tokenization در Pipelineهای آموزش LLM
  • 82. Tokenization در Fine-Tuning و Instruction Tuning
  • 83. Tokenization در Retrieval-Augmented Generation
  • 84. تأثیر Tokenization بر Chunking در RAG
  • 85. Tokenization و محاسبه Context در RAG
  • 86. Tokenization و طراحی Promptهای چندزبانه
  • 87. Tokenization و مدل‌های Long Context
  • 88. تأثیر Tokenization بر کیفیت خروجی مدل
  • 89. رابطه Tokenization با Attention و طول Sequence
  • 90. Trade-off بین کیفیت، سرعت و هزینه
  • 91. اصول طراحی یک Tokenizer حرفه‌ای برای LLM
  • 92. پروژه نهایی: طراحی و ارزیابی Tokenizer سفارشی برای فارسی و چندزبانه

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.