ترجمه فارسی مقاله ارزیابی مدل‌های زبان بزرگ با رقابت‌های بازی مبتنی بر شبکه: یک معیار و تابلوی برتر LLM توسعه‌یافته

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard
عنوان مقاله به فارسی ارزیابی مدل‌های زبان بزرگ با رقابت‌های بازی مبتنی بر شبکه: یک معیار و تابلوی برتر LLM توسعه‌یافته
نویسندگان Oguzhan Topsakal, Colby Jacob Edell, Jackson Bailey Harper
فرمت مقاله انگلیسی PDF
تعداد صفحات 26
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Artificial Intelligence,Computation and Language,Machine Learning,Neural and Evolutionary Computing,هوش مصنوعی , محاسبات و زبان , یادگیری ماشین , محاسبات عصبی و تکاملی ,
توضیحات Submitted 10 July, 2024; v1 submitted 10 July, 2024; originally announced July 2024.
توضیحات به فارسی 10 ژوئیه 2024 ارسال شد.V1 ارسال شده 10 ژوئیه 2024 ؛در ابتدا ژوئیه 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

We introduce a novel and extensible benchmark for large language models (LLMs) through grid-based games such as Tic-Tac-Toe, Connect Four, and Gomoku. The open-source game simulation code, available on GitHub, allows LLMs to compete and generates detailed data files in JSON, CSV, TXT, and PNG formats for leaderboard rankings and further analysis. We present the results of games among leading LLMs, including Claude 3.5 Sonnet and Claude 3 Sonnet by Anthropic, Gemini 1.5 Pro and Gemini 1.5 Flash by Google, GPT-4 Turbo and GPT-4o by OpenAI, and Llama3-70B by Meta. We also encourage submissions of results from other LLMs. In total, we simulated 2,310 matches (5 sessions for each pair among 7 LLMs and a random player) across three types of games, using three distinct prompt types: list, illustration, and image. The results revealed significant variations in LLM performance across different games and prompt types, with analysis covering win and disqualification rates, missed opportunity analysis, and invalid move analysis. The details of the leaderboard and result matrix data are available as open-access data on GitHub. This study enhances our understanding of LLMs' capabilities in playing games they were not specifically trained for, helping to assess their rule comprehension and strategic thinking. On the path to Artificial General Intelligence (AGI), this study lays the groundwork for future exploration into their utility in complex decision-making scenarios, illuminating their strategic thinking abilities and offering directions for further inquiry into the limits of LLMs within game-based frameworks.

چکیده به فارسی (ترجمه ماشینی)

ما یک معیار جدید و گسترده برای مدل های بزرگ زبان (LLMS) از طریق بازی های مبتنی بر شبکه مانند Tic-Tac-Toe ، Connect Four و Gomoku معرفی می کنیم.کد شبیه سازی بازی منبع باز ، موجود در GitHub ، به LLMS اجازه می دهد تا به رقابت بپردازند و پرونده های داده مفصلی را در قالب های JSON ، CSV ، TXT و PNG برای رتبه بندی های رهبری و تجزیه و تحلیل بیشتر تولید می کنند.ما نتایج بازی ها را در بین LLM های پیشرو ، از جمله Claude 3.5 Sonnet و Claude 3 Sonnet توسط Anthropic ، Gemini 1.5 Pro و Gemini 1.5 Flash توسط Google ، GPT-4 Turbo و GPT-4O توسط Openai و Llama3-70B توسط متا ارائه می دهیم.ما همچنین ارسال نتایج از سایر LLM ها را تشویق می کنیم.در کل ، ما 2،310 مسابقه (5 جلسه برای هر جفت در بین 7 LLM و یک پخش کننده تصادفی) در سه نوع بازی ، با استفاده از سه نوع سریع سریع: لیست ، تصویر و تصویر شبیه سازی کردیم.نتایج نشان داد که تغییرات قابل توجهی در عملکرد LLM در بازی های مختلف و انواع سریع ، با تجزیه و تحلیل شامل نرخ پیروزی و رد صلاحیت ، تجزیه و تحلیل فرصت از دست رفته و تجزیه و تحلیل حرکت نامعتبر است.جزئیات داده های ماتریس رهبری و نتیجه به عنوان داده های دسترسی باز در GitHub در دسترس است.این مطالعه درک ما از توانایی های LLMS را در انجام بازی هایی که به طور خاص برای آنها آموزش دیده نبود ، تقویت می کند و به ارزیابی درک قانون و تفکر استراتژیک آنها کمک می کند.در مسیر اطلاعات عمومی مصنوعی (AGI) ، این مطالعه زمینه را برای اکتشافات آینده در ابزار آنها در سناریوهای پیچیده تصمیم گیری ، روشن کردن توانایی های تفکر استراتژیک آنها و ارائه راهنمایی برای تحقیق بیشتر در مورد LLM ها در چارچوب های مبتنی بر بازی ارائه می دهد.بشر

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.