کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
In this paper we explore evaluation of LLM capabilities. We present measurements of GPT-4 performance on several deterministic tasks; each task involves a basic calculation and takes as input parameter some element drawn from a large well-defined population (e.g., count elements in a list, multiply two k-digit numbers, etc). We examine several conditions per-task and perform enough trials so that statistically significant differences can be detected. This allows us to investigate the sensitivity of task-accuracy both to query phrasing and input parameter population. We find that seemingly trivial modifications in the task-prompt or input population can yield differences far larger than can be explained by sampling effects. For example, performance on a simple list-counting task varies with query-phrasing and list-length, but also with list composition (i.e., the thing-to-be-counted) and object frequency (e.g., success when an element accounts for $\approx$ 50\% of a list is different from when it accounts for $\approx$ 70\% etc). We conclude that efforts to quantify LLM capabilities easily succumb to the language-as-fixed-effect fallacy, where experimental observations are improperly generalized beyond what the data supports. A consequence appears to be that intuitions that have been formed based on interactions with humans form a very unreliable guide as to which input modifications should ``make no difference'' to LLM performance.
چکیده به فارسی (ترجمه ماشینی)
در این مقاله ما ارزیابی قابلیت های LLM را بررسی می کنیم.ما اندازه گیری عملکرد GPT-4 را در چندین کار قطعی ارائه می دهیم.هر کار شامل یک محاسبه اساسی است و به عنوان پارامتر ورودی برخی از عناصر گرفته شده از یک جمعیت بزرگ تعریف شده (به عنوان مثال ، عناصر شمارش در یک لیست ، ضرب دو شماره k رقمی و غیره) را می گیرد.ما چندین شرایط را در هر کار بررسی می کنیم و آزمایشات کافی را انجام می دهیم تا از نظر آماری تفاوت معنی داری تشخیص داده شود.این به ما اجازه می دهد تا حساسیت به دقت کار را هم برای پرس و جو در مورد عبارت و جمعیت پارامتر ورودی بررسی کنیم.ما می دانیم که اصلاحات به ظاهر بی اهمیت در جمعیت کار یا جمعیت ورودی می تواند اختلافات بسیار بزرگتر از آنچه را می توان با اثرات نمونه گیری توضیح داد ، به همراه آورد.به عنوان مثال ، عملکرد در یک کار شمارش لیست ساده با جستجوی پرس و جو و طول لیست متفاوت است ، اما همچنین با ترکیب لیست (یعنی چیز به شمارش) و فرکانس شی (به عنوان مثال ، موفقیت وقتی یک عنصر برای آن حساب می کند$ \ تقریبا 50 $ \ ٪ یک لیست متفاوت از زمانی است که با قیمت \ $ 70 \ \ ٪ و غیره حساب می کند).نتیجه می گیریم که تلاش برای تعیین کمیت قابلیت های LLM به راحتی در معرض مغایر با زبان-به عنوان اثر ثابت قرار می گیرد ، جایی که مشاهدات تجربی به طور نادرست فراتر از آنچه از داده ها پشتیبانی می کنند ، تعمیم داده می شوند.در نتیجه به نظر می رسد که شهودهایی که بر اساس تعامل با انسان شکل گرفته اند ، یک راهنمای بسیار غیرقابل اعتماد تشکیل می دهند که در آن تغییرات ورودی باید "هیچ فرقی ایجاد کند" برای عملکرد LLM.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs