Computation and Language,Artificial Intelligence,Human-Computer Interaction,Machine Learning,محاسبات و زبان , هوش مصنوعی , تعامل انسان و رایانه , یادگیری ماشین ,
توضیحات
Submitted 13 September, 2024; v1 submitted 6 September, 2024; originally announced September 2024.
توضیحات به فارسی
ارسال شده 13 سپتامبر 2024 ؛V1 ارسال شده در 6 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Generating user intent from a sequence of user interface (UI) actions is a core challenge in comprehensive UI understanding. Recent advancements in multimodal large language models (MLLMs) have led to substantial progress in this area, but their demands for extensive model parameters, computing power, and high latency makes them impractical for scenarios requiring lightweight, on-device solutions with low latency or heightened privacy. Additionally, the lack of high-quality datasets has hindered the development of such lightweight models. To address these challenges, we propose UI-JEPA, a novel framework that employs masking strategies to learn abstract UI embeddings from unlabeled data through self-supervised learning, combined with an LLM decoder fine-tuned for user intent prediction. We also introduce two new UI-grounded multimodal datasets, "Intent in the Wild" (IIW) and "Intent in the Tame" (IIT), designed for few-shot and zero-shot UI understanding tasks. IIW consists of 1.7K videos across 219 intent categories, while IIT contains 914 videos across 10 categories. We establish the first baselines for these datasets, showing that representations learned using a JEPA-style objective, combined with an LLM decoder, can achieve user intent predictions that match the performance of state-of-the-art large MLLMs, but with significantly reduced annotation and deployment resources. Measured by intent similarity scores, UI-JEPA outperforms GPT-4 Turbo and Claude 3.5 Sonnet by 10.0% and 7.2% respectively, averaged across two datasets. Notably, UI-JEPA accomplishes the performance with a 50.5x reduction in computational cost and a 6.6x improvement in latency in the IIW dataset. These results underscore the effectiveness of UI-JEPA, highlighting its potential for lightweight, high-performance UI understanding.
چکیده به فارسی (ترجمه ماشینی)
ایجاد هدف کاربر از دنباله ای از اقدامات رابط کاربری (UI) یک چالش اساسی در درک جامع UI است.پیشرفت های اخیر در مدل های بزرگ زبان چند حالته (MLLMS) منجر به پیشرفت قابل توجهی در این زمینه شده است ، اما خواسته های آنها برای پارامترهای مدل گسترده ، قدرت محاسبات و تأخیر زیاد باعث می شود که آنها برای سناریوهایی که نیاز به راه حل های سبک وزن دارند ، با تأخیر کم یا افزایش یافته ، غیر عملی باشد.حریم خصوصیعلاوه بر این ، فقدان مجموعه داده های با کیفیت بالا مانع از توسعه چنین مدل های سبک وزن شده است.برای پرداختن به این چالش ها ، ما UI-JEPA را پیشنهاد می کنیم ، یک چارچوب جدید که از استراتژی های ماسک برای یادگیری تعبیه های انتزاعی UI از داده های بدون برچسب از طریق یادگیری خودبوشی استفاده می کند ، همراه با یک رمزگذار LLM که برای پیش بینی قصد کاربر تنظیم شده است.ما همچنین دو مجموعه داده چند منظوره جدید UI با نام "قصد در وحشی" (IIW) و "هدف در رنگ آمیزی" (IIT) را معرفی می کنیم ، که برای کارهای درک UI چند عکس و صفر طراحی شده است.IIW از فیلم های 1.7K در 219 دسته هدف تشکیل شده است ، در حالی که IIT حاوی 914 فیلم در 10 دسته است.ما اولین خط مقدماتی را برای این مجموعه داده ها ایجاد می کنیم ، نشان می دهد که بازنمایی ها با استفاده از یک هدف به سبک JEPA ، همراه با یک رمزگذار LLM ، می توانند به پیش بینی های قصد کاربر دست یابند که مطابق با عملکرد MLLM های بزرگ و پیشرفته باشد ، اما با قابل توجهی کاهش یافته است.منابع حاشیه نویسی و استقرار.اندازه گیری شده توسط نمرات شباهت هدف ، UI-JEPA به ترتیب از GPT-4 Turbo و Claude 3.5 Sonnet به ترتیب 10.0 ٪ و 7.2 ٪ بهتر است ، به طور متوسط در دو مجموعه داده.نکته قابل توجه ، UI-JEPA با کاهش 50.5 برابر هزینه محاسباتی و بهبود 6.6 برابر در تأخیر در مجموعه داده IIW ، عملکرد را انجام می دهد.این نتایج تأکید می کند که اثربخشی UI-JEPA را نشان می دهد و پتانسیل آن را برای درک سبک وزن و با کارایی بالا نشان می دهد.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs