مدل هوش مصنوعی Jev توانسته بازی کلاسیک Pokémon Red را در کمتر از یک هفته به پایان برساند و پس از شکست Elite Four و Champion وارد Hall of Fame شود.
طبق صفحه رسمی این آزمایش، Jev در ۲۳ سپتامبر ۲۰۲۶ بازی را به پایان رساند. بااینحال، این موفقیت کاملاً مستقل نبود؛ Claude Opus 5 گزارش بازی را زیر نظر داشت و در مواقعی که Jev در مسیر اشتباه گیر میکرد، ساختار گزینههای پیش روی آن را اصلاح میکرد.
Jev بازی Pokémon Red را در کمتر از یک هفته تمام کرد
در این آزمایش، Jev کنترل تصمیمگیریهای بازی را بر عهده داشت و براساس اطلاعات موجود، از میان گزینههای مشخصشده یکی را انتخاب میکرد.
درنهایت این مدل موفق شد Elite Four و Champion را شکست دهد و وارد Hall of Fame شود؛ اتفاقی که در ۲۳ سپتامبر ثبت شد.
تیم نهایی Jev شامل Lapras سطح ۶۰، Pidgeot سطح ۵۲، Gloom سطح ۳۸، Raticate سطح ۳۸، Graveler سطح ۷۴ و Machoke سطح ۴۲ بود.

Jev یک چتبات معمولی نیست
Jev محصول شرکت TypeSafe AI است و برخلاف مدلهای زبانی بزرگی مانند Claude یا ChatGPT برای تولید پاسخهای متنی طراحی نشده است.
این مدل در دستهای قرار میگیرد که TypeSafe آنها را System One Models مینامد. Jev بهجای تولید رشتههای متنی، از میان خروجیهای ازپیشتعریفشده تصمیم میگیرد و برای هر تصمیم میزان اطمینان ارائه میکند.
TypeSafe میگوید این ساختار برای خودکارسازی نرمافزار و تصمیمگیری سریع طراحی شده و Jev خروجیهای ساختاریافتهای ارائه میدهد که برنامهها میتوانند مستقیماً از آنها استفاده کنند.
Claude Opus 5 نقش مربی Jev را بازی میکرد
نکته مهم این آزمایش این است که Jev بهتنهایی تمام فرایند را مدیریت نکرد.
طبق صفحه رسمی پروژه، گیمپلی توسط Jev انجام میشد، اما Claude Opus 5 وظیفه نظارت بر گزارش بازی و ساخت آنی Harness را بر عهده داشت.
هر زمان Jev در یک مسیر نامناسب گیر میکرد، Opus 5 میتوانست گزینههای موجود یا نحوه بیان آنها را تغییر دهد تا مدل تصمیمگیری مسیر مناسبتری پیدا کند.
بنابراین Claude مستقیماً دکمههای بازی را کنترل نمیکرد، اما در نقش یک لایه نظارتی و مربی به Jev کمک میکرد.
کاربران چت هم در آزمایش نقش داشتند
انسانها نیز بهطور کامل از حلقه این آزمایش حذف نشده بودند.
بینندگان میتوانستند از طریق چت پیشنهادهایی ارائه کنند و پیشنهادهای مفید در برخی موارد برای بهبود گزینههایی که Jev در اختیار داشت استفاده میشدند.
به همین دلیل، پایان Pokémon Red را نمیتوان صرفاً نتیجه عملکرد مستقل یک مدل دانست؛ بلکه این پروژه ترکیبی از تصمیمگیری Jev، نظارت Claude Opus 5 و بازخورد انسانی بود.
چرا این آزمایش برای Jev اهمیت دارد؟
TypeSafe، Jev را مدلی برای تصمیمگیری سریع و ساختاریافته معرفی کرده است، نه جایگزینی مستقیم برای چتباتها.
اجرای Pokémon Red نمونهای نمایشی از این ایده است؛ Jev مجبور نیست توضیح طولانی تولید کند، بلکه در هر مرحله از میان گزینههای موجود تصمیم میگیرد.
موفقیت این آزمایش نشان میدهد مدلهای تخصصی تصمیمگیری میتوانند در کنار مدلهای زبانی بزرگ بهصورت ترکیبی استفاده شوند؛ جایی که یک مدل تصمیمهای سریع میگیرد و مدل قدرتمندتر نقش نظارت و اصلاح را بر عهده دارد.





دیدگاهها