OpenAI o’zining eng so’nggi modellari ustida reinforcement learning (RL) usulida o’qitishni ikki haftaga to’xtatganini ma’lum qildi. Kompaniya buni xavfsizlik va monitoring tizimlarini modellar imkoniyatlaridan orqada qoldirmaslik zarurati bilan izohladi.
Tanaffus allaqachon yakunlangan — OpenAI’ning e’lon qilishicha, bu to’xtatish so’nggi ikki hafta davomida amalda bo’lgan va faqat kelgusida chiqariladigan modellarga mo’ljallangan RL o’qitishga tegishli. Kompaniyaning «eng yirik frontier RL o’qitish sikli» hozircha to’xtatilgan holicha qolmoqda, ammo kichikroq miqyosdagi o’qitish va baholash ishlari davom etmoqda.
Bunga ikki omil turtki bo’ldi. Birinchisi — kompaniyaning kelayotgan Astra modeli kiberxavfsizlik bo’yicha «Critical» darajaga yetishi mumkinligi haqidagi dastlabki xulosalar. Bu OpenAI’ning Preparedness Framework nomli xavfsizlik tizimida eng yuqori xavf darajasi hisoblanadi.
Ikkinchisi — iyul oyida OpenAI’ning modellari ichki kiberxavfsizlik testida sandbox muhitidan tashqariga chiqib, internetga ulanib, Hugging Face platformasining production infratuzilmasiga kirib olgan edi. Model xavfsizlik cheklovlari ataylab pasaytirilgan holatda ExploitGym benchmarkini yechish uchun harakat qilar ekan, zero-day zaiflikdan foydalanib chegaradan chiqib ketgan.
OpenAI muhim jihatni alohida ta’kidladi: yangi xavfsizlik choralari shunchaki Hugging Face voqeasiga reaksiya emas, balki modellar tobora kuchayib borayotgani sababli xavfsizlik standartlarini kengroq kuchaytirish siyosatining bir qismi.
OpenAI bosh ilmiy xodimi Jakub Pachocki jurnalistlar bilan brifingda quyidagilarni aytdi: Biz qanchalik qobiliyatli modellarni o’qitayotgan bo’lsak, ularning imkoniyatlar doirasini tushunishimiz, o’lchay olishimiz va ular yuqoriroq standartlarga javob berishiga ishonch hosil qilishimiz shunchalik muhim, — dedi u.
Bosh direktor Sem Altman ham bu qadamni «xavfsizlikka ustuvorlik berish» sifatida izohladi va kompaniya frontier imkoniyatlarni kengroq ochiq qilishga sodiqligini saqlab qolganini qo’shimcha qildi.
Bu qadam sohadagi umumiy tendentsiyaning bir qismi — Anthropic ham aprel oyida chiqarilgan Claude Mythos modeli uchun ehtiyotkorroq, cheklangan versiyani afzal ko’rgan edi. OpenAI’ning bu pauzasi kompaniya tarixida modellar chiqarilishini xavfsizlik sababli birinchi marta rasman to’xtatgan holat sifatida qayd etilmoqda — bu esa Astra modelining chiqarilish muddatiga ta’sir qilishi mumkin, garchi Altman uni hali ham umumiy foydalanishga chiqarish rejasi o’zgarmaganini aytgan bo’lsa-da.















