Az OpenAI bejelentette, hogy szűkíti és szabályozza az értékelési környezeteket, hogy a benchmarkpontszámok jobban a modellek valódi intelligenciáját tükrözzék. A lépés célja a mérési torzítások csökkentése és az összehasonlíthatóbb teljesítményértékelés biztosítása, különösen automatikus és emberi értékelések esetén.
OpenAI szigorítja az értékelési környezeteket, hogy jobban tükrözze a modellek intelligenciáját
Az OpenAI bejelentette, hogy szűkíti és szabályozza az értékelési környezeteket, hogy a benchmarkpontszámok jobban a modellek valódi intelligenciáját tükrözzék.



