Samsung wprowadza TRUEBench: Nowy standard oceny produktywności modeli AI w biznesie
W miarę jak firmy na całym świecie coraz chętniej sięgają po modele językowe (LLM) w celu optymalizacji swoich operacji, pojawia się kluczowe pytanie: jak właściwie zmierzyć ich efektywność? Dotychczasowe metody oceny często bazowały na testach wiedzy ogólnej lub akademickiej, ograniczając się do języka angielskiego i prostych formatów pytań i odpowiedzi. Samsung, dostrzegając te niedoskonałości, opracował TRUEBench – Trustworthy Real-world Usage Evaluation Benchmark – aby zaoferować kompleksową ocenę LLM w oparciu o scenariusze i zadania bezpośrednio związane z realiami korporacyjnymi.
TRUEBench – co to takiego?
TRUEBench to wynik analizy wewnętrznego wykorzystania modeli AI w Samsungu. System ocenia funkcje takie jak tworzenie treści, analiza danych, streszczanie dokumentów i tłumaczenia, dzieląc je na 10 kategorii i 46 subkategorii. To pozwala na szczegółową ocenę produktywności AI.
„Samsung Research wnosi bogate doświadczenie i przewagę konkurencyjną dzięki swojemu doświadczeniu w AI w świecie rzeczywistym”, powiedział Paul (Kyungwhoon) Cheun, CTO działu DX w Samsung Electronics i szef Samsung Research. „Oczekujemy, że TRUEBench ustanowi standardy oceny produktywności”.
Multilingualność i realizm przede wszystkim
W przeciwieństwie do starszych benchmarków, TRUEBench opiera się na 2485 zróżnicowanych zestawach testowych w 12 językach, wspierając scenariusze międzyjęzykowe. To kluczowe dla globalnych korporacji, gdzie informacja przepływa przez różne regiony. Materiały testowe odzwierciedlają różnorodność żądań w miejscu pracy – od krótkich instrukcji po analizę dokumentów liczących ponad 20 000 znaków.
Samsung zdaje sobie sprawę, że w biznesie intencje użytkownika nie zawsze są wyrażone wprost. TRUEBench ocenia więc zdolność modelu AI do rozumienia ukrytych potrzeb, idąc dalej niż prosta dokładność i mierząc użyteczność i adekwatność.
AI w służbie jakości ocen
Samsung Research zastosował unikalny proces współpracy między ekspertami a AI w celu stworzenia kryteriów oceny produktywności. Ludzcy eksperci ustalają standardy, a następnie AI weryfikuje je pod kątem błędów, sprzeczności lub niepotrzebnych ograniczeń. Po uwzględnieniu opinii AI, eksperci doprecyzowują kryteria. Taka iteracyjna pętla zapewnia precyzję i odzwierciedlenie wysokiej jakości rezultatów.
Ten system minimalizuje subiektywizm charakterystyczny dla ocen dokonywanych wyłącznie przez ludzi, zapewniając spójność we wszystkich testach. TRUEBench stosuje model, w którym model AI musi spełnić wszystkie warunki testu, aby go zaliczyć. Takie podejście „wszystko albo nic” pozwala na dokładną ocenę wydajności AI w różnych zadaniach.
Transparentność i dostępność
Samsung udostępnił dane i tabele wyników TRUEBench na platformie open-source Hugging Face. Umożliwia to porównanie produktywności do pięciu modeli AI jednocześnie. Platforma oferuje przejrzysty przegląd wyników w zadaniach praktycznych. Dane obejmują również średnią długość odpowiedzi generowanych przez AI, co pozwala na porównanie wydajności i efektywności kosztowej.
Nowa era oceny AI
Wprowadzając TRUEBench, Samsung nie tylko wypuszcza kolejne narzędzie, ale dąży do zmiany sposobu myślenia o wydajności AI. Przesuwając akcent z wiedzy abstrakcyjnej na produktywność, TRUEBench może pomóc organizacjom w podejmowaniu lepszych decyzji dotyczących integracji modeli AI w ich procesach pracy, zmniejszając dystans między potencjałem a sprawdzoną wartością.
