Technologia

LLMR & D

EraRAG: Nowa generacja systemów RAG dla dynamicznych zbiorów danych

W obliczu wciąż rosnących zbiorów danych, tradycyjne systemy wspierające duże modele językowe (LLM) zmagają się z efektywnością i skalowalnością. Naukowcy z Huawei, Hong Kong University of Science and Technology oraz WeBank przedstawiają EraRAG – innowacyjne podejście do Retrieval-Augmented Generation, zaprojektowane z myślą o dynamicznych, ciągle zmieniających się korpusach tekstowych.

Read More
BiznesProgramowanie

Anthropic wprowadza nowe limity na Claude Code: Koniec z nieograniczonym użytkowaniem i nadużyciami

Anthropic, twórca popularnego modelu językowego Claude, ogłosił wprowadzenie nowych, tygodniowych limitów użytkowania dla swojej usługi Claude Code. Decyzja ma na celu ograniczenie nadmiernego korzystania przez część użytkowników oraz walkę z nielegalnym odsprzedawaniem subskrypcji, co stanowi odpowiedź na rosnące wyzwania związane z zasobami obliczeniowymi.

Read More
ObrazR & DRozumowanie

GPT-4o widzi, ale czy rozumie? Analiza wizualnych kompetencji modeli multimodalnych

Najnowsze modele multimodalne, takie jak GPT-4o, Gemini i Claude, zrewolucjonizowały interakcję z AI, łącząc umiejętności językowe z przetwarzaniem obrazu. Jednak ich rzeczywiste zdolności do rozumienia wizualnego pozostają przedmiotem intensywnych badań. Analizy EPFL rzucają nowe światło na to, jak te modele radzą sobie z zadaniami typowo wizualnymi, wskazując ich mocne strony, ale i wyraźne ograniczenia w porównaniu ze specjalistycznymi systemami.

Read More
Gen AIR & D

VLM2Vec-V2: Nowe podejście do unifikacji wiedzy w modelach wizyjnych

Modele osadzania danych (embedding models) stanowią pomost między różnymi modalnościami, przekształcając zróżnicowane informacje multimodalne w ujednoliconą, gęstą przestrzeń reprezentacji. W ostatnich latach, głównie dzięki rozwojowi dużych modeli fundamentalnych, nastąpił znaczący postęp w tej dziedzinie. Istniejące modele multimodalne, choć zaawansowane, często opierają się na zbiorach danych, które nie odzwierciedlają pełnego spektrum wyzwań w świecie rzeczywistym. Badacze z Salesforce Research, UC Santa Barbara, University of Waterloo i Tsinghua University przedstawili VLM2Vec-V2, innowacyjne rozwiązanie dążące do unifikacji przetwarzania obrazów, wideo i dokumentów wizualnych w jednym, spójnym frameworku.

Read More