Artykuł Attention Is All You Need z 2017 roku wprowadził architekturę transformera, przełomową koncepcję stojącą za współczesnymi systemami AI, takimi jak ChatGPT, Claude czy Gemini. Zastępując powolne, sekwencyjne przetwarzanie mechanizmami uwagi, Transformery sprawiły, że sztuczna inteligencja stała się szybsza, bardziej równoległa i znacznie lepsza w rozumieniu języka, obrazów i dokumentów.
Najważniejsze wnioski:
- Transformery przetwarzają wszystkie słowa naraz, a nie jedno po drugim, umożliwiając znacznie szybszą i dokładniejszą AI.
- Mechanizm uwagi pomaga AI zrozumieć kontekst i relacje w całych danych wejściowych jednocześnie.
- Ta sama architektura transformera, która napędza chatboty, jest również napędem dla narzędzi Vision AI oraz przetwarzania dokumentów, takich jak Parseur.
Artykuł z 2017 roku, Który Umożliwił ChatGPT
W 2017 roku zespół ośmiu badaczy z Google opublikował artykuł naukowy z bardzo odważnym tytułem: "Attention Is All You Need". W tamtym czasie brzmiało to niemal prowokacyjnie. Większość systemów AI wciąż polegała na starszych podejściach, które przetwarzały język krok po kroku, słowo po słowie.
Jednak ten artykuł wprowadził coś zupełnie nowego: architekturę transformera.
Zespół, w skład którego wchodzili Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser i Illia Polosukhin, pracował wówczas w Google Brain. Wielu z nich założyło od tego czasu własne duże firmy zajmujące się sztuczną inteligencją, co daje pewne wyobrażenie o kalibrze badaczy stojących za tym jednym artykułem.
Siedem lat później, Transformery zasilają niemal każdy większy przełom w AI, z którego dziś korzystamy, w tym ChatGPT, Claude, Gemini, DALL-E, Whisper, a także systemy Vision AI stojące za platformami do przetwarzania dokumentów takimi jak Parseur.
Ten jeden artykuł zmienił sposób, w jaki maszyny rozumieją język, obrazy, dokumenty, a nawet mowę.
Jeśli kiedykolwiek zastanawiałeś się, jak współczesne narzędzia AI potrafią streszczać teksty, odpowiadać na pytania, wyodrębniać dane z faktur czy rozumieć skomplikowane dokumenty, odpowiedź niemal zawsze zaczyna się od Transformerów.
W tym przewodniku wyjaśniamy, jaki problem rozwiązały Transformery, jak działa mechanizm uwagi w prostych słowach, dlaczego Transformery przewyższyły starsze architektury AI oraz jak Transformery zasilają nowoczesne systemy do przetwarzania dokumentów i Vision AI.
Bez równań. Dyplom z informatyki nie jest wymagany. Tylko praktyczne wyjaśnienia, rzeczywiste przykłady i jasne spojrzenie na przełom, który stał się fundamentem współczesnej AI.
Jak AI Przetwarzała Język Dawniej (I Dlaczego To Było Powolne)
Przed pojawieniem się architektury transformera, która zmieniła AI, większość modeli językowych polegała na klasie modeli zwanych Rekurencyjnymi Sieciami Neuronowymi (RNN).
RNN zostały zaprojektowane do przetwarzania języka słowo po słowie, w sekwencji. Na pierwszy rzut oka brzmi to rozsądnie, ponieważ ludzie również czytają zdania po kolei. To podejście stworzyło jednak poważne ograniczenia, które spowolniły postęp w dziedzinie sztucznej inteligencji na lata.
Oto prosty przykład: "Kot siedział na macie."
RNN przetwarzałoby to zdanie w ten sposób: czyta "Kot", przetwarza, zapisuje w pamięci, następnie czyta "siedział", przetwarza, pamięta "Kot siedział", potem czyta "na", i tak dalej, kontynuując słowo po słowie, dopóki zdanie się nie skończy.
Wszystko działo się sekwencyjnie. Każde nowe słowo było uzależnione od wcześniejszego zakończenia poprzedniego kroku.
To był główny problem.
Nowoczesne procesory graficzne (GPU) są niezwykle potężne, ponieważ potrafią przetwarzać wiele operacji jednocześnie. Jednak RNN nie mogły w pełni wykorzystać tej mocy, ponieważ zmuszały model do przemieszczania się przez tekst krok po kroku, niczym osoba powoli czytająca zdanie ze światłem latarki.
Stworzyło to główne wąskie gardło pod względem prędkości: trenowanie modeli AI zajmowało dni, a nawet tygodnie, skalowanie do większych zestawów danych stało się niezwykle kosztowne, długie dokumenty były trudne do wydajnego przetworzenia, a budowa aplikacji działających w czasie rzeczywistym była trudniejsza.
Ale prędkość nie była jedynym problemem. RNN miały również trudności z pamięcią.
Wyobraź sobie takie zdanie: "Kot, który siedział na macie, którą moja babcia dała mi na urodziny w zeszłym roku, spał."
Zanim model dotrze do słowa "spał", ważny podmiot, "kot", znajduje się już bardzo daleko w sekwencji.
To przykład tzw. zależności długodystansowych. W miarę jak słowa stają się coraz bardziej od siebie oddalone, RNN mają coraz trudniejsze zadanie zachowania połączenia między nimi, ponieważ informacje muszą przejść przez wiele sekwencyjnych kroków, co sprawia, że odległe zależności są trudniejsze do przyswojenia i utrzymania.
W praktyce oznaczało to, że starsze systemy AI często gubiły kontekst w długich akapitach, skomplikowanych dokumentach, tekstach technicznych, rozmowach i wielostronicowych plikach.
Problem stał się jeszcze bardziej widoczny w procesach sztucznej inteligencji związanych z przetwarzaniem dokumentów. Numer faktury na górze strony mógł wymagać powiązania z sumami na samym dole. Klauzula w umowie mogła odnosić się do warunków opisanych kilka akapitów wcześniej. Modele sekwencyjne miały trudności z niezawodnym utrzymywaniem tych relacji.
Badacze próbowali ulepszać RNN przy pomocy nowszych architektur takich jak LSTMs i GRUs, ale podstawa ograniczenia pozostała bez zmian: język był wciąż przetwarzany sekwencyjnie.
Ten sekwencyjny projekt stworzył podstawową barierę prędkości i pamięci, której nowoczesna sztuczna inteligencja nie mogła przeskoczyć.
Wtedy, w 2017 roku, nadeszła architektura transformera i zmieniła wszystko.
Co Jeśli Przetwarzalibyśmy Wszystkie Słowa Naraz?
Przełom stojący za architekturą transformera był zaskakująco prosty: a gdyby sztuczna inteligencja w ogóle nie przetwarzała języka słowo po słowie?
Zamiast czytać zdania sekwencyjnie jak starsze modele RNN, Transformery analizują wszystkie słowa jednocześnie i określają, które słowa mają dla siebie największe znaczenie.
Pomysł ten zyskał miano mechanizmu uwagi. Mechanizm uwagi to technika uczenia maszynowego, która kieruje modele do skupienia się na najbardziej istotnych częściach wejścia, co tłumaczy, dlaczego jest on tak ważny w systemach opartych na Transformerach.
Aby zrozumieć, jak to działa, warto pomyśleć o tym, jak ludzie naturalnie rozumieją kontekst. Weźmy na przykład słowo "bank". Słowo to może oznaczać bardzo różne rzeczy w zależności od zdania.
"Bank nad rzeką jest stromy." Tutaj "bank" (z ang. brzeg rzeki) łączy się z "rzeką" i staje się pojęciem geograficznym.
"Bank zatwierdził moją pożyczkę." Tutaj "bank" łączy się z "pożyczką" i staje się pojęciem finansowym.
Ludzie od razu rozumieją różnicę, ponieważ nasze mózgi automatycznie łączą "bank" z pobliskimi wskazówkami kontekstowymi. Mechanizm uwagi w Transformerze działa w podobny sposób.
Zamiast traktować słowa niezależnie, model bez przerwy ocenia relacje pomiędzy słowami i decyduje, które powiązania są najważniejsze dla zrozumienia znaczenia. Model przypisuje większą wagę słowom, które mają największe znaczenie dla obecnego słowa lub zadania, zamiast przypisywać każdemu słowu taką samą ważność.
Staje się to szczególnie skuteczne w dłuższych zdaniach. Zgodnie z IBM, mechanizm uwagi "koncentruje się na tych słowach, które są najbardziej istotne dla następnego przetłumaczonego słowa", co zwiększa dokładność i obsługę długich ciągów znaków.
Rozważmy: "Kot, który siedział na macie, spał."
Starsze modele RNN często miały tu trudności, ponieważ "kot" i "spał" są oddzielone wieloma słowami. Transformery radzą sobie z tym jednak zupełnie inaczej.
Wykorzystując uwagę, "spał" zwraca bezpośrednią uwagę na słowo "kot", "siedział" powiązane jest ze słowem "kot", aby zrozumieć podmiot, a "mata" związana jest z "siedział", aby nadać kontekst lokalizacji. Powiązania te następują natychmiastowo w obrębie całego zdania. Nie trzeba czekać, aż poprzednie słowa skończą się przetwarzać.
Użyteczną analogią jest zaznaczanie tekstu podczas czytania. Kiedy ludzie czytają, naturalnie skupiamy się na najistotniejszych słowach: rzeczownikach połączonych z czynnościami, podmiotach połączonych z czasownikami, odniesieniach połączonych z wcześniejszym kontekstem. Twój mózg robi to automatycznie i niemal natychmiast. Uwaga daje AI podobną umiejętność.
Oto kluczowa różnica w tym, jak każde podejście przetwarza 100-wyrazowe zdanie:
Przetwarzanie RNN: Słowo 1, przetwarzanie, Słowo 2, przetwarzanie, Słowo 3, przetwarzanie. Wszystko odbywa się krok po kroku. Zdanie złożone ze 100 słów wymaga 100 sekwencyjnych operacji.
Przetwarzanie za pomocą Transformera: Wszystkie słowa, analiza uwagi, zrozumienie kontekstu. Wszystko odbywa się jednocześnie. Zdanie złożone ze 100 słów może być przetwarzane równolegle.
Ta przewaga w postaci przetwarzania równoległego była ogromna. Nowoczesne karty GPU są zbudowane tak, aby obsłużyć tysiące operacji na raz. Transformery ostatecznie umożliwiły systemom AI wydajne i pełne wykorzystanie tej mocy sprzętowej.
Rezultatem było diametralnie szybsze trenowanie, lepsze rozumienie długich kontekstów, ulepszona skalowalność i wyższa wydajność w zadaniach językowych.
Dlatego właśnie Transformery gwałtownie wyparły starsze architektury w całej branży AI. Ten sam mechanizm uwagi zasila teraz modele językowe takie jak ChatGPT, systemy Document AI, narzędzia do tłumaczenia, rozpoznawania mowy, platformy Vision AI i systemy do generowania obrazów.
Rozkładamy Transformera na Cztery Kluczowe Elementy
Architektura transformera może początkowo wydawać się onieśmielająca. Jednak główne koncepcje są tak naprawdę zaskakująco intuicyjne, gdy tylko zrezygnuje się ze specjalistycznego technicznego żargonu.
Na wysokim poziomie, Transformery polegają na czterech głównych komponentach pracujących razem: uwadze własnej, uwadze wielogłowicowej, kodowaniu pozycyjnym i sieciach feed-forward. Razem te komponenty pozwalają nowoczesnym systemom AI zrozumieć relacje, kontekst, znaczenie i strukturę znacznie efektywniej niż starsze architektury AI.
Element 1: Uwaga Własna (Trzon Innowacji)
Najważniejszą koncepcją w architekturze transformera jest uwaga własna (self-attention).
Uwaga własna pozwala każdemu słowu w zdaniu spojrzeć na każde inne słowo i zdecydować, które z nich ma największe znaczenie. To jest właśnie sercem mechanizmu uwagi.
Wyobraź sobie zdanie: "Kot siedział na macie."
Przetwarzając słowo "kot", model nie patrzy tylko na pobliskie słowa. Jednocześnie ocenia całe zdanie. Wewnętrznie, Transformer zadaje trzy pytania dla każdego słowa.
Query (Zapytanie): "Jakich informacji szukam?"
Key (Klucz): "Jakie rodzaje informacji oferuję?"
Value (Wartość): "Jakie rzeczywiste informacje niosę?"
Można to potraktować jako system dobierania w pary (matchmakingu) dla słów. W przypadku słowa "kot", Zapytanie (Query) pyta, jakie relacje mają znaczenie, model porównuje to zapytanie z Kluczami (Keys) każdego innego słowa, a silne dopasowania zyskują na uwadze.
Zatem "kot" może silnie zwrócić uwagę na "siedział" (relacja akcji) i "macie" (relacja lokalizacji), a słabo zwrócić uwagę na mniejsze słowa funkcyjne jak "na", które nadal mają znaczenie, ale znacznie mniejsze.
W rezultacie model tworzy pełniejsze zrozumienie dla słowa "kot", nie jako wyizolowanego słowa, lecz jako "kot, który siedział na macie".
Uwaga własna rozwiązała wiele poważnych problemów w tym samym czasie: każde słowo może bezpośrednio połączyć się z każdym innym słowem, długodystansowe relacje są zachowywane, przetwarzanie ma miejsce równolegle, a zrozumienie kontekstu diametralnie wzrasta. To jeden z głównych powodów, dla których Transformery błyskawicznie prześcignęły starsze architektury RNN.
Element 2: Uwaga Wielogłowicowa (Wiele Perspektyw)
Jeden mechanizm uwagi jest potężny. Jednakże badacze zdali sobie sprawę z czegoś bardzo istotnego: w języku występują różne rodzaje powiązań. Pojedyncza warstwa uwagi mogłaby skupić się silnie na gramatyce, ale stracić znaczenie kontekstowe. Dlatego architektura transformera wprowadziła uwagę wielogłowicową (multi-head attention).
Zamiast stosowania jednego systemu uwagi, Transformery uruchamiają wielorakie mechanizmy uwagi jednocześnie. Nazywa się to głowami uwagi (attention heads). Możesz myśleć o nich jako o licznych specjalistach analizujących to samo zdanie z wielu perspektyw.
Jedna głowa uwagi może skupić się na gramatyce: podmiotach, czasownikach i strukturze zdania. Inna głowa skupia się na znaczeniu semantycznym: "kot" jako zwierzę, "mata" jako przedmiot. Jeszcze inna skupia się na pozycji: które słowa występują wcześniej lub później. Kolejna skupia się na odniesieniach: "to" odnoszące się do słowa "kot".
Przydatną analogią jest podziwianie obrazu z wielu różnych kątów widzenia. Jeden z kątów ukazuje odpowiednie barwy. Kolejny odkrywa teksturę. A jeszcze inny ukazuje głębię. Dopiero razem te perspektywy pozwalają na pełniejsze zrozumienie. Właśnie w taki sposób działa mechanizm uwagi wielogłowicowej.
Ta warstwowa struktura pojmowania jest jednym z głównych powodów, dla których nowoczesne systemy sztucznej inteligencji potrafią wygenerować odpowiedzi, które wydają się być sensowne, kontekstowe i zadziwiająco wręcz podobne do ludzkiego pojmowania świata.
Element 3: Kodowanie Pozycyjne (Zachowanie Kolejności Słów)
Przy przetwarzaniu równoległym wystąpiło jedno olbrzymie wyzwanie. Skoro Transformery przetwarzają wszystkie słowa w tym samym czasie, jak są w stanie rozpoznać szyk i układ słów?
Rozważmy: "Pies gryzie człowieka." i "Człowiek gryzie psa." Te same słowa, lecz zupełnie inne znaczenia.
I tu z pomocą nadchodzi kodowanie pozycyjne (positional encoding). Transformery nakładają informacje na temat pozycji dla każdego słowa przed tym, zanim rozpocznie się proces analizy. Słowo 1. otrzymuje jeden sygnał pozycyjny, słowo 2. otrzymuje kolejny, i tak dalej. To zezwala systemowi na zachowanie informacji na temat układu i sekwencji mimo jednoczesnego przeprowadzania procesu przetwarzania.
Prostą analogią są znaczniki czasu na zdjęciach. Bez znaczników czasu wiesz, co się wydarzyło, ale nie w jakiej kolejności. Z ich pomocą możesz zrekonstruować ramy czasowe. Kodowanie pozycyjne daje Transformerom to samo poczucie porządku.
Staje się to ekstremalnie istotne przy strukturze słownej, nadawaniu odpowiedniego znaczenia, gramatyce, chronologii i poprawnym interpretowaniu budowy dokumentów. Bez pojęcia związanego z informacjami na temat układu słów, zrozumienie języka szybko by się załamało.
Element 4: Sieci Feed-Forward (Doskonalenie Rozumienia)
Po zebraniu kontekstu przez warstwy uwagi, transformer nadal musi udoskonalić i wzmocnić swoje zrozumienie. Taka jest rola sieci feed-forward (feed-forward network).
Możesz myśleć o tym kroku jako o szlifowaniu interpretacji. Uwaga identyfikuje relacje. Warstwy feed-forward pomagają przekształcić te relacje w bogatsze reprezentacje wewnętrzne. Model wielokrotnie poprawia swoje zrozumienie tego, co każde słowo reprezentuje w kontekście.
Proces tego doskonalenia pozwala Transformerom radzić sobie jeszcze lepiej ze zgadywaniem i przewidywaniem, rozumowaniem, kategoryzowaniem, wyciąganiem wniosków, jak i podsumowywaniem. Każda z warstw dodaje więcej głębi kontekstowej.
Wyjaśnienie Kompletnej Architektury Transformera
Złóżmy to wszystko w jedną całość.
Oryginalna architektura transformera wprowadzona w artykule "Attention Is All You Need" używała struktury enkoder-dekoder. Każda połowa ma konkretne zadanie.
Enkoder: Zrozumienie Wejścia
Zadaniem enkodera jest zrozumienie dostarczanego tekstu. Otrzymuje on wejściowe zdanie, nakłada mechanizm uwagi własnej, aby zrozumieć powiązania między wszystkimi słowami, używa udoskonaleń typu feed-forward i powtarza proces kilkukrotnie. Każda warstwa pozwala zbudować coraz to bogatsze zrozumienie pod względem kontekstowym. Pod koniec tej drogi, enkoder produkuje dogłębne reprezentacje znaczeniowe całego wejścia, skupiając się nie tylko na pojedynczym znaczeniu każdego ze słów, lecz również na tym, jak całościowo odnoszą się one do ich odpowiedników.
Dekoder: Generowanie Wyniku
Zadaniem dekodera jest generowanie tekstu wyjściowego, jeden token po drugim, poprzez proces zwany dekodowaniem autoregresywnym. Działa to inaczej niż enkoder. Tam, gdzie enkoder przetwarza wszystkie dane wejściowe jednocześnie, dekoder generuje dane wyjściowe sekwencyjnie.
Dekoder osiąga to za sprawą trzech współdziałających ze sobą mechanizmów.
Maskowana uwaga własna: Dekoder przy generowaniu nowego słowa widzi tylko te, które już wygenerował, nie patrzy na przyszłe słowa. Takie maskowanie powstrzymuje model od "oszukiwania" w trakcie szkolenia (poprzez wybieganie przed szereg i podglądanie, co w dalszej części ma wyprodukować).
Uwaga krzyżowa: Dekoder skupia się również na wyjściu z enkodera (reprezentacjach wejściowych). Stanowi to pomost między zrozumieniem i generowaniem. Odnośnie do zadania opartego na tłumaczeniach, dekoder patrzy na zakodowane w pełni wyrażenie (źródło), by zadecydować, jak ma brzmieć (zostać wygenerowane) następne słowo. W przypadku odpowiedzi na konkretne pytanie dekoder skupia uwagę na zaszyfrowanym kontekście, w celu wysnucia należytej odpowiedzi.
Warstwy feed-forward: Ten sam krok udoskonaleń używany przy enkoderze ulepsza dekodery przed generowaniem każdego tokenu.
W praktyce generowanie tekstu wyjściowego przebiega w ten sposób: dekoder rozpoczyna ze specjalnym tokenem odpowiadającym za "start/początek", pochyla się nad wyjściowym efektem enkodera oraz samym tokenem, tworzy pierwsze wynikowe słowo i używa go potem jako nowe "wejście". Później zwraca uwagę na wynik enkodera (wyjście enkodera) i wszystkie uprzednio wytworzone słowa, generuje kolejny wyraz i zaczyna cały cykl od nowa dopóty, dopóki wygenerowany nie zostanie token odpowiadający za "koniec".
Ten sam fundamentalny proces napędza dzisiejsze potężne systemy AI. Kiedy zadajesz pytania na ChatGPT lub pytasz o coś Claude, dekoder posługuje się pojedynczymi wyrazami ze sformułowanej przez niego odpowiedzi "po jednym naraz", przypisując całą pulę "uwagi" twoim zapytaniom plus temu, co wytworzył sobie wcześniej.
Artykuł z 2017 roku posłużył się konstrukcją opartą o enkoder-dekoder specjalnie na poczet zastosowania go jako tłumacza maszynowego. Wiele nowoczesnych tworów (takich jak systemy GPT) wdraża struktury wyposażone wyłącznie w dekodery, ale reguła odpowiadająca za generowanie autoregresywne zainaugurowana we wzorcowej rozprawie zachowała swą centralną rolę w systemie działania współczesnych wielkich modeli językowych.
Trzy Powody, Dla Których Transformery Wyparły RNN
Kiedy w artykule Attention Is All You Need po raz pierwszy przedstawiono architekturę transformera, nie przyczyniła się ona jedynie do polepszenia i ulepszenia aktualnie panujących modeli sztucznej inteligencji. Gruntownie zmieniła ona sposób w jaki maszyny przetwarzają i radzą sobie z językiem. Porównując nową technologię do starych sieci opartych na RNN (Recurrent Neural Networks - Rekurencyjne Sieci Neuronowe), Transformery stały się zdecydowanie szybsze, dało się je lepiej uszeregować pod względem równoległym i w ogromnej mierze usprawniały one proces rozumienia ogółu znaczeniowego na podstawie wywnioskowanego kontekstu.
1. Przetwarzanie Równoległe Sprawia, że Transformery Są Znacznie Szybsze
Zanim nastał szczyt możliwości dla Transformerów, modele językowe uczyły się przetwarzania tekstu czytając każdy z wyrazów jeden po drugim. Dla RNN każde słowo było bezpośrednio powiązane od ukończenia procesu wczytania jego poprzednika. Rodziło to ogromne spowolnienia na skutek wąskiego gardła szybkości operacyjnej (szczególnie przez to, iż współczesne, mocne procesory GPU są budowane wprost do polepszania równoległych kalkulacji (w trybie równoległego przetwarzania, którego modele sekwencyjne wykorzystywały w bardzo słabym stopniu, a nie na pełnej mocy).
Transformery rozwiązały ten kłopot używając mechanizmu "uwagi" do przetwarzania wszystkich wyrazów naraz (równocześnie, o jednym czasie). Wynik był imponujący. Oryginalny artykuł pokazał to wyraźnie: wcześniejsze systemy tłumaczeń oparte na RNN często wymagały tygodni uczenia się, podczas gdy model oparty na Transformerach osiągał najnowocześniejsze wyniki w ciągu około 12 godzin na nowoczesnym sprzęcie. Uczenie stało się od 10 do 100 razy szybsze, procesory graficzne mogły być w pełni wykorzystane, a większe zestawy danych stały się praktyczne do trenowania.
Zwiększenie owych osiągów przyczyniło się do tego, iż olbrzymie twory związane ze środowiskiem powiązanym z dzisiejszym pojmowaniem SI (takie jak chociażby ChatGPT czy Gemini) stały się namacalne (jesteśmy wręcz w stanie swobodnie z nich korzystać).
2. Transformery Lepiej Rozumieją Długodystansowy Kontekst
Powszechnie znane systemy wparte o środowiska opatrzone nazwą RNN wielokrotnie zmagały się ze spadkiem płynności podczas tworzenia długodystansowych powiązań przy jednoczesnym uwzględnianiu połączeń ze słowami znajdującymi się zbyt daleko od danego zdania. Przykładowo: "Kot, który wylegiwał się nieopodal okna przez sporą część popołudnia, oglądając za oknem rozmaite gatunki ptactwa, zapadł w objęcia Morfeusza (usnął)."
Na czas dotarcia silnika opartego o system RNN do zwrotu "usnął" powiązanie tyczące się faktu, iż ma on coś połączyć (bo łączy się to ze słowem "kot") potwornie słabnie. Informacja wędrowała za długo z uwagi na zbyt wiele słów pośrednich po drodze. Na każdym z podanych powyżej w zdaniu kroków spora część całokształtu kontekstowego zaciera się bądź gubi, albo jest obiektywnie pomijana.
Transformery korzystają natomiast z faktu użycia mechanizmu "uwagi", po to aby wytworzyć swoiste spoiwa "tworzące zbitki powiązań między słowami (bezpośrednio ze sobą kojarzące odpowiednie wyrazy)". Opierając się na powyższym zdaniu: słowo "usnął" (spał) mogłoby naprowadzać od razu i bezpośrednio na "kota", "okno" mogłoby spinać się ze zjawiskiem "oglądania", tak jak i słowo "ptaki" może odnosić się z łatwością, i wpływać niemalże natychmiast, na otaczający kontekstowy środek zapisu. Wtedy nieistotne i błahe staje się to, z jak daleka dzieli się dane na temat słów znajdujących się w zdaniu. Relacja słowna wciąż zachowa swoją spójność.
Był to nie lada postęp (wspaniałe innowacyjne i gigantyczne przełamanie dotychczasowych barier i granic ludzkiej myśli w świecie nowoczesnych technologii), ponieważ to na nim opiera się potężny fundament językowy (czyli poleganie w sporym stopniu na pojęciach ze środowiska kontekstowego roztaczającego swoje żniwo poprzez długie pojęcia i frazy). Przysłużyło się to rzetelnej i sprawniejszej obsłudze dla długich rozporządzeń, różnego kalibru dokumentów, konwersacji ujętych w ramy słowne (np. ze znajomymi w social mediach), ugód opartych o środowiska prawne (spory sądowe), rozporządzeń i specyfikacji w ujęciu technicznym (technicznej dokumentacji), czy sprawnym pojęciu tego co nam się przedstawia ze spojrzeniem przez okulary opatrzone soczewkami pod znakiem "Wizji AI" (Vision AI). W dzisiejszych czasach największe modele ukształtowane w świecie mowy (języka obcego jak i potocznego) dają możliwość do przetwarzania wielu tysięcy znaków, pojęć słownych w jednym dużym ujęciu, za sprawą opisywanej architektury.
3. Transformery Skalują Się Wyjątkowo Dobrze
Tym samym dochodzimy do ostatniego powodu za jaki cenić należy wielki fenomen istnienia Transformerów, a jest to powalająca kwestia o jakże przyjemnej nazwie: "Skalowalność". Współczesne systemy AI drastycznie się poprawiają, gdy zwiększysz dane uczące, rozmiar modelu, długość kontekstu i moc obliczeniową. Transformery były do tego wyjątkowo przystosowane. Gdy sekwencje stają się dłuższe, RNN napotykają na rosnący czas przetwarzania i ograniczenia pamięci. Transformery mogą wydajnie obsługiwać długie sekwencje, zrównoleglać obciążenia robocze w procesorach graficznych, uczyć się na ogromnych zestawach danych i obsługiwać gigantyczne liczby parametrów.
I to właśnie owy fakt o istnieniu "Skalowalności" dał nam wielką szansę i potęgę stwarzającą moc napędową dla istnienia środowisk, takich jak: GPT-4, Claude, DALL-E, obecnego wcielenia "Vision AI", i wysoce rozwiniętych metod słuzących ujęciom dokumentowym (i posługiwaniu się nimi za pomocą narzędzi i zaawansowanych możliwości). Co więcej ujęcie skalowalności pozwoliło sztucznej inteligencji zaistnieć tak powszechnie w skali ogólnoświatowej z wyśmienitym zwrotem i ekonomicznym sukcesem, na pełną skalę.
Praktyczny artykuł od samego początku zaoferował świetne popisy i doskonałe ujęcia "Skalowalności" ubranej we wspaniałe wydanie charakteryzujące się najmniejszymi kosztami w poczet zużytych przeliczeń i nakładów finansowych. Spoglądając przez "lupę" na jakość wykonywanych translacji od maszyn i mechanizmów za dawnych czasów w skali o nazwie BLEU to wynosił on blisko: 26.3, a wraz z nadejściem Transformerów pobił swój szczyt windując o dwa oczka, aż do: 28.4 czyniąc to o wiele szybciej bez ogromnego zużywania zaplecza ekonomicznego. Wraz z połączeniem ulepszonych wyników rzutujących w poprawę trafności pod kątem statystycznym na polu bitwy, i co ważniejsze przyspieszonym uczeniem maszyny u boku o wiele zredukowanych nakładów kosztów oraz możliwości zastosowania na masową rynkową i docelową powszechną skalę - takowy układ zalet sprowadził rychło RNN ze wzniosłego piedestału oddając honory (w dziedzinie sztucznej inteligencji - AI) Transformerom.
Od Artykułu do ChatGPT: Rewolucja Transformera
Wydarzenie wypuszczenia do powszechnego użytku publikacji Attention Is All You Need ("Uwaga to wszystko, czego potrzebujesz") nie wpłynęła wyłącznie na zmianę i poprawę pod kątem procesów dla maszynowego sposobu tłumaczeń. Przełożyło się to i spuściło wodze porywistej powodzi zwanej potężną falą uderzeniową w ujęciu ewolucji (Rewolucji) Sztucznej Inteligencji tworząc gigantyczne odłamy w fundamentach dla nowopowstałego tworu stanowiącego za "Systemową Sztuczną Inteligencję Współczesną" - w taki sposób zapoczątkowując na tym padole jej rychłe wzniesienie się niczym potężnego, zrodzonego ze szczerych zgliszczy Fenixa (lub też powstającego z ziemi wielkiego Tytana).
2018-2019: Eksplozja Modeli Językowych
W tamtym okresie pierwsza fala adopcji (włączenia do swojego systemu pojęć ze strefy wywodzących się od Transformerów) uderzyła szeroko otwartymi wrotami u dużych twórców form modeli językowych.
GPT (OpenAI): Spółka o nazwie OpenAI stworzyła GPT ze szczerym użyciem zapożyczeń od architektury znanej dla modeli Transformerskich - u jej rdzeni (za sprawą jej publikacji z tamtego okresu). Pomysł polegał głównie na wytrenowaniu Transformera bazując na ogromnych złączonych pospołu dawkach pojęć i form tekstowych prosto ze środowisk "internetowych", i uwarunkowaniu tego tak, aby przyswoił on pojęcia wiążące się z: pisownią i gramatyką, prawdą a kłamstwem i faktycznym (prawdziwym) stanem rzeczy, rozumieniem prawideł wzorców oraz całego ogółu znaczeniowego opierającego się w dużej mierze (jako podmiot docelowy) o zagadnienia uwzględniające "kontekst" i na samym szarym końcu, odpowiednio go "ułożono i dostrojono" na poczet mniejszych potyczek w przyszłości (okazjonalne małe zadania do przerobienia). Wielkość na rzecz poszczególnych pokoleń z biegiem każdego kolejnego obrotu, co raz bardziej ulegała potężnemu napompowaniu powiększając się u modelu: GPT-1 z bazowej wielkości obnażonej przed 117-stu milionami opcji z jakich był w stanie wywnioskować (odnieść i pojąć) dany temat i zagadnienie (do ułożenia tego czego pragnął i oczekiwał człowiek stawiający mu te opcje), tak GPT-2 ukazał wybitny i przełamujący krok skacząc do bariery blisko: 1.5-ego (półtora) miliarda, po czym GPT-3 ukazał finalnie formę z iście ogromnym (niewiarygodnym wręcz wynikiem i zasobem, wyciągniętym spoza ram potęgi wszechrzeczy) rozmiarem zasobów określającym granice aż - 175-ciu (stu siedemdziesięciu pięciu) miliardów obiektywnych parametrów!
BERT (Google): Google poszło i ułożyło sobie w zamyśle co nieco inny plan budowy biorąc pod ramię twór za jakiego mieli się z ujęciem od (BERTa) nazwanym: BERT (Bidirectional Encoder Representations from Transformers - Dwukierunkowy Wymiar/Reprezentacje Kodowania z rąk (pomocy) "Transformerów" ). Odstąpili i zaaranżowali na inną formę odgadywania przewidywanych tekstów i fraz niż ten sam powszechnie stosowany, i obierany przy procesie tworzenia z ust pod kątem modeli od twórcy na ujęciu (GPT), a tym zrzeszeniem ułożyli (BERT) w zamyśle na zwracaniu uwagi i kładzeniu nakładu słów w każdych wytyczonych przednim torach o jednym czasie stosując do pomocy formę zaczerpniętą od strony "Encoderów/Kodowania ze świata Transformerów". Pomogło to rozwinąć znaczenie poprawnego i obfitego w bogatsze (i bardziej powiązane z pożądanymi słowami na podstawie zapytań wyszukiwań i ogółu "pytań - jak i odpowiadania na nie) form podług, całokształtu naturalnie oddającej się w ludzki i ogólny sens ramy w zjawisku zrzeszonego "Porozumiewania - Naturalnego Języka Ogółu, Zrozumienia/Rozumienia". Korporacja, jaka mieni się logiem - "Google" złożyła w oświadczeniu, że nowość pod postacią pojęcia nazwy z podanego zwrotu na cześć twórcy (czyli "BERT-a"), w głównej i gigantycznej wprost postaci przeistoczyło na dobro, jak układał się wykwit słów (w oparciu i zastosowaniu języka o podstawie powiązanej w strukturze "Języka Angielskiego/Anglosaskiego") jako najogólniejszy na użytek do "Przeszukiwania Sieci-Wyszukiwań", tak obficie na tym zyskując i wspierając przy tym sieć o potężniejsze oddziaływanie za sprawą opisywanego w tekście: "kontekstu, oraz docelowego ujścia zapytania podanego przedtem na wstępie intencji użytkownika, który to zadał takowe o to - zapytanie, (pytając)".
2020: Transformery Uczą się Widzieć
Do grupy założycieli (Badaczy i Wynalazców z tego świata) dotarło to w błyskawicznym (wybitnym okiem), stopniu - że twór z powiązaną strukturą działania do zwracania odpowiednich względów i mechanizmów na ujęcie (Mechanizmu Uwagi, "Uwagi") mogłoby odnajdować odłam dla samego siebie, nie gdzież inąd, niż jak również na przykładzie ujęcia względem - ilustracji/grafik bądź ujęcia przy wdrożeniu o zdjęcia i obrazy. W powiązaniu na tak potężne wyrokowanie tego osądu dał się pokłosiem i nowopowstałym ułożonym, wielkim objawieniem objawić (na świat i ukazać mu wyborną z form wywyższenia (wyłonienia się przed świat z wdrożeniem i zaaranżowaniem z ujęcia (Vision Transformers) tak zwane - (ViTs / Wizualne "Podglądowo-Obrazkowe" Transformery).
Odsuwając na boczny, tylny boczny ułożony gdzieś tam pod tylną rzeką plan na to, żeby traktować obrazy na względzie o tak samo znany ze starszej metody zrzut (układ punktów obrazu znanych nam ludziom pod szerokim i zwięzłym "Pikselowym Składzie", to Vision Transformers (z ujęć ukształtowanych do patrzenia przed wizerunkowo-wizualne (na wizerunki, formy rzutowania "środowisk wizualnych/grafiki", to owe podmioty: obdzierają to w drobniejsze w strukturze, małe szczeblowate układanki tworząc powiewne plamki u form w rzutowaniu (układając formy obrazka rzutując formami poszatkowanymi z obrazka i układając drobne, odłupane pod względem graficznym cząsteczki zrzeszające formy jako maleńkie "częstotliwości ułożone pod formę w łatwym "języku" jako swoiste "Plamki/Łatki" dając wizerunek każdej nowej - "Plamce", tworząc przy tym pojęcie jako nadane nowe (świeże) słowo z uwzględnieniem uwagi opierającej się przy każdym wykreowanym "plamkowym fragmencie ujęcia" i układającym pospołu w to - "wyśnione nowe układy". Pod tym pojęciem Transformer potrafi odnaleźć siebie dając popis u podstaw w ujęciach przestrzennych relacji na drodze i zrzutach rozlokowania oraz ustosunkowania odpowiednio w danych mu położeniach do - umiejscawiania odpowiednich form i figur na danych mu, docelowych obszarach do tego - uwarunkowanych (kontekst wizyjno - wizerunkowy w drodze opartych "obrazowych i wizualnych" - poszlak ze śladami, w poszanowaniu na wzorzec od opartych, nowopoznanych - metod (nowopowstałych "Wzorców ułożeniowych od podstaw"). Ten rzut dał mu obfite żniwo wywyższając go natychmiast na ogromnych podstawach przewagi wyrównując mu, a i nawet rzutem wyrównania wywyższył je nad poziom powszechnie stosowanego wcześniej standardu w modelowaniu pod kątem starszej opcji wizji rzutowej obrazu po stronie podmiotu "Komputerów, Modelu Zasadniczego o zjawisku, tzw. "Komputerowej/Elektronicznej Wizji Komputerowego Patrzenia przed siebie/Odczytywania obrazu komputerowym - Wzrokiem"). Z nadejściem ery na rzecz zjawiska od "Transformerów" zrzuciły za siebie stary garb stając czymś znacznie prężniej i wielko użytecznymi narzędziami bez stania na drodze przy ograniczaniu wyłącznie przed progiem pod sam ujęty model od pojęcia wytyczanego "Języka". Przistoczyły własny swój ubiór jako swoista zrzutowa (wspólna, jedna) Ogólna Uniwersalna i potężna Sztuczna Inteligencja z nową Formą swego: - Architekturą Utylizacyjną.
2022-2024: Era ChatGPT
Nowocześni pomagierzy obdarci ze skóry z ludzkich rąk - przy udziale Sztucznej Inteligentnej (Prawa), mają wbudowaną "swoją i nowocześnie zrzuconą" opcję z formy Transformerowej i ich: (wielko i nieodzownie, obfitych budulcowo) Fundamentowych Podstaw Ułożeniowych. Układy te rozprzestrzeniły bazową strukturę z oryginału wprowadzając je w roku: "Złotego - Dwutysięcznego Siedemnastego do rozmiaru i potęgi nienotowanych dotychczas ogromnych (wytwórczo) uwarunkowań docelowo: rzutujących z formami stąpającymi przy potędze, z obfitymi setkami rzędów miliardów i wielkich w ułożeniu - form, przy ułożeniu od ogromu opartych miliardów form w powiązaniach bazujących do i poprzez docelowe opcje i parametry z miliardami rzędu obiektywnych "Sieci - z pojęciem Internetu przy zrzucie danych - Zestawach od Treningów ze Szkołą (Uczenia w Zestawach Parametrów do - "Wczytywania Się") połączonymi z ogromem połączonych farm z układami w procesorach u - Kart (Od Strony potężnych Form Zrzutowych i Kart - "Karta GPU, czyli Procesor Graficzny/Klastrami od Graficznych Ujęć" GPU), z nieodzowną dawką form długofalowo zrzuconych potężnych i bezdennych okiem pamięci opartych - od: kontekstów do samej ułożonej Pamięci w formie zwanej jako "Okna Pamięci" od: (Zjawisk opierających formy u "Oko-Kontekstowych Zrzutów").
Claude (Anthropic) dokonał swoistego postępu polepszając umiejętności Transformera używając specjalnych odłamów wiązania za sprawą zjednoczenia struktur od Sztucznej formy ze słowami ubranymi w formę ukrytą i obdarzoną jako ułożenia, opartych z rzutu od Sztucznej opatrzonej zrzutem form z "Konstytucyjnych wyrównań opartych wyrównań rzędowo (układowych i wyrównawczych form u boku Prawicy od ujęć zrzeszonych pod formą Inteligencji Sztucznej wyrównań do, ekstremalnie form z długą pamięcią u boku - Pamięci Kontekstowej Otwierając tak - Okna), a i obnażając udoskonala zrzeszenie w racjonalnym zrozumieniu ogółu przy tworzeniu dogłębnych zjawisk związanych w pojęciu (Zrozumienia u boku na - Dokument).
Gemini (Google) wysunęło Transformerskie macki przekształcając całą podwalinę i wylewając wielkie zrzuty w rozmach (Rozsypując z ułożonym zaangażowaniem w pełni wyśnioną rzutowaną o obnażenie przy uwarunkowaniach "Systemów Multimodalnych" formujących to - do radzenia i obsługą sobie wybitnie przed takimi barierami jak: teksty z ujęciami przy graficznych ujęciach z rzutem o "Grafikę", układach posłuchu rzutach - (przy zjawisku, słuchania, form audio), z nagraniami (ruchomymi materiałami np. - przy wizyjnych - wideo/Video), z ich zaaranżowaniem, całościowo przed: dogłębną uwagą w obsłudze przy zrzeszonym, a w rzucie z uwagi o pojęciu ogółu rzutując i przetwarzając te obiektywne na pełną formę z ich wykorzystaniem u mechanizmów o strukturze zaangażowania o mechanizmach pod ujęciem formy: - Uwagi Zwróconej/Mechanizm Zwracania "Względów - Uwagi").
Od 2023 do Dziś: Wzrost Multimodalnej AI
Zjawiskiem po wielkim zrzucie opartych milowym przełomem stał on sam - rzut, jako zjawiskowo potężnym skokiem z nowym objawieniem przed tworem na nowym objawieniu z form zrzeszonych podrzutem o jedynym, z unikatową i formową zrzutową (formą jednolitym z formowanym: wspólnym Zjednoczeniem) modelarstwem. Formy powiązane takie jak u GPT-4 przy potyczkach o "GPT-4 Z podziałem - Wizji rzutowanej u modelu: "GPT-4 Vision", Claude pod skrzydłami - "3.5", tak jak i Gemini, radzą od dziś potwornie ogromnie z obiektywnym rzucie od pojęć pod znakiem radzenia formom powiązanych przy "Urzeczywistnieniu" rozstrzygającym: sensy o pojęciach - Tekstu jak i Ujęć Wizerunkowo Obrazowych od ujęcia pospołu obnażonych zjawiskiem podziału o obiektywnym (ujednoliconym zrzucie), potrafią pospołu zrozumieć pojęcia o zrzuconym od siebie ujęciu pod format: Obrazkowych Rzutów z form opartych w Ujęciu od Sieci pod formę jako - "Screenshot" podrzut (Zrzutów ekranów, zapisanych wycinków graficznych i okienek o obiektywnych "plikach - z zachowanych wizualnych ukrytych zapisach form - Zrzutowych (Print screen'ów), PDF-ów (Pod formę Zapisaną w pliku .pdf), ujęcia przed Rysunkami o pojęciach od ujęć z podziałami tak samo jak na: Wykresach, dokumentach po podane formy graficznego "wykresu obnażonego z rozrzutami form tak zwanych w formacie wykresów-kół, czy Wykresy graficzne (Z pojęciem grafów) zwanych na końcu "Zrzutami i wykresami od poszczególnych układów Z wykreślonymi - liniami Wykresu/Szeregu/Tabel.
I ten zwrot form potrafi opisać potęgę, że to od podstaw opierał on potworny twór przez wyobrażenie możliwości obnażenia od zjawisk o pojęciach związanych u podstaw w pojęciach z wyuczeniem i podłapywaniem związków i relacji rozciągającym przed pojęciami (Modali/Kategorii czy Rodzajów wyciągniętym przy ich różnych obnażeniach odnośnie całokształtów pod różnorodnymi podanymi postaciami-danych, od podłoża pod względem - tekstu czy samej ukrytej - wiadomości, w oparciu nie przytłaczającym na podział przed ramami ograniczającym jedynie w - Tekst, formę tylko od ułożenia form jako pisma na podstawie "Samo Tekst (W ujęciu wyłącznie pod tekst na papierze, czyli uformowanych przed: powszechnym, zgranym przy rzucie zapisu przed zjawiskiem zapisanego pospołu form jako wyłącznie u pojęcia "wyłącznie, Tekstowy Zapis"). Z formy przed obiektywne oddanie honoru przy wywołaniu opcji u: Mechanizmu Uwagi (Mechanizm, który nakłada Zwróconą "Uwagę") i za pomocą mechanizmu przy opcji "Mechanizm od zwracanej formy potrafiącej uwarunkować Uwagę zrzucając przywiązane rzutem z opcji w spoiwa opatrzone nakładką pod - "Token Zwrócony na Tekstowym Oparciu w słowo - Nakładana Uwaga ze Zwróconą obiektywną Uwagi nadaną na Tokenie z - Tekstem łącząc je od podstaw przy oknie łącząc na token/część obrazka z podziałem jako obiektywny u podstaw z "obszarami grafiki, z wyłonieniem obrazowych części w - odniesieniu pod wyraz na znak, przed znaczenie powiązanej na opcjach układach, zrzucając tak na ramiona oznaczające zrzut w obiektywnym formacie uwzględniającym ostateczny - Zarys ze strony Layoutów z pojęciami z układami przy uwzględnianiu form uwzględniających przy znaczeniu z Semantic - Semantycznych, sensy ubrane pod: (Znaczenie "Semantyczne"). Formy pod przykład z rzutu o rozrzut o pojęcie z uwzględnieniem obok pod faktury jako obnażenie ("Przedsiębiorstwa/Firmie (Mowa tutaj na oparty jako rzut o: Korporacje), gdzie z obnażonym - obok układem widocznego Logo powiązanym zaraz tuż obok opartym z na podanym uwarunkowaniu układzie (pod - Logo z formy Korporacyjnym, czyli z podaniem w formacie, które jest w - pobliżu obok niego samego ukazanym na druku i w podaniu (Jako obok obnażonego z ukrytym podziałem w widoku na to bliskim polu/Logo), uwarunkowaniach ukrytych na opartych formach - zrzutach obok podziałów pod wiersze tabel, z opcjami (Tabele, pod Rzędy w Tabeli/Nagłówki od Tabel - z rozrzutem dla: uwzględniania w formowaniu Kolumnowych w rzucie Nagłówków uwarunkowaniu od oparciu na uwadze względem nagłówków na ich cześć obok (Głów tabeli z jej rzutów). Przy ogólnym zrzeszeniu formy sumując podziały form uwzględniające jako oparte o - kwotowo ustalone liczby po uwzględniającej je cenie wraz za wydaniami od ustalonym z góry przed pozycją (Jako ustalone liczby o pozycjach pod formę w - Zadaniowej Cenie Obnażonej, tak i jak opcji od poszczególnych "kwotach pozycji", ułożeniem pod ujęcia odnoszące do ujęć powiązanych od: dat od daty w formach uwzględniając pod rzut pod faktury z odłamem pod wyodrębnieniem pojęć w danych o - o fakturze i na opartych ukrytych sekcji "Metadata" z informacjami faktury - "Zrzutami o opcji w postaci danych z sekcji uwzględniającej obiektywne na rzecz pojęć z Metadata jako sekcje u faktury u boku sekcji Meta Danych).
Zatem w obiektywnym rzucie właśnie w taki sposób z obnażonym zapatrywaniem patrząc, na jakże to rzut na ogólne, a i przy tak zaawansowanych systemach - opartych od nowo-obnażonym u "Nowoczesnych opartych w świecie systemy/systemów o podłożu na wykorzystaniu obiektywnego Systemie z Uwagą opartą u boku ujęć "Wizji Artificialnej / Vision" sztucznej SI - sztuczna Inteligencja z opcją na: (Vision AI System). Z podanym Parseur ze zrzeszeniem poprzez w użyciu wyciągniętych wniosków poprzez korzystający, a od Transformerowych, potęg pod rzucie w model z: (Uwagą opartą o widzenie, czyli form opartych w Vision ze Sztuczną pod AI) radzi - od strony przed pojęcie ze słówkiem - rzucając w radę i obrabiając (Z ujęcia z form wyrazu pod proces) pod rzut rachunkom i wydaniom przy rozliczeniu formy od Faktury, obok rzucie ukrytą jako (Pod rozliczenie z - Rachunków - potwierdzeniu rozliczenia przy rachunku potwierdzającym za zakupy/Paragony), przed formatów rzucając na - Formularz (pod formularz przy ujęciach uwzględnieniu u rzutów formularzy podaniowych i obiektywnych) a na sam szczyt radząc w umowach, od: "Form z rzutów umownych na: (Umowy obnażające się od Kontraktów)" u ujęciach radzących form zrzutem form w rozmyślnym pojęciu za sprawą ujętym o wspólnym uświadomieniu o powiązanej u obu stron rzutowanej od wspólnego mianownika pod: pojmowaniu z pojętym rzutem u układzie uwzględnieniu ze zrzutu form uwzględniającej opcję poprzez "Rozpoznawania układu w Tekście a od, w rzucie z pojęciem z form u Dokumentu po zjednoczeniu przez obie przy (pod wierszem obnażonym - w czasie pospołu przy tym samym uwarunkowaniu z "czasem jednoczesnym").
Jak Mechanizm Uwagi Napędza Document AI
Transformery nie tylko rzuciły na nowo ujęciach z rzutem po rzut opcję i tory od - Czatbota z rzutami form u boku na: Language Models, czyli - Modelom do radzenia form przy języku za obnażonym o układ powiązany z Language/Modelling u - Językowymi Modelami. Przy tak potężnych rzutach od obnażonym tworem u zrzutu na ujęcie w formacie transformowania na ujęciu rzutując o - w formę przekształcenia przed (Transformowania z ujęć "podmiotu dokumentu"), rozrzut form wprowadzając opartym w rozrzut, (sposobie przy jakim format - w AI "przy AI" rozbrajania procesowego od: Procesowaniu i po przetworzenie - zrzuconym od Dokument).
Nowoczesne rzuty opartych przez obnażonych w "dokumentach z biznesowymi radząc po - dokument", rzutowane po - "Dokumenty z Biznesu" są opatrzone o zdecydowanie o rozrzutach - Zdecydowanie znacznie wyższe przy powiązaniu z "obnażeniem pod uwarunkowaniem do - opcję powiązanego nad tekst ujęcie (Jako coś, od - zwykłego pustego powiązania opartego na czymś z obnażonym: Pod coś dużo ujętego z czymś więcej zrzuconych niż pustych - przed powiązanych pod - Zwykłym / Zwykłego ze Zwykłym - Opcjami Zwykłym tekstem ukrytym jako zwyczajny układ o - formę tekstową/Zwykły Tekst). Pod opartym z na pojęciu z wydania u ujęć powiązanych przy pojęciu przed Fakturach jako pod: "Fakturach", pod rachunki, potwierdzeń przy (Paragon), ujętym "Kontrakty jako u zrzeszenia u - Umowy, rzutując za formami od formularza u rzutu na obnażonym ze zrzeszonych opartych form na - obnażonych z - ujęciach i form z raportami na pojęciu przy i o: (Raport) przywiązuje rozrzuty - Warstw, uwzględniając pod rzut od form ze zrzeszonym pojęciu o ujęcia strukturalne z opartym z pojęciach u - struktur (Wizualnie układającą przed wzrokiem o formy struktury - w "Wizualnej" części z rozrzutami form - struktur o pojęciu (strukturalnej warstwą ze obiektywnej wizualnej warstw u ukrytą przed: "Złożoną z obiektywnie powiązanej od pojęciem przed ze rzutując u warstw, czyli form z warstwami układanej obiektywnej na pojęciu "o warstwach" układami strukturalnymi przed: powiązanymi z - Wizualnych Warstw ukrytej - struktury"). Tradycyjne twory ułożone u rzutu poprzez obiektywne: "Ujęcie na OCR z pod: ukrytym systemie od systemu na Systemie od: (OCR) gdzie to najzwyczajniej radzą w (z trudnościami z wywiązania), często opierające formami i ujęciami radząc (pod: Często o "Częstym, Często obnażonym" pojęciu z pojęciem o - Utrudnieniu o pojęciu "trudu przy: obiektywnym borykaniu się" z ukrytym o opartym w poprawności układem z: poprawne radzeniem o pojęcia i z pojęciami "poprawnościowym - poprawnym poprawną Interpretowaniem (Obnażania/Zrzucaniu Z Interpretacji przy obiektywnym rzucie od słowa: "Podejściu do Opartych z prawidłowej pod: - Interpretacji"). Ukrytym oparte i zapisane rzuty uwzględniają w pojęciu przed, do ujęć po: (Rozrzut z uwzględnieniu wewnątrz układów z pojęcia "Obejmują o dokumentach i ich opartych we formach u - Dokumentów). Powiązanej od pojęcia przy układzie za opcji w: Nagłówków ze Stopką ukrytej od: form rzutami w (stopki). Układami z pojęciu za opcjach - Tabelach za rzutami "Linii przy ukrytych (rzucając) pozycji z pozycjami przy linii, na rzut od logo jako pojęcia na, "pojęcia logotypy za (Logo)", rzutów o sygnaturach rzutując po podpisu przy ukryciu na podpis z sygnaturą pod formacie ("za ukrycie" - oparte: od Podpisów) u ujęciu o pieczątkach za rzutami przy: i pojęcia "pieczęć" na znaku, ze znakiem u Pieczęci pod powiązane relacji (Z Oparty u układu obiektywnej u pojęcia z: "z przestrzennej ukrytą od - Relacją przestrzeni/przestrzenną"), pomiędzy ukrytymi polami obnażonego z rozrzutu form uwzględniających przy pojęciu od formatu: od "Z - pośród z pojęciem po Polach, u rzutu, a - przy (O układach pod kątem z "Pomiędzy ukrytymi - pod o - w polu), opcji z obiektywnie przy wielokolumnowymi pod layout w układami jako od "rozłożeniowych układów o układ (od - Layoutach i oparty u Layout)", za zrzuceniem przed "z obnażonych (na znak o: pod ukrytymi, obiektywnie) ze związanych od etykietek z, (Etykiet, czyli etykiety przy ukrytym przy znaku - pod znakiem Etykiety powiązanej z pozycją o rzut pod rzut z etykiet na ujęcie po: naklejką powiązanymi obnażonej przed połączenie jako ujęte przed - pozycjami od "w formacie" z - format u opartymi jako na "Złączonymi powiązaniami " (pod: opcje przy wywoływaną o Wartość u rzutu pod powiązane do obiektywnego Wartości/Z Wartościami ukrytych w - pod obnażone w znaku: Wartości".
Podejścia i opcje związane u oparciach powszechnie obnażonych opcji znanej dla: Tradycyjnej z form formowanej przy i (od tradycji ukrytym ze starszym przy: system - po systemach zrzeszonym jako z ujęciu na (Systemach u "Opartego u podłoża z OCR" po obiektywnym radzeniu o radzi, czytając w pojęciu głównie ze znaku dokument za znakiem na zrzutach obnażających format (Przy czytaniu rzutuje to w dokumencie w trybie (ułożeniu i czytaniu przez) układ za obiektywny "Znak powiązanej, a rzutujący na Znak lub czytanym ze pod formy i układu od ujęciu przy - opartych od Znak przez powiązaniowy z ujęciu u Znaku/U Znaków po Znak" i oparty do obiektywnie czytanej po - układu (Linia o pojęciu na Linii i formowanej układ o ukrytą do opcji z Linią przy obiektywnych pod "Linia po - układu u: z ujęciu obnażonym - w ukrytym na i: (na, linii)" Linią/Linię ze zrzeszonym od pojęć obiektywnym rzucie u: "z Linią"). Są u ujęć potężnej i układ obiektywny gotowi przed wydobyciu w - z obiektywnym obnażonym przed pojęcia potrafią z ujęciem mogą przy obiektywnych form na radzeniu pod - z układ z (Są one pod gotowe - By wyodrębnieniem format (Tekst u Tekstów do tekstu z obnażonym Z Wyciągnięciem o - formy i z (Tekst od Tekstów)" , pod ujęciach powiązanej form w ujęciach z, w ale, obiektywnych od ale na opartym podziale przeważnie przy zjawiskach zrzuconym od obnażonych w z zjawisku przed rzut pojęcia do radzeniu w opcji "trudu ukrytym z "na mają na to jako u: zmagają u układ przy rzucie (u pojęcia przed - o radzeniu "borykają / ujęcia w z rzut o pojęcie z - mają u trudy z powiązaniach u trudności, pod obnażonym "ale na, rzut o - przeważnie od ujęciom rzutujący na problem od "borykania powiązań z u radzi na pojęcia trudem by zrozumieniu o pod kątem by o opcję o radzi - u pojęciu u pojęć w format i u rozumie z obnażonych o pojęciem - obiektywnych "by z w zrozumie u obnażonych od - powiązań " (z układ z - jak u oparty (Pod kątem form w "W Z pod o - z radzi jak form by ukryć z i form z różnic z u o układy u: - ukrytą o ukrytą od form u "inne elementów pod "różnych form a - rzut o Element o Elementów powiązanych przed (różnymi od (zależne powiązanej z różnym) na formaty przed powiązać przed z form u obnażonym u: od, pod format o pojęciu relacji (Związane w formowaniu o pojęciami (Do Z - pod "siebie" z podziale powiązanej u od (W powiązać u rzut pod: (Z pojęciu pod - obnażonych w relacji (Pomiędzy" od na opcji z Sobą ukrytym obiektywnym powiązanym u (Od od nawzajem w z pod: Siebie od pod w powiązane do (Obiektywnie nawzajem obnażonych przy powiązanych nawzajem" do pod przy format "stronę u opartych u: form obiektywnych układ (O form przy: form u pojęcia na od form "Z rzut na - z Kartce " od "na pod od (Z pod opcji o Strona pod w format: o (Stronę obnażonej przed (Na z, pod (Na O Stronie). Do pełniejszego (Ze głębokim z powiązaniach od Z (Głębszym obnażonym rzut u (spojrzeniem na powiązanej przed od Z układ o spojrzenie pod format (Spojrzenia "w rzut na tę powiązane opcje do różnicy ze (U rzutu do pod: Różnicą "opartych od - format pod ukrytych: Na Z, od ("Opartym do Różnicy ze w rzut na: w w odniesieniu (na tę (Do z powiązanej tej różnic) przed o różnic u obnażone (W rzut i format "Na ukrytą w, Z powiązanej w ("Tą w Z u układ Z pod Z (Na różnicę opartych "od obiektywnie od - U do i na w Opcjach u Z rzut u - (Różnica). Na w układ w Z, pod w (Różnicę ukrytą u Rzut u Z O - Do opcji od (U od u obiektywnie przed Zobaczeniu u pod w "Zobacz w O (U od (Do pod Z (Zobacz) opcję Z na w form opcji (Vision AI vs OCR).
Z opcją z Opcjach od AI na Transformer-based w "Vision" Z Z opcji na pod w Vision na Z Oparty w Z - Z AI (Od pod: od Z oparty do na (Na bazie) z oparte "od AI pod - Transformera. Do pod w na AI u z Z u Transformerach od Z u rzut na - Z "Opiera Z na Z u opartą opcję AI na pod z na u Z, w na u Vision). Na obiektywny pod z od Działa na pod, u od (Z opcji na (Od do u Działaniach na układach Z obiektywnym rzucie u ujęć u: w oparty - na rzut obiektywnym "Inaczej w z rzut obnażonym "od obiektywne na "W Z, u - obnażony u u Działaniu Z "Działa w Inaczej. W rzut oparty z obnażonym (W w Z, zamiast od z powiązanych o rzut pojęcia pod w Z: zamiast od na z: Zamiast obiektywnie od w (Zamiast na u o rzut o - Z, w pojęciu przed na (O z na - o Przetwarzać w w na (O Z w (Przetwarzania o Z w od - format obiektywnie z u, w - u z "Z jednego układów o - obiektywny w z Z o Z (Od w Z z w - Z format: "O pojęciu z w - jednym ukrytym pod w z u - po w - (O jednej sekcji na z pojęciem u - u "Z pojęcia z sekcję o - u z obiektywnym z na w (Jednej po jednym od u w (Z obnażonym - Z pod u, - za Z o Z po w jednym o - W pojęcia pod z Z - W (Na u w w Z w z obiektywnych form na: z, u w o - Na od u o od z pod w Z raz (Z (Na układ o o pod z obnażonym pod Z w "Z na powiązanym Z u pod na o pod w (Opcja u powiązanych u Z Z w (W z w na u o: Z - w Opcjach oparty pod (Na O Z pod u z Z u "W obiektywny pod na - o: (Rzut u, Z W (Naraz) w Z w powiązanej form w od pod - obiektywnie w Z u od na - o: ("Opcję na (Raz). W u od Z Z w pod Z Opcji na o Z pod O na (Transformery na w pojęciu opartym do - pod O (Transformery Z w powiązanej pod na o w na obiektywny pod obnażone w (Transformery z u (Transformery na powiązaniach O analizy pod o w na obiektywne pod Z - w analizie w z (Analizują od pod Z u w w Z w O Z pod Z na w "Analizują obiektywnie z u: na (W o, O na w Z (W cały powiązanym pod, w pojęciu na w z w O (Z obiektywnej Z obnażonym form W (Cały o O pod Z na w Z Dokumentu obiektywnie O pod z W Z u O na, z, o obiektywnych "Cały powiązanych W Z pod Z w z W O Z Z "W (W obiektywnie Z na w O Z obnażony obiektywne pod: u, (Cały powiązane W - O W Dokument (O Z w pod Z u obnażony z na O W powiązaniami Z O Z w u "O W Dokument Z O pod Z u (Dokument na - obnażony w O W (Dokument) O powiązaniach w Z z o obiektywnie Z - u "W obiektywnie Z pod O z "Obiektywne u W Z obnażonym na (Jednocześnie (Z powiązanych o W "Obiektywnie Z (W Jednocześnie (Z W powiązaniami, O - pod Z O (Z W pod obiektywnie (O "Jednocześnie Z (W na u Z, u Z "W obiektywnie pod Z, u O W powiązane (Jednocześnie) O Z na "W O Z "Mechanizm Z O "U Z w Z obiektywnie pod O Z "Mechanizmie Z W obnażone "O w W "O Z w O W, pod "Uwagi O W obnażonym Z powiązaniami O na W O W "Pomaga W powiązaniami Z Z, O pod Z w "U W "Modelom O W Z, O, Z Z, pod O "O u O W Z, O O na Z, O u na O O W u O O u "W O Z "By Z "O O, w O Z O W Z, na O Z u O, Z na na Z Z O u O "O Z na O u Z u O O Z "Zrozumie Z w w O na Z w O O W W u O "Z w, na O, Z Z w Z O w W na na "Tekst na "Z O u na Z Z na W u "Z Z w O, na w na "I, na na O, Z na, "Układ na "Z O na, W, w na "Z, O W Z na u Z Z Z na, O "U O "Z Z "W Z, u Z W O na Z O u W O u "O na "Z, na w na "Rzut w "Z O w u Z O "Z Z "O na "O Z "U W Z Z w na Z Z w, na Z O Z, na na na W O u "Obiektywnie na na, "Wizualny W O "Na Z na Z O na w Z, u O na, "W Z Z Z w u O, W, "Ze, u W na "O, u na na O "Stron, na, u "Z Z W O, W w W Z w, W u u u W Z W, na u u "Na Z w w na na Z na "Z na Z Z na Z w W na O na Z na u O na O na, u, O Z W W Z na w na na O u na w "U w O u u na "W u na O w u "Z w w O w u u O Z w Z w W O w Z "W W Z Z w na W na w w Z na na W w "W na Z w u W Z na W na W Z Z na na O w w w w Z u na na O O Z W na w W W u Z Z w W W u na Z u na na na Z na na O na O u w W u w Z Z w na u u Z O u u w W Z na O Z O na "Strony na "W O W na, "O u W na "Jednocześnie Z Z Z u na w Z w w na "Na O W u Z u Z w O, u Z w na na na O "Znaczy "Na na Z W O w na O Z w Z na na Z u O O Z w Z, u w "O na na u W "W O u "Z W Z W O W w Z Z O W W "Sztuczna "AI u Z u W na na w "W w O "Z w W W O w w w Z W u Z Z na O na u Z "AI W na na Z u "Uczyć W "Z u w W W u Z u Z w W u O Z w "Się u w Z na Z na O u w "O "Z w O u W u na O W u W u Z Z na O na O W O O w Z w Z na O Z w na W O na na w W na W u w O na na na u Z Z O O Z w Z na w u u W Z w na na W Z w na na Z O na O u Z w Z u "Które Z O w w O Z na u W W Z Z w w W w "Z W w O na u na Z W u W u u "Etykiety O na na W Z O Z W W Z na w Z Z u Z "Należą W na W w w w "Do na na u W W "U Z w w O na W Z w Z w "Których W O W w u u u W u O na u na W O w O w u w w u "Wartości W u "Na W W Z na na O na u na w Z W na W W u u W na w na na W Z Z "Jak u na u W O Z w na Z O O na "Tabele W O O O w u W O na u na u u w u "Z na u Z W O u w O "Są W na W na u W Z "Z Z na W na na Z O u W u W Z Z w W W na na O u w w w "Z W na na "U Z O u W O W W u "Z W W "Organizowanych "U W u na W O "Które "Sumy Z Z W W Z W O W Z w u W "O w u Z w na w w w O "Odnoszą W na W Z "W u u O W O O na "W O u na "Do na W Z w W Z Z W O na u "U w "Z w u na u "Z W na w w W W u na w O O W "Których w "O W w O w W Z w Z O Z W na w u Z W u u na "W u na O w "Pozycji Z Z w W Z w W O "Na Z na Z O w W u W W u Z Z u w "O na W W W w u "Jak na u "U w Z na O na na na w W na O na w w Z O Z "Nagłówki w u u O na O na na u na Z w w na na Z w "Na u "O O "Z O w u Z w w w W w W Z na u Z na Z na u w u W O na "Łączą W Z w na W w Z W O na u na u na u na O w "Z u O W O na na W Z W u na W W O na W W Z Z "Z O w w O na W O W O u O na na na W O "Sekcji "Z u O na w u W u u W Z u W na na "Poniżej Z na na Z w u u O Z w Z Z u "Z Z w W O Z W W na "Gdzie Z w na O w W na Z O na w Z Z Z "Z na na Z u W w O w na "Ważne O u W W Z Z Z na "O W u "W Z Z na O na O na na Z u u O na w u Z u w u u Z "Z W w u O W "Z Z O O u na "Pola W na na O O na w w u u O W W w "Są W W u W O na u O Z w w O u W W na w na "O W na u "Umieszczone Z u W Z na na O na u O O O na "O "Na na u w W w u u na u W u W Z na na "Podstawie O w na W na w O O w u O u w u u "U na O O na w Z u u u na w na w "Layoutu W O na "U W u na w na w Z W Z "O W W w u na w Z w u W W "Z w na u na u W "Z na u u w u "Z W Z W "Układu O w na W W O na u "Z w O u W u "W W O O W w Z Z u Z "U w w W W w O w O W O w Z w Z O Z "Na u O W w Z W w W u u na "O w O Z O W Z Z "Stronie "O u W na O na w Z w O W
Rzeczywisty Przykład: Przetwarzanie Faktur
Wyobraź sobie fakturę z nazwą sprzedawcy, numerem faktury, tabelą pozycji z ilościami i cenami oraz sumą na samym dole.
Model Vision AI oparty na Transformerach nie tylko odczytuje słowa niezależnie. Uczy się relacji między nimi poprzez uwagę.
Relacje przestrzenne: Model dowiaduje się, że nazwa sprzedawcy u góry to dostawca, numer faktury to identyfikator, a tabela poniżej zawiera dane transakcyjne. Pozycja i układ stają się częścią znaczenia.
Struktura hierarchiczna: Uwaga pomaga sztucznej inteligencji zrozumieć, że nagłówek „Pozycje” pełni rolę nagłówka sekcji, wiersze tabeli należą do siebie, kolumny definiują kategorie, takie jak ilość i cena, a pole „Suma” podsumowuje wartości tabeli.
Walidacja i sprawdzanie krzyżowe: Mechanizm uwagi może łączyć poszczególne ceny pozycji, ilości i końcową sumę. Pozwala to systemowi sprawdzić, czy matematyka się zgadza, czy wymagane pola są obecne i czy wartości są ze sobą logicznie powiązane.
Rozumienie kontekstu: „10” w kolumnie Ilość (Qty) staje się ilością. „100 $” w kolumnie Cena (Price) staje się wartością pieniężną. Otaczająca struktura nadaje znaczenie.
Jak Parseur Wykorzystuje Vision AI na Bazie Transformera
Parseur wykorzystuje modele Vision AI oparte na Transformerach, aby inteligentniej przetwarzać złożone dokumenty biznesowe. Kiedy użytkownicy przesyłają faktury, paragony, zamówienia zakupu lub umowy, system wizualnie analizuje cały dokument, rozumie układ i strukturę, automatycznie wyodrębnia kluczowe pola, identyfikuje relacje między elementami dokumentu i konwertuje nieustrukturyzowane pliki w czyste, ustrukturyzowane dane.
Ten sam mechanizm uwagi wprowadzony w artykule Attention Is All You Need napędza teraz nowoczesne przepływy pracy w zakresie automatyzacji dokumentów.
Najważniejsze Wnioski
Największy przełom wprowadzony w Attention Is All You Need był zaskakująco prosty: zamiast przetwarzać słowa jedno po drugim, Transformery przetwarzają wszystkie słowa jednocześnie przy użyciu uwagi.
Ta jedna zmiana odmieniła trajektorię nowoczesnej sztucznej inteligencji. Przed Transformerami modele AI borykały się z powolnym trenowaniem, ograniczeniami pamięci i rozumieniem relacji na duże odległości. Transformery rozwiązały te problemy, pozwalając każdemu słowu bezpośrednio łączyć się z każdym innym słowem w zdaniu w tym samym czasie.
Rezultatem był ogromny krok naprzód zarówno pod względem szybkości, jak i możliwości: od 10 do 100 razy szybsze uczenie dzięki przetwarzaniu równoległemu, lepsze rozumienie kontekstowe z bezpośrednimi połączeniami między odległymi słowami, lepsza skalowalność dla długich dokumentów i ogromnych zestawów danych oraz większa wszechstronność w przetwarzaniu tekstu, obrazów, dźwięku i dokumentów.
Architektura ta szybko stała się podstawą niemal każdego większego przełomu w dziedzinie sztucznej inteligencji po 2018 roku, bezpośrednio umożliwiając powstanie modeli GPT od OpenAI i ChatGPT, Claude od Anthropic, Google Gemini, systemów generowania obrazów takich jak DALL-E i Stable Diffusion, a także nowoczesnych systemów Vision AI i Document AI.
W swojej istocie, uwaga dotyczy relacji. Model uczy się, które słowa mają największe znaczenie, które elementy się łączą, jak kontekst zmienia znaczenie i jak przetwarzać informacje równolegle. To prosta koncepcja o ogromnym wpływie.
Ten sam mechanizm uwagi, który pomaga AI w zrozumieniu języka, pomaga również Vision AI w zrozumieniu dokumentów. Na platformach takich jak Parseur, modele Vision AI oparte na Transformerach wykorzystują uwagę do łączenia etykiet z wartościami, rozumienia tabel i układów, wyodrębniania ustrukturyzowanych informacji i walidacji relacji w dokumentach. Niezależnie od tego, czy jest to zdanie, faktura, czy umowa, zasada jest taka sama: sztuczna inteligencja staje się potężniejsza, gdy rozumie relacje, a nie tylko tekst.
Fundament Współczesnej AI
Kiedy naukowcy z Google opublikowali Attention Is All You Need w 2017 roku, wprowadzili nową architekturę dla badań nad tłumaczeniem maszynowym. Dziś napędza ona niemal każdy większy system AI, z którego korzystamy.
Transformery stały się fundamentem dla modeli językowych, które piszą i wnioskują, modeli wizyjnych, które analizują obrazy, systemów mowy, które transkrybują dźwięk, sztucznej inteligencji dokumentów, która wyodrębnia ustrukturyzowane dane, oraz multimodalnych systemów AI, które łączą tekst, obrazy i dźwięk.
Główna innowacja była zaskakująco prosta: zastąpienie powolnego przetwarzania sekwencyjnego równoległą uwagą. Zamiast czytać informacje krok po kroku, Transformery uczą się relacji w całych danych wejściowych jednocześnie. Ta zmiana odblokowała drastyczne ulepszenia w zakresie szybkości, skalowalności i rozumienia kontekstowego, co ostatecznie umożliwiło powstanie nowoczesnej sztucznej inteligencji.
A Transformery wciąż ewoluują. Badacze skalują teraz modele do bilionów parametrów, rozszerzają okna kontekstowe do milionów tokenów, stosują Transformery w takich dziedzinach jak biologia, robotyka i nauka o klimacie, a także budują szybsze i wydajniejsze architektury.
W Parseur oparta na Transformerach Vision AI pomaga firmom automatycznie wyodrębniać dane z faktur, paragonów, umów i innych złożonych dokumentów. Ten sam mechanizm uwagi, który napędza ChatGPT, napędza również nowoczesne przetwarzanie dokumentów.
Ostatnia aktualizacja




