Vreme čitanja: oko 7 min.
Google predstavlja Gemini 4 Argon, vraćajući vođstvo na benčmark testovima: Evo gde je bolji od Claude i GPT-a
Vreme čitanja: oko 7 min.
Sumirano
- Gugl je najavio Gemini 4 Argon, napredni AI model koji se još uvodi ograničenoj grupi stručnjaka, a šira dostupnost planirana je za programere, preduzeća i korisnike koji plaćaju
- Argon vodi ili deli prvo mesto u 13 od 18 objavljenih benčmark testova, ali konkurenti zadržavaju prednost u pojedinim softverskim, naučnim i terminalskim zadacima
- Model je namenjen poslovnoj automatizaciji, programiranju, radu sa znanjem i sajber bezbednosti; Gugl navodi da zaposleni već koriste Argon za programiranje, istraživanje i optimizaciju
Gugl (Google) je najavio Džemini 4 Argon (Gemini 4 Argon), novi napredni AI model za koji kompanija tvrdi da prednjači u odnosu na rivalske sisteme na nekoliko benčmark testova relevantnih za preduzeća, uključujući dugoročni softverski inženjering, otklanjanje ranjivosti u sajber bezbednosti, poslovnu automatizaciju i rad sa znanjem koji ima ekonomski uticaj.
Ovaj model još uvek nije široko dostupan. Gugl navodi da je Argon počeo da se uvodi za grupu pouzdanih stručnjaka za sajber odbranu kroz svoj program Fervind (Fairwind), koji je predstavljen ranije ovog meseca, i da učestvuje u dobrovoljnom procesu američke vlade za pristup modelima pre objavljivanja, pre nego što postane šire dostupan.
Široka dostupnost je planirana "što je pre moguće", za programere, preduzeća i potrošače, počevši od korisnika koji plaćaju API i pretplatnika na Gugl AI Ultra (Google AI Ultra), prema embargovanom blog postu Gugla koji je pregledao Venčurbit (VentureBeat).
Za korporativne kupce, ova najava je manje važna kao lansiranje četbota, a više kao signal da Gugl pokušava da ponovo učvrsti svoju poziciju u oblasti napredne veštačke inteligencije (AI) nakon višemesečnog pritiska od strane OpenAI i Antropika.
Kompanija pozicionira Argon oko tri oblasti u kojima preduzeća već ulažu novac: razvoj softvera, profesionalni rad sa znanjem i operacije u sajber bezbednosti.
Rezultati benčmark testova: Argon vodi ili je izjednačen u većini kategorija, ali bez apsolutne dominacije Gugl ne tvrdi da Džemini 4 Argon pobeđuje na svakom benčmarku. Ipak, širom tabele sa rezultatima koja je otkrivena u embargovanim materijalima kompanije, Argon beleži najviši rezultat, ili je izjednačen za najviši rezultat, u više kategorija nego Dži-Pi-Ti-6 Astra (GPT-6 Astra) ili Klod Opus 5.5 (Claude Opus 5.5).
Od 18 benčmark testova koje je Gugl obelodanio, Argon samostalno vodi na 12, i izjednačen je na prvom mestu na jednom. Dži-Pi-Ti-6 Astra samostalno vodi na tri i izjednačen je sa Argonom na jednom. Klod Opus 5.5 samostalno vodi na dva. To čini Argon vodećim naprednim modelom prema ukupnom broju vođstava na benčmark testovima ili najviših rezultata u Guglovom uporednom skupu, iako rezultati pokazuju da je trka i dalje tesna, u kojoj OpenAI i Antropik zadržavaju prednosti u nekoliko važnih tehničkih kategorija.
Najjače prednosti Argona dolaze u korporativnim tokovima posla i radu sa dugim kontekstom. Na benčmarku pravnog agenta kompanije Harvi (Harvey), Argon postiže 19,6%, daleko ispred Dži-Pi-Ti-6 Astre sa 5,4% i Kloda Opus 5.5 sa 3,8%, što predstavlja jednu od najjasnijih pobeda ovog modela u nekoj kategoriji. Na Otomejšnbenču (AutomationBench), benčmarku kompanije Zapijer (Zapier) za end-to-end poslovnu egzekuciju, Argon postiže 51,3%, u poređenju sa 42,5% za Klod Opus 5.5 i 41,4% za Dži-Pi-Ti-6 Astru. Na dužoj evaluaciji Grafvoks (GraphWalks), koja testira prolazak kroz grafove u širim kontekstima, Argon beleži 84,2%, u poređenju sa 71,8% za Dži-Pi-Ti-6 Astru i 66,8% za Klod Opus 5.5.
Model takođe beleži značajna vođstva u finansijama, programiranju i multimodalnom razumevanju. Na testu Vals fajnans agent v2 (Vals Finance Agent v2), Argon postiže 65,4%, ispred Kloda Opus 5.5 sa 58,6% i Dži-Pi-Ti-6 Astre sa 53,5%. Na DipSVI v1.1 (DeepSWE v1.1), koji meri stvarne zadatke softverskog inženjeringa sa dugim horizontom, Argon beleži 77,9%, u poređenju sa 74,2% za Klod Opus 5.5 i 74,1% za Dži-Pi-Ti-6 Astru. Na El-Vi-benču (LVBench), benčmarku za razumevanje dugih video zapisa, Argon postiže 91,7%, ispred Dži-Pi-Ti-6 Astre sa 87,5% i Kloda Opus 5.5 sa 83,7%.
Ove pobede podržavaju širu tvrdnju Gugla da je Argon najjači u onim vrstama tokova posla koje će preduzeća najverovatnije prve evaluirati: pravna i finansijska analiza, programiranje, poslovna automatizacija, rezonovanje u dugom kontekstu, multimodalno razumevanje i defanzivna sajber bezbednost. Argon je takođe izjednačen sa Dži-Pi-Ti-6 Astrom na CVI-benč v1 (CWE-bench v1) testu, pri čemu oba modela postižu 68% na benčmarku za otklanjanje ranjivosti, dok Klod Opus 5.5 beleži 67%.
Međutim, tabela sa rezultatima takođe pokazuje gde trka ostaje nerešena. Najveći zaostaci Argona su u odnosu na Dži-Pi-Ti-6 Astru na FrontijerSVI v2 (FrontierSWE v2) i Terminal-benč sajens 0.1 (Terminal-Bench Science 0.1). U oba slučaja, Astra vodi sa 10,5 procentnih poena: 65,5% naspram 55,0% na FrontijerSVI v2, i 68,1% naspram 57,6% na Terminal-benč sajens 0.1. Najveća prednost Kloda Opus 5.5 nad Argonom ostvarena je na Terminal-benč 4.0 (Terminal-bench 4.0) testu, gde Opus beleži 66,4% u poređenju sa Argonovih 57,4%, što je razlika od 9 poena. Opus takođe vodi na Post-trejn-benču (PostTrainBench), sa rezultatom od 49,3% naspram Argonovih 45,3%.
Rezultat je znatno nijansiranija tvrdnja od "najbolji model u svim aspektima". Čini se da Argon ima najširi profil najviših rezultata među tri napredna modela u Guglovom obelodanjenom poređenju, ali Dži-Pi-Ti-6 Astra ostaje u prednosti u nekoliko softverskih zadataka, naučno-terminalnih operacija i zadataka upotrebe računara, dok Klod Opus 5.5 ostaje napred u terminalnim agentima i tokovima posla nakon obučavanja. Za korporativne kupce to znači da izbor modela i dalje zavisi od radnog opterećenja, iako Argon sada Guglu daje najjači argument do sada za opšte vođstvo u naprednoj tehnologiji prema broju pobeda na benčmark testovima.
Za programere i IT direktore, praktičan zaključak je da Argonu nije potrebna apsolutna dominacija da bi promenio konkurentsku sliku. Vodeći ili izjednačavajući se u 13 od 18 obelodanjenih kategorija, on daje Guglu najveći broj najviših rezultata širom uporednog skupa. Ali praznine u kojima zaostaje - posebno FrontijerSVI v2, Terminal-benč sajens 0.1 i Terminal-benč 4.0 - pokazuju da OpenAI i Antropik i dalje imaju jasna područja tehničke snage. Trka za primat ostaje tesna, ali Gugl sada može da tvrdi da Argon u njoj vodi po širini primene.
Argon takođe podiže Guglov plafon izlaza. Kompanija kaže da model podržava vodećih u industriji milion izlaznih tokena, što je povećanje u odnosu na prethodno ograničenje od 64.000 tokena. To je značajna prednost za agentno softversko inženjerstvo, reviziju, migraciju i radna opterećenja u pravnim analizama gde vrednost modela često zavisi od toga koliko dugo može da održava lanac rada pre nego što vrati kontrolu čoveku.
Gugl već u velikoj meri interno koristi Argon Unutar Gugla, kompanija navodi da Argon već koriste hiljade zaposlenih za specijalizovane zadatke programiranja, dublja istraživanja i pisanje.
Gugl navodi nekoliko internih primera: Argon je pomogao istraživačima kvantnog računarstva da optimizuju prostorno-vremenske resurse za rutine sa uskim grlima, navodno nadmašivši objavljenu osnovnu liniju za 40% u roku od nekoliko minuta; Argonovi agenti su analizirali telemetriju profilisanja širom flote i identifikovali memorijske optimizacije za koje se očekuje da će osloboditi više od 300 TiB širom Guglovih data centara nakon implementacije, sa procenjenom ukupnom uštedom od 500 TiB do 1 PiB; i Argonovi agenti se koriste za migraciju C/C++ baza koda na Rast (Rust), uključujući osnovne biblioteke i Fuksija OS Cirkon (Fuchsia OS Zircon) kernel.
Najkonkretniji inženjerski primer je libgav1, Guglov dekoder video zapisa otvorenog koda.
Prema Guglovom blog postu, Argonovi agenti preuzeli su postojeći Rast port i zamenili 32.000 linija SIMD koda izvođenjem eksperimenata vođenih profilisanjem, proučavanjem izlaza prevodioca (kompajlera) i pisanjem bezbednog Rasta koji je kompajler mogao automatski da vektorizuje. Gugl navodi da rezultujući bezbedni memorijski dekoder radi 2,7 puta brže od Rast porta uz očuvanje identičnog video izlaza.
Sajber bezbednost je drugi glavni stub. Gugl kaže da Argon može autonomno da pronađe, validira i zakrpi kritične softverske ranjivosti. Za pouzdane zaštitnike i Guglove sopstvene interne timove, kompanija kaže da će objaviti Argon bez sajber ograničenja kako bi ti korisnici mogli da pristupe njegovim punim defanzivnim sposobnostima.
Kompanija kaže da Viz (Wiz) već koristi Argon kroz svoju inicijativu Sken for gud (Scan for Good), koja je fokusirana na zaštitu kritične javne infrastrukture, i da je model otkrio kritičnu ranjivost koja izlaže osetljive lične podatke u zdravstvenom softveru koji koriste bolnice širom sveta.
Gugl ovu implementaciju sajber odbrane spaja sa porukom o bezbednosti. Pre široke dostupnosti, kompanija kaže da jača mere zaštite protiv zloupotrebe sajber i CBRN (hemijskih, bioloških, radioloških i nuklearnih) sredstava, napada posrednim ubrizgavanjem komandi, neusklađenosti modela i nebezbednih okruženja za agente.
Na Grej svon (Gray Swan) benčmarku za posredno ubrizgavanje komandi prikazanom na blogu, Džemini 4 Argon beleži stopu uspešnosti napada od 0,7%, u poređenju sa 1,0% za Klod Opus 5.5 i Klod Fejbl 5.1 (Claude Fable 5.1), 8,5% za Dži-Pi-Ti-6 Astru, 27,0% za Dži-Pi-Ti-6 Sol (GPT-6 Sol), 31,5% za Dži-El-Em 5.3 (GLM 5.3) i 51,8% za Grok 4.8 (Grok 4.8).
(Ubrzanje.rs/Venture Beat)
Video: Gde je Srbija na putu stvaranja digitalne suverenosti i zašto je ovo goruća tema?
Ubrzanje Telegraf zadržava sva prava nad sadržajem. Za preuzimanje sadržaja pogledajte uputstva na stranici Uslovi korišćenja.