Google lanserer Gemini 1.5 Flash: Mer hastighet og bedre bildeforståelse

Gemini Flash-intelligens og dens bidrag

La Kunstig intelligens er området med størst teknologisk utvikling de siste årene. Og aktører som Meta og Google blir også med for å konkurrere og lede i sektoren. Gemini 1.5 Flash er Googles forbedrede plattform for større hastighet og bildeforståelse. Med sin nye modell er det nå fire som Google tilbyr: Gemini Nano, Flash, Pro og Ultra.

I Google I / O Fremtiden til Android og kunstig intelligens ble diskutert med presentasjonen av Gemini 1.5 Flash og dens store økning i hastighet og kvalitet på svar. Googles veiskille er veldig slående, fordi selskapet spesialiserer seg på kunstig intelligens. Det var selskapet som skapte hovedverktøyene for å trene AI-er, men det opptar ikke lenger podiet i språkmodeller og generativ intelligens. Open AI er referanseselskapet i sektoren, og innovasjonen stopper ikke med den nylige lanseringen av GPT-4o, som fortsetter på toppen. Googles svar med Gemini 1.5 Flash var umiddelbar.

Gemini 1.5 Flash, en trimmet AI, men fokusert på hastighet

Når man sammenligner kunstige intelligenser fra Google og Open AI var forskjellen når det gjaldt hastighet åpenbar. Chat-GPT 4o-modellen gjorde at ordrevurdering og ord-for-ord-skriving nådde nye nivåer. Og Google ønsker ikke å bli etterlatt.

At AI som tar lang tid å reagere, gjør læringsmodellen mindre naturlig og generative svar. Det er derfor den nye Gemini 1.5 Flash har som mål å akselerere responstidene, men uten å miste multimodal atferd. Den siste versjonen av Googles AI mister ikke evnen til å forstå, den fortsetter å analysere konteksten og kan tolke ord og bilder. Men med en virkelig forbedret responstid. Opplæringen er basert på Gemini 1.5 Pro-versjonen og fjerner noen prosesser for å optimalisere utførelseshastigheten til det maksimale.

Hva kunne sees i Google I / O viser en merkbar forbedring. Fremgangen i hastighet lar deg trekke ut dokumenter, oppsummere e-poster, tolke tabeller og mange andre funksjoner. I tillegg til denne nye modellen, optimaliserte Google også driften av Gemini 1.5 Pro. Dette er modellen som for øyeblikket gir liv til den gratis Google chatboten. Chatboten forstår instruksjonene bredere og forskjellige formater kan brukes. Den har også muligheten til å tolke stiler, og Google forsikrer at atferden er litt mer menneskelig enn i tidligere versjoner.

AI-endringene påvirker også Gemini Nano-versjonen. I dette tilfellet blir generativ AI på nivå med Pixel-enheter også multimodal. Dette betyr at den i tillegg til å forstå tekst, kan analysere bilder. Den er tilgjengelig på Google Pixel 8 og vil fortsatt være versjon 1.0, i motsetning til 1.5 i de tre andre iterasjonene. Det ble også annonsert at den vil nå andre Google Pixel-modeller. De ny Gemini 1.5 Flash Den er tilgjengelig i Google API for utviklere og i selskapets chatbot for alle brukere. Når det gjelder utplasseringen av Gemini Nano, vil den bli overført til forskjellige Google Pixels etter hvert som dagene går.

Hvordan er Googles kunstig intelligens-modeller forskjellige?

Las tre viktigste kunstige intelligenser som Google markedsfører De heter Gemini 1.5, Pro og Flash. De er like, men de har betydelige forskjeller som gjør at valget kan variere i henhold til bruken og behovene til hver plattform. Alle tre jobber i skyen, og det er derfor de deler hovedaksen for operasjon.

Google Gemini er navnet på intelligensmodellene, men det er også navnet på Mountain View-chatboten. Geminien som har et versjonsnummer er ikke Artificial Intelligence-assistenten, men refererer til den underliggende teknologien.

Hvordan er den nye Gemini Flash?

Hva er Gemini 1.5?

Den siste versjonen av Google AI-modell Den ble presentert i februar 2024. Det er en modell som konkurrerer med andre som GPT. Det er for tiden motoren til kunstig intelligens-knappen kalt Gemini, og konkurrerer direkte med Open AI ChatGPT-forslaget.

Gemini 1.5 kom opprinnelig med ideen om å tilby en personlig assistent så vel som et forretningsverktøy. Modellen er ultimodal, den forstår tekstmeldinger og konteksten til et fotografi. Hvis vi laster opp et bilde, vil AI-en kunne forstå hva rekkefølgen omgir og betyr og hvordan man trekker ut forskjellige data.

Tilnærmingen deres har en forbedret arkitektur kalt Mixture-of-Experts. Fordelen er at den oppnår større effektivitet, og dens interne ekspertfelt gir mulighet for raskere svar og kvaliteten på svarene, uavhengig av forespørselstype.

Når vi tar en konsultasjon med Gemini 1.5, bare ekspertsøkemodulene er aktivert for hvert emne. Dermed blir typen anbefaling eller søk mye mer fokusert og spesifikk. En klage som hadde blitt ganske tilbakevendende sammenlignet med GPT-4o Chat-svarene.

Gemini 1.5 Pro-forbedringer

Den mest avanserte og profesjonelle versjonen av Gemini 1.5. Det er en middels stor kunstig intelligens-modell, optimalisert for å forbedre ytelsen i et bredt spekter av forskjellige handlinger. Den kan behandle naturlig språk for å generere tekster, oppsummere dem, svare på spørsmål og analysere kode på forskjellige språk. Den oppdager også feil og kan være din assistent og generere din egen kode i henhold til instruksjoner. Siden den er multimodal, behandler den også bilder og identifiserer elementer, klassifiserer og beskriver dem.

Hovedforskjellen er at den har et forståelsesvindu på 1 million tokens, sammenlignet med standarden på basisversjonen som er redusert til 128.000 1.5. Jo flere tokens, jo større presisjon og flyt i svarene den gir. Gemini XNUMX Pro er også i stand til å behandle og forstå hva som skjer i en video og oppsummere innhold direkte fra en audiovisuell base.

Gemini 1.5 Flash-forslaget

Endelig Gemini 1.5 Flash kunstig intelligens Den er lettere og mer effektiv, men med noen reduksjoner som fremskynder responsen. Den deler vinduet på 1 million tokens med Pro og er i stand til å tolke lyd, bilder, videoer eller tekst. Den er designet for å fungere i virtuelle assistenter, chatbots og innholdsmodereringssystemer på sosiale nettverk.


Legg til som foretrukket kilde