Googles Gemini 3.8 Live blir nativ tale-til-tale

Googles Gemini 3.8 Live blir nativ tale-til-tale
Google svarte 15. september med Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking, native tale-til-tale-modeller som nå er tilgjengelige i Gemini API og AI Studio [3][4]. Begge håndterer sanntidsdialog, visuelle innspill, asynkrone funksjonskall og bakgrunnsbruk av verktøy uten å bryte samtaleflyten — og standardmodellen topper Speech-to-Speech Quality Index med 82,6 [5].
Prisingen er aggressiv for utviklere ($0,005/min input, $0,018/min output-lyd), med en forhåndsvisning for bedrifter på vei inn i Gemini Enterprise. Verdt å merke seg er at den kommer med live transkribering og oversettelse på over 70 språk rett ut av boksen — en detalj som betyr mer enn den kanskje virker ved første øyekast, for alle som bygger flerspråklige møteverktøy.
Reaksjonene på X fokuserte på integrasjonen med Workspace og Search, der flere pekte på at lav ventetid og bakgrunnsbruk av verktøy er den egentlige nøkkelen for forretningsapplikasjoner — ikke bare forbrukerrettede taleassistenter.
MLCommons standardiserer benchmarks for RAG og agentbaserte systemer
MLCommons lanserte MLPerf Inference v6.1 den 16. september, og hovednyheten er en ende-til-ende RAG-benchmark som endelig tester hele embed-hent-rangér-resonner-pipelinen, i tillegg til en Edge Agentic Inference-benchmark for flerturs oppgaver med voksende kontekst [6][7]. Deltakelsen nådde en rekord, noe som tyder på at bransjen nå betrakter retrieval-augmented-systemer som kjerneinfrastruktur som fortjener grundig måling, ikke bare et sidespor.
NVIDIAs innsendinger viste gevinsten — 6,4 ganger raskere ytelse på Jetson AGX Thor for agentbaserte arbeidsbelastninger [8]. For alle som bygger eller kjøper kunnskapsgjenfinningssystemer er dette første gang det finnes en standardisert, sammenlignbar måte å spørre "hvor god er egentlig denne RAG-pipelinen?" i stedet for å måtte stole på leverandørens markedsføring.
AI-forskere på X kalte dette lenge etterlengtet, og påpekte at bedriftskunder som evaluerer kunnskapsforvaltnings- og gjenfinningsverktøy har manglet epler-mot-epler-benchmarks — inntil nå.
Salesforce og NVIDIA lanserer Koa, en CRM-native resonneringsmodell
Under Dreamforce 15. september avduket Salesforce og NVIDIA Koa, Salesforces første CRM-spesifikke resonneringsmodell, videretrent på NVIDIA Nemotron 3 Super ved hjelp av syntetiske arbeidsflyter hentet fra 27 år med CRM-data på tvers av 14+ bransjer — det er verdt å merke seg at ingen kundedata ble brukt i treningen [9][10]. Jensen Huang beskrev det på Dreamforce som et vendepunkt: "nå kan vi vite alt og gjøre hva som helst" [11].
Innlemmet i Agentforce leverer Koa en presisjonsøkning på 11 %, 2,1 ganger bedre kontekstgjenkalling og 3 ganger færre feil på CRM Bench-oppgaver som oppdatering av salgsmuligheter og saksruting [10]. Pilotkunder inkluderer Formula 1 og UChicago Medicine, med generell tilgjengelighet planlagt til vinteren 2026.
Stemmer innen salg og bedriftsteknologi på X festet seg ved token-effektiviteten — en domenespesifikk resonneringsmodell som sløser mindre med kontekst og gjør færre feil, er et klart signal om at vertikal, arbeidsflyt-native AI begynner å slå generalistmodeller på deres eget spill.
Hva dette betyr for møtene dine
Dagens nyheter er egentlig én historie fortalt på fire måter: tale, resonnering, gjenfinning og domenespesifikt minne smelter sammen til én felles forventning — at AI-systemer skal høre hva som skjer, forstå det, og huske det nøyaktig måneder senere. GPT-Live-1 og Gemini 3.8 Live beviser begge at fullduplex tale med lav ventetid nå er en selvfølge, ikke et konkurransefortrinn. Det som skiller seg ut, er det som skjer etter samtalen — hvor godt systemet henter frem og resonnerer over det som ble sagt.
Det er nettopp her MLCommons' nye RAG-benchmark og Salesforces Koa er lærerike. Koas gevinster kom ikke fra en større modell, men fra trening på realistiske arbeidsflytdata og belønning av presis gjenkalling fremfor generisk flyt — det samme prinsippet som skiller et møteverktøy som bare transkriberer ord fra ett som faktisk bygger opp brukbar institusjonell hukommelse. En kunnskapsgraf over møtene dine er ikke bedre enn kvaliteten på gjenfinningen, og nå finnes det endelig en standardisert måte å måle nettopp det på, i stedet for å måtte ta leverandørens ord for det.
For team som er avhengige av møteintelligensplattformer er budskapet klart: æraen med "bare transkriber det" er over. Terskelen er nå fullduplex samtaleforståelse, nøyaktig taleridentifikasjon og gjenfinning som tåler grundig benchmarking — på tvers av hele møtehistorikken din, ikke bare den siste samtalen.
Hovedpoeng: Tale-AI blir raskt en hyllevare — det egentlige konkurransefortrinnet flytter seg nå til gjenfinningskvalitet og langtidsminne, og det er nettopp den grunnen møteintelligensverktøy som Proudfrog er bygget for å eie.
Sources
- https://openai.com/index/gpt-6-astra-next-generation-work/
- https://openai.com/index/introducing-gpt-live-1-in-the-api/
- https://www.wired.com/story/openai-says-gpt-6-can-use-a-computer-better-than-a-human/
- https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
- https://ai.google.dev/gemini-api/docs/models/gemini-3-8-live
- https://mlcommons.org/2026/09/mlperf-inference-v6-1-results/
- https://techstrong.ai/articles/mlperf-inference-v6-1-updated-for-rag-agents-and-api-based-serving/
- https://developer.nvidia.com/blog/tensorrt-edge-llm-completes-the-mlperf-edge-agentic-benchmark-6-4x-faster-on-jetson-agx-thor/
- https://www.salesforce.com/agentforce/koa/
- https://blogs.nvidia.com/blog/jensen-huang-dreamforce/
- https://investor.salesforce.com/news/news-details/2026/Announcing-Koa-Salesforces-First-CRM-Reasoning-Model-Built-on-NVIDIA-Nemotron/default.aspx
Få den daglige briefingen
AI, kunnskapsgrafer og fremtidens arbeid — i innboksen din hver morgen.
Ingen spam. Avslutt når som helst.