Googles Gemini 3.8 Live blir helt tal-till-tal

Googles Gemini 3.8 Live blir helt tal-till-tal
Google svarade den 15 september med Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking — native tal-till-tal-modeller som nu finns i Gemini API och AI Studio [3][4]. Båda hanterar dialog i realtid, visuell input, asynkrona funktionsanrop och verktygsanvändning i bakgrunden utan att bryta konversationsflödet — och standardmodellen toppar Speech-to-Speech Quality Index med 82,6 [5].
Prissättningen är aggressiv för utvecklare ($0,005/min för input, $0,018/min för output-ljud), med en förhandsversion för företag som rullas ut i Gemini Enterprise. Värt att notera är att den levereras med livetranskribering och översättning på 70+ språk direkt ur lådan — en detalj som betyder mer än man kanske tror för alla som bygger flerspråkiga mötesverktyg.
Reaktionerna på X fokuserade på integrationen mot Workspace och Search, där flera röster lyfte fram den låga latensen och bakgrundsverktygsanvändningen som det verkliga genombrottet för affärsapplikationer — inte bara röstassistenter för konsumenter.
MLCommons standardiserar benchmarks för RAG och agentiska system
MLCommons släppte MLPerf Inference v6.1 den 16 september, och huvudnyheten är ett heltäckande RAG-benchmark som äntligen testar hela embed-hämta-omrangordna-resonera-kedjan, plus ett Edge Agentic Inference-benchmark för flerstegsuppgifter med växande kontext [6][7]. Deltagandet slog rekord, vilket signalerar att branschen nu ser retrieval-augmented-system som central infrastruktur värd att mäta noggrant — inte som ett sidospår.
NVIDIA:s inlämningar visade på resultatet — 6,4 gånger snabbare prestanda på Jetson AGX Thor för agentiska arbetsbelastningar [8]. För alla som bygger eller köper system för kunskapshämtning är detta första gången det finns ett standardiserat, jämförbart sätt att fråga "hur bra är den här RAG-pipelinen egentligen?" istället för att bara lita på leverantörens marknadsföring.
AI-forskare på X kallade detta efterlängtat och påpekade att företagskunder som utvärderar verktyg för kunskapshantering och informationssökning tidigare har saknat rättvisa jämförelser — fram tills nu.
Salesforce och NVIDIA lanserar Koa, en CRM-native resonemangsmodell
Under Dreamforce den 15 september presenterade Salesforce och NVIDIA Koa, Salesforces första CRM-specifika resonemangsmodell, efterträning gjord på NVIDIA Nemotron 3 Super med syntetiska arbetsflöden hämtade från 27 års CRM-data inom 14+ branscher — värt att notera är att ingen kunddata användes i träningen [9][10]. Jensen Huang beskrev det på Dreamforce som en vändpunkt: "nu kan vi veta allt och göra vad som helst" [11].
Inbakad i Agentforce ger Koa en precisionsökning på 11 %, 2,1 gånger bättre kontextminne och 3 gånger färre fel på CRM Bench-uppgifter som uppdatering av affärsmöjligheter och ärenderoutning [10]. Pilotkunder inkluderar Formula 1 och UChicago Medicine, med allmän tillgänglighet planerad till vintern 2026.
Röster inom sälj och företag på X fokuserade på token-effektiviteten — en domänspecifik resonemangsmodell som slösar mindre kontext och gör färre fel är ett tydligt tecken på att vertikal, arbetsflödesanpassad AI börjar slå generalistmodeller på deras egen planhalva.
Vad detta betyder för dina möten
Dagens nyheter är egentligen samma historia berättad på fyra sätt: röst, resonemang, informationssökning och domänspecifikt minne smälter samman till en enda förväntan — att AI-system ska höra vad som händer, förstå det, och komma ihåg det korrekt månader senare. GPT-Live-1 och Gemini 3.8 Live bevisar båda att fullduplex röst med låg latens nu är ett grundkrav, inte en konkurrensfördel. Det som skiljer ut sig är vad som händer efter konversationen — hur väl systemet hämtar och resonerar kring det som sades.
Det är precis där MLCommons nya RAG-benchmark och Salesforces Koa blir lärorika. Koas framsteg kom inte från en större modell, utan från träning på realistisk arbetsflödesdata och belöning av precis återkallning framför generisk flyt — samma princip som skiljer ett mötesverktyg som bara transkriberar ord från ett som faktiskt bygger användbart institutionellt minne. En kunskapsgraf över dina möten är bara så bra som dess sökkvalitet, och nu finns det äntligen ett standardiserat sätt att mäta det istället för att bara lita på en leverantörs ord.
För team som förlitar sig på plattformar för mötesintelligens är budskapet tydligt: eran av "bara transkribera det" är över. Ribban ligger nu vid fullduplex konversationsförståelse, korrekt taltilldelning och sökfunktioner som håller måttet vid rigorös benchmarking — genom hela din mötehistorik, inte bara det senaste samtalet.
Viktigaste slutsatsen: Röst-AI blir snabbt en handelsvara — den verkliga konkurrensfördelen flyttar till sökkvalitet och långtidsminne, vilket är precis den mark som mötesintelligensverktyg som Proudfrog är byggda för att äga.
Källor
- https://openai.com/index/gpt-6-astra-next-generation-work/
- https://openai.com/index/introducing-gpt-live-1-in-the-api/
- https://www.wired.com/story/openai-says-gpt-6-can-use-a-computer-better-than-a-human/
- https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
- https://ai.google.dev/gemini-api/docs/models/gemini-3-8-live
- https://mlcommons.org/2026/09/mlperf-inference-v6-1-results/
- https://techstrong.ai/articles/mlperf-inference-v6-1-updated-for-rag-agents-and-api-based-serving/
- https://developer.nvidia.com/blog/tensorrt-edge-llm-completes-the-mlperf-edge-agentic-benchmark-6-4x-faster-on-jetson-agx-thor/
- https://www.salesforce.com/agentforce/koa/
- https://blogs.nvidia.com/blog/jensen-huang-dreamforce/
- https://investor.salesforce.com/news/news-details/2026/Announcing-Koa-Salesforces-First-CRM-Reasoning-Model-Built-on-NVIDIA-Nemotron/default.aspx
Få den dagliga briefingen
AI, kunskapsgrafer och framtidens arbete — i din inkorg varje morgon.
Ingen spam. Avsluta när du vill.