Googlen Gemini 3.8 Live siirtyy natiiviin puhe-puhe-teknologiaan

Googlen Gemini 3.8 Live siirtyy natiiviin puhe-puhe-teknologiaan
Google vastasi 15. syyskuuta julkaisemalla Gemini 3.8 Liven ja Gemini 3.8 Live Extended Thinkingin — natiivit puhe-puhe-mallit, jotka ovat nyt saatavilla Gemini API:ssa ja AI Studiossa [3][4]. Molemmat käsittelevät reaaliaikaista dialogia, visuaalisia syötteitä, asynkronisia funktiokutsuja ja taustalla tapahtuvaa työkalujen käyttöä ilman että keskustelun sujuvuus katkeaa — ja perusmalli nousee Speech-to-Speech Quality Indexin kärkeen lukemalla 82,6 [5].
Hinnoittelu on kehittäjille aggressiivinen (0,005 $/min syöte, 0,018 $/min ääntuloste), ja yritysesikatselu on tulossa osaksi Gemini Enterprisea. Huomionarvoista on, että mukana tulee valmiina reaaliaikainen litterointi ja käännös yli 70 kielelle — yksityiskohta, joka merkitsee enemmän kuin ensisilmäyksellä vaikuttaa kaikille, jotka rakentavat monikielisiä kokoustyökaluja.
X:ssä keskustelu keskittyi Workspace- ja Search-integraation näkökulmaan, ja useat kommentoijat nostivat esiin matalan viiveen ja taustatyökalujen käytön todellisena läpimurtona liiketoimintasovelluksille — ei pelkästään kuluttajien ääniavustajille.
MLCommons standardoi RAG- ja agenttijärjestelmien vertailutestit
MLCommons julkaisi 16. syyskuuta MLPerf Inference v6.1 -version, ja pääuutinen on End-to-End RAG -vertailutesti, joka vihdoin testaa koko upotus-haku-uudelleenjärjestely-päättely-putken, sekä Edge Agentic Inference -vertailutesti monivaiheisille tehtäville, joissa konteksti kasvaa [6][7]. Osallistujamäärä nousi ennätykseen, mikä viestii siitä, että ala pitää nyt hakuavusteisia järjestelmiä (RAG) ydininfrastruktuurina, jota kannattaa mitata tarkasti — ei enää sivujuonteena.
NVIDIAn tulokset osoittivat hyödyn konkreettisesti — 6,4 kertaa nopeampi suorituskyky Jetson AGX Thor -alustalla agenttipohjaisissa työkuormissa [8]. Kaikille, jotka rakentavat tai hankkivat tietohakujärjestelmiä, tämä on ensimmäinen kerta, kun on olemassa standardoitu ja vertailukelpoinen tapa kysyä "kuinka hyvä tämä RAG-putki oikeasti on?" sen sijaan, että luotettaisiin pelkkään myyjän markkinointipuheeseen.
Tekoälytutkijat X:ssä pitivät tätä myöhässä tulleena mutta tervetulleena uudistuksena, sillä yritysostajat, jotka ovat arvioineet tiedonhallinta- ja hakutyökaluja, ovat tähän asti joutuneet ilman yhteismitallisia vertailutestejä.
Salesforce ja NVIDIA julkaisevat Koan, CRM-natiivin päättelymallin
Dreamforce-tapahtumassa 15. syyskuuta Salesforce ja NVIDIA esittelivät Koan, Salesforcen ensimmäisen CRM-kohtaisen päättelymallin, joka on jälkikoulutettu NVIDIA Nemotron 3 Super -mallin pohjalta käyttäen synteettisiä työnkulkuja, jotka on koostettu 27 vuoden CRM-datasta yli 14 toimialalta — huomionarvoista on, ettei koulutuksessa käytetty lainkaan asiakasdataa [9][10]. Jensen Huang kuvasi tätä Dreamforcessa käännekohdaksi: "nyt voimme tietää kaiken ja tehdä mitä tahansa" [11].
Agentforceen integroituna Koa tuottaa 11 %:n parannuksen tarkkuudessa, 2,1-kertaisen parannuksen kontekstin muistamisessa ja kolme kertaa vähemmän virheitä CRM Bench -tehtävissä, kuten mahdollisuuksien päivityksissä ja tapausten ohjauksessa [10]. Pilottiasiakkaisiin kuuluvat muun muassa Formula 1 ja UChicago Medicine, ja yleinen saatavuus on suunniteltu talveksi 2026.
Myynnin ja yritysmaailman äänet X:ssä tarttuivat erityisesti token-tehokkuuden näkökulmaan — toimialakohtainen päättelymalli, joka tuhlaa vähemmän kontekstia ja tekee vähemmän virheitä, on suora signaali siitä, että vertikaalinen, työnkulkuun sidottu tekoäly alkaa voittaa yleismalleja niiden omalla pelikentällä.
Mitä tämä tarkoittaa kokouksillesi
Tämänpäiväiset uutiset ovat oikeastaan yksi ja sama tarina neljällä eri tavalla kerrottuna: puhe, päättely, tiedonhaku ja toimialakohtainen muisti ovat sulautumassa yhdeksi odotukseksi — että tekoälyjärjestelmien tulisi kuulla mitä tapahtuu, ymmärtää se ja muistaa se tarkasti kuukausien päästä. GPT-Live-1 ja Gemini 3.8 Live todistavat molemmat, että täysduplex, matalan viiveen ääni on nyt perusvaatimus, ei erottautumistekijä. Erottautumistekijä on se, mitä tapahtuu keskustelun jälkeen — kuinka hyvin järjestelmä hakee ja päättelee sanotun perusteella.
Juuri tässä MLCommonsin uusi RAG-vertailutesti ja Salesforcen Koa ovat opettavaisia. Koan parannukset eivät syntyneet suuremmasta mallista, vaan koulutuksesta realistisella työnkulkudatalla ja tarkan muistamisen palkitsemisesta yleisen sujuvuuden sijaan — sama periaate, joka erottaa kokoustyökalun, joka pelkästään litteroi sanat, työkalusta, joka todella rakentaa käyttökelpoista organisaation muistia. Kokoustesi tietoverkko on vain niin hyvä kuin sen hakulaadun taso, ja nyt on vihdoin olemassa standardoitu tapa mitata tätä sen sijaan, että pitäisi luottaa myyjän sanaan.
Kokousälyalustoihin luottaville tiimeille viesti on selvä: "pelkän litteroinnin" aikakausi on ohi. Rima on nyt täysduplex-keskusteluymmärrys, tarkka puhujantunnistus ja tiedonhaku, joka kestää tiukan vertailutestauksen — koko kokoushistoriasi ajalta, ei vain viimeisimmän puhelun osalta.
Keskeinen huomio: Ääni-AI:sta on tulossa nopeasti kaikkien saatavilla oleva perushyödyke — todellinen kilpailuetu siirtyy hakulaatuun ja pitkäaikaiseen muistiin, ja juuri tätä maaperää kokousälytyökalut kuten Proudfrog on rakennettu hallitsemaan.
Sources
- https://openai.com/index/gpt-6-astra-next-generation-work/
- https://openai.com/index/introducing-gpt-live-1-in-the-api/
- https://www.wired.com/story/openai-says-gpt-6-can-use-a-computer-better-than-a-human/
- https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
- https://ai.google.dev/gemini-api/docs/models/gemini-3-8-live
- https://mlcommons.org/2026/09/mlperf-inference-v6-1-results/
- https://techstrong.ai/articles/mlperf-inference-v6-1-updated-for-rag-agents-and-api-based-serving/
- https://developer.nvidia.com/blog/tensorrt-edge-llm-completes-the-mlperf-edge-agentic-benchmark-6-4x-faster-on-jetson-agx-thor/
- https://www.salesforce.com/agentforce/koa/
- https://blogs.nvidia.com/blog/jensen-huang-dreamforce/
- https://investor.salesforce.com/news/news-details/2026/Announcing-Koa-Salesforces-First-CRM-Reasoning-Model-Built-on-NVIDIA-Nemotron/default.aspx
Tilaa päiväkatsaus
Tekoäly, tietograafit ja työn tulevaisuus — sähköpostiisi joka aamu.
Ei roskapostia. Peru milloin tahansa.