Smallest.ai julkaisee Pulse STT:n tarkemmalla puhujantunnistuksella

orchestrationenterprise-aiagentsinfrastructure
Team collaborating around a conference table with notes and a timeline

Smallest.ai julkaisee Pulse STT:n tarkemmalla puhujantunnistuksella

Smallest.ai:n Pulse-malli hoitaa nyt puhujien erottelun sekä erä- että suoratoistotilassa, ja se antaa varmuuspisteytetyt puhujatunnisteet reaaliajassa [1]. Pääotsikon ominaisuus on nopeus — 64 millisekunnin viive yli 38 kielellä — mutta kokousvetoisille tiimeille kiinnostavampi yksityiskohta on puhujamäärän kattoraja: ei-suoratoistotila toimii luotettavasti neljään puhujaan asti, minkä jälkeen tarkkuus heikkenee, kun taas suoratoistotila selviää huomattavasti useammasta puhujasta [2].

Tämä on hiljainen mutta tärkeä myönnytys alalta: puhujantunnistus laajassa mittakaavassa — se klassinen 8–10 hengen kokoushuone — on yhä se vaikea ongelma, jota kukaan ei ole täysin ratkaissut. Smallest.ai tähtää selvästi B2B-infrastruktuurikerrokseen työkalujen kuten Fireflies, Otter, Fathom ja Granola alla, asemoiden Pulsen moottoriksi sovelluksen sijaan [3].

X:n reaktiot olivat innostuneita tarkkuuden paranemisesta suuremmissa kokouksissa, vaikka väitteitä "korkeasta tarkkuudesta 8–10 puhujalla" kannattaa suhtautua hieman varauksella, kunnes riippumattomia vertailutestejä saadaan. Siitä huolimatta, jos puhujantunnistusinfrastruktuuri jatkaa kehittymistään tähän tahtiin, kuilu "kuka sanoi mitä" -tarkkuuden välillä kahden hengen puhelussa ja 10 hengen yhteiskokouksessa pitäisi kaventua nopeasti.

IBM nostaa agenttipohjaiset tietograafit uudeksi tekoälyn muistikerrokseksi

IBM julkaisi yhdessä edX:n ja Pluralsightin kanssa noin tunnin mittaisen kurssin agenttipohjaisten tietograafien rakentamisesta — se kattaa entiteetit, suhteet, ontologiat sekä sen, miten agentit poimivat ja yhdistävät strukturoitua ja strukturoimatonta dataa muistiin moniagenttijärjestelmiä varten [1]. Kurssi istuu IBM:n laajemman agenttipohjaisen tekoälyn opetussuunnitelman rinnalle, joka kattaa LangGraphin, ReActin ja orkestroinnin, ja siinä viitataan työkaluihin kuten Neo4j ja LangChain selitettävää, moniaskelista päättelyä varten [2].

Taustalla oleva viesti on isompi kuin pelkkä koulutuskurssi: tietograafeja asemoidaan uudelleen — ei enää mukavana visualisointikerroksena vaan varsinaisena muistialustana tekoälyagenteille, joiden täytyy päätellä ajan, kontekstin ja suhteiden pohjalta sen sijaan, että ne vain hakisivat samankaltaista tekstiä. Tämä on merkittävästi erilainen arkkitehtuuri kuin upotuksilla täytetty vektoritietokanta.

X:n keskustelu kiinnittyi henkilökohtaisen tiedonhallinnan (PKM) näkökulmaan — ihmiset vetivät yhtäläisyyksiä näiden yritystason kehysten ja henkilökohtaisten tietotyökalujen, kuten Obsidianin, välille, ehdottaen että samat periaatteet (entiteetit, suhteet, selitettävä haku) pätevät riippumatta siitä, rakennetaanko yrityksen vai yksityishenkilön "aivoja" [3].

HydraDB julkaisee aikatietoiset kontekstigraafit yritysten tekoälymuistiin

HydraDB julkaisi sen, mitä se kutsuu tekoälyn "puuttuvaksi kontekstikerrokseksi": ajallisia tietograafeja, jotka kohtelevat aikaa ensiluokkaisena elementtinä, voimassaoloikkunoineen, aikaleimoineen ja Git-tyylisellä vain-lisäävällä versioinnilla [1]. Järjestelmä yhdistää hybridihaun — vektorihaun, graafin läpikäynnin ja tuoreuspainotuksen — automaattiseen entiteettien ja suhteiden poimintaan tallennusvaiheessa, ja se on suunnattu suoraan yritystiimeille, jotka yrittävät seurata, miten faktat, ihmiset ja päätökset kehittyvät ajan myötä [2].

Vertailuluvut ovat huomionarvoisia: 90,79 % tarkkuus LongMemEval-S-testissä Gemini 3.0 Prolla, haulla alle 200 millisekunnin vasteajalla, ja väitetysti parempi suorituskyky kuin tavallisilla vektoritietokannoilla nimenomaan ajallisen päättelyn tehtävissä [3]. Tässä onkin koko idean ydin — tavallinen vektorihaku on hyvä vastaamaan "mikä on samankaltaista", mutta huono vastaamaan "mikä muuttui ja milloin", ja juuri tällainen kysymys on tärkein silloin, kun yrität muistaa, mitä päätettiin kolme kokousta sitten verrattuna siihen, mikä pitää paikkansa tänään.

X:n julkaisut asettivat HydraDB:n nimenomaisesti vastakkain vektoritietokantojen kanssa, markkinoiden sitä oikeana alustana ihmisten, projektien ja muuttuvan kontekstin muistamiseen pitkissä tekoälyavusteisissa työsuhteissa — ei vain yksittäisen istunnon muistamiseen.

Mitä tämä tarkoittaa sinun kokouksillesi

Neljä uutista, yksi teema: ala on yhtä mieltä siitä, että kokouksen litterointi on arvoton ilman rakennetta, muistia ja aikaa. Googlen offline-panostus osoittaa, että käyttäjät haluavat keskustelujensa pysyvän yksityisinä oletusarvoisesti. Smallest.ai:n puhujantunnistuksen parannukset osoittavat, että perustavanlaatuista "kuka sanoi mitä" -ongelmaa yhä ratkotaan aktiivisesti, ei ole vielä ratkaistu loppuun. Ja sekä IBM:n kurssi että HydraDB:n julkaisu esittävät saman argumentin eri kulmista — että tietograafit, eivät litteät litteroinnit tai upotukset, ovat se, mikä antaa tekoälylle mahdollisuuden oikeasti päätellä historiastasi sen sijaan, että se vain hakisi siitä.

Tämä on juuri sitä aluetta, jolle Proudfrog on asemoitunut alusta asti. Litterointityökalu, joka vain litteroi, on vuonna 2026 perusvaatimus; todellinen arvo syntyy siitä, mitä tapahtuu kokouksen päätyttyä — dialogin muuttamisesta strukturoiduksi, puhujakohtaisesti merkityksi, ajallisesti tietoiseksi tietograafiksi, jota tekoälyavustajasi voi käydä läpi kuukausia myöhemmin, kun kysyt "mitä sovimme sen toimittajan kanssa maaliskuussa, ja onko jotain muuttunut sen jälkeen?" Tämä on ajallinen päättelykysymys, ei avainsanahaku, ja tämänpäiväiset uutiset vahvistavat, että koko ala kilpailee kohti graafipohjaista muistia vastatakseen juuri siihen.

Ammattilaisille, jotka hukkuvat peräkkäisiin puheluihin, käytännön seuraus on tämä: pitkällä aikavälillä voittavat työkalut eivät ole niitä, joilla on siistein live-litterointi, vaan niitä, joiden avulla voit hakea, yhdistää ja luottaa siihen, mitä sanottiin — yksityisesti, tarkasti ja täydellä ymmärryksellä siitä, miten projektisi ovat kehittyneet ajan myötä.

Keskeinen huomio: Litteroinnista on tulossa hyödyke — yksityisyys, puhujantunnistuksen tarkkuus ja aikatietoiset tietograafit ovat se, missä todellinen kilpailutaistelu kokoustiedostasi nyt käydään.

Sources

  1. https://www.theverge.com/tech/1007985/google-ai-notetaking-app-transcribe-offline
  2. https://www.cnet.com/tech/services-and-software/google-ai-note-taker-edge-foresight/
  3. https://www.notebookcheck.net/Google-AI-Edge-Foresight-Offline-AI-for-meeting-notes-on-Mac.1418337.0.html
  4. https://docs.smallest.ai/models/speech-to-text/features/diarization
  5. https://smallest.ai/speech-to-text
  6. https://docs.smallest.ai/waves/model-cards/speech-to-text/pulse
  7. https://www.pluralsight.com/courses/agentic-knowledge-graphs
  8. https://www.edx.org/learn/computer-science/agentic-ai-with-langchain-and-langgraph
  9. https://developer.ibm.com/technologies/agentic-ai/learningpaths/
  10. https://hydradb.com/blog/temporal-knowledge-graphs-tracking-how-ai-context-evolves-over-time
  11. https://docs.hydradb.com/essentials/v2/context-graphs
  12. https://hydradb.com/blog/knowledge-graph-memory-systems-ai-agents

Tilaa päiväkatsaus

Tekoäly, tietograafit ja työn tulevaisuus — sähköpostiisi joka aamu.

Ei roskapostia. Peru milloin tahansa.