smallest.ai's Pulse-model tager tronen inden for diarisering

LLMinfrastructure
Team collaborating around a table with notes and transcripts connected by strings

smallest.ai's Pulse-model tager tronen inden for diarisering

Speaker-diarisering — at vide hvem der sagde hvad — har stille og roligt været det sværeste problem inden for mødetranskription, og smallest.ai har netop præsenteret et solidt resultat. Deres Pulse-model toppede VoiceArena Diarization Bench v1 den 7. oktober 2026 med 24,4% DER på tværs af 139 samtaler og 280+ talere — en 1,7x forbedring i forhold til ElevenLabs Scribe v2 (40,71%), AssemblyAI (44,64%) og Deepgram (67,13%) [4][5][6].

Fremskridtene holder stik både i rodede fysiske møder (24,7% DER) og renere online-opkald (22,4% DER), med streaming-understøttelse af flere talere på 21+ sprog. Det tal for fysiske møder betyder mere, end det ser ud til — de fleste benchmarks smigrer sig selv med ren Zoom-lyd, så en model, der holder sammen i et støjende mødelokale, er den, der reelt er brugbar til ægte mødeintelligens.

Reaktionerne på X var ligefrem lykønskning blandet med det oplagte opfølgende spørgsmål: hvor hurtigt siver det her ned i de forbrugerrettede mødeværktøjer, alle allerede bruger?

Hybrid søgning bliver stille og roligt RAG-standarden

En jævn strøm af tutorials i denne periode landede på den samme arkitektur: at parre BM25-nøgleordssøgning med vektorembeddings i én samlet søgepipeline. LangChains EnsembleRetriever kombineret med ChromaDB og Nomic-embeddings er den referencestak, der dukker op overalt, typisk med 50/50-vægtning og Reciprocal Rank Fusion til at sammenflette resultaterne [7][8][9].

Appellen er praktisk, ikke akademisk — ren semantisk søgning er god til "find mig det overordnede indhold", men dårlig til "find mig den præcise sætning, nogen sagde." Hybrid søgning lukker det hul, hvilket betyder enormt meget, når man søger i måneders mødereferater i stedet for en håndfuld dokumenter.

Udviklere på X behandler det mindre som en forskningskuriositet og mere som en forudsætning for alle, der bygger en seriøs vidensbase oven på mødedata — et tegn på, at RAG-værktøjerne omkring transkriptioner standardiseres hurtigt.

Mødereferater bliver til levende videngrafer

Den mest interessante tendens denne måned er ikke et enkelt produkt — det er et mønster. Flere projekter konverterer nu rå mødetranskriptioner til strukturerede, forespørgselsbare videngrafer. Meetily skubber lokal transkription ind i Obsidian-baserede grafer med tilknyttede opgaver [10]. Et andet projekt bruger LLM-udtræk til at bygge selvopdaterende Neo4j-grafer, der forbinder møder, personer og opgaver via relationer som DELTOG_I [11]. Og en tl;dv + Cognee-integration bygger entitetsgrafer, der er direkte designet til at besvare spørgsmål som "hvem meldte sig til X" eller "hvad blokerer for Y" [12].

Det er skiftet fra transskription-som-arkiv til transskription-som-infrastruktur. Ingen vil have en bunke søgbar tekst; de vil have et system, der husker relationer — hvem forpligtede sig til hvad, hvornår, og om det skete. X-tråde om emnet bruger i stigende grad udtrykket "second brain" ("ekstra hjerne"), og det hænger ved, fordi det er præcist: disse systemer begynder at opføre sig mindre som notat-apps og mere som institutionel hukommelse.

Hvad det betyder for dine møder

Sæt disse fire historier sammen, og der tegner sig et klart billede: mødeintelligens-stakken deler sig op i lag, og hvert lag får uafhængigt et seriøst løft. Optagelsen bliver mere præcis (Pulses fremskridt inden for diarisering), søgningen bliver smartere (hybrid søgning bliver standarden), og outputlaget udvikler sig fra flade resuméer til strukturerede videngrafer, der forstår relationer mellem mennesker, beslutninger og opgaver. Sammenligningerne på assistent-markedet er reelt en stedfortræderkrig om, hvilket firma bedst syr disse lag sammen.

For Proudfrog er det et bekræftende tegn. Et nordisk-bygget værktøj, der allerede kombinerer præcis talergenkendelse med en videngraf på tværs af hele din mødehistorik, jager ikke en trend — det er bygget til dér, hvor kategorien er på vej hen. Diariserings-benchmarks viser, hvorfor "hvem sagde det" stadig kræver dedikeret ingeniørarbejde og ikke bare er en eftertanke hægtet på en transskriptions-API. Og hybrid søgningsmønstret bekræfter, at det at søge godt i et mødearkiv kræver mere end vektorsøgning alene — præcise navne, projektkodenavne og konkrete forpligtelser kræver nøgleordspræcision sammen med semantisk genkaldelse.

Det praktiske resultat for fagfolk: din mødehistorik bliver et aktiv, du kan udspørge, ikke bare et referat, du skimmer igennem én gang og glemmer. De værktøjer, der indhenter hinanden hurtigst, er dem, der behandler præcision, struktur og søgning som ét sammenhængende problem frem for tre separate funktioner.

Konklusion: Mødeintelligens modnes fra "optag og opsummer" til "husk og ræsonnér" — og de værktøjer, der forbinder præcis optagelse med en struktureret, forespørgselsbar videngraf, vil definere kategorien.

Sources

  1. https://www.remogrid.com/blog/ai-tools/best-ai-meeting-assistants-2026
  2. https://sieva.co/best/ai-meeting-assistants/
  3. https://www.techrepublic.com/article/news-best-ai-meeting-note-takers-2026/
  4. https://docs.smallest.ai/models/speech-to-text/benchmarks/performance
  5. https://x.com/smallest_AI/status/2107680800045183003
  6. https://docs.smallest.ai/waves/model-cards/speech-to-text/pulse
  7. https://www.youtube.com/watch?v=Hn0UK2l1Nkw
  8. https://stackoverflow.com/questions/79477745/bm25retriever-chromadb-hybrid-search-optimization-using-langchain
  9. https://www.mintlify.com/chroma-core/chroma/guides/hybrid-search
  10. https://meetily.ai/blog/the-decision-makers-second-brain
  11. https://pub.towardsai.net/building-a-self-updating-knowledge-graph-from-meeting-notes-with-llm-extraction-and-neo4j-b02d3d62a251
  12. https://dev.to/insane_odyssey/turning-meeting-transcripts-into-an-ai-knowledge-graph-with-tldv-cognee-57e7

Få den daglige briefing

AI, videngrafer og fremtidens arbejde — i din indbakke hver morgen.

Ingen spam. Afmeld når som helst.