Pianissimo Meet: lokal transkribering och snabba beslut med Jev

Pianissimo Meet: lokal transkribering och snabba beslut med Jev

Pianissimo Meet: lokal transkribering och snabba beslut med Jev

Jag sa att växthuseffekten inte existerar. Några sekunder senare protesterade min egen mötesapp med en röd varning. Det var ett medvetet test, men det väcker en intressant fråga: vad händer när AI hjälper oss förstå och kontrollera det som sägs medan mötet fortfarande pågår? 😅

En mötesassistent som hjälper till under samtalet

Pianissimo Meet är min egen Windows-app, byggd kring svenska Klang AI:s tal-till-text-modell Pianissimo. Det är alltså mitt fristående experiment, inte en produkt från Klang.

Appen fångar mikrofonen och datorljudet, exempelvis från Teams eller Zoom. Samtalet blir text lokalt på datorn. Sedan får Jev från TypeSafe AI bedöma om något behöver uppmärksammas. Vid behov kopplas Gemini in för att förklara ett begrepp eller kontrollera ett påstående med webbkällor.

Pianissimo transkriberar. Jev bedömer när hjälp behövs. Gemini formulerar hjälpen.

När jag säger ”inferens” kan förklaringen dyka upp utan att någon behöver avbryta och fråga. Det är den sortens vardagsnytta jag ville testa.

Pianissimo jämfört med Whisper och KB-Whisper

Lokal transkribering är inte nytt. OpenAI släppte Whisper redan 2022, med öppna modeller och kod för taligenkänning på flera språk. Whisper kan köras på egen hårdvara; det behöver inte vara en molntjänst.

Sedan kom KB-Whisper från Kungliga bibliotekets KBLab, finjusterad på över 50 000 timmar svenskt tal. I KBLabs publicerade tester slog till och med den mindre modellen KB-Whisper small OpenAI:s betydligt större Whisper large-v3 på svenska. Även KB-Whisper kan köras lokalt.

Pianissimo tar en annan väg. Enligt Klangs modellkort bygger den på Nvidias Parakeet v3, inte Whisper, och har anpassats för svenska. Modellvikterna är tillgängliga under CC BY 4.0.

Här är några resultat ur samma jämförelse i Klangs modellkort. WER är ordfelprocent; lägre är bättre.

Modell Common Voice svenska FLEURS svenska
Whisper large-v3 8,07 % 7,24 %
KB-Whisper large 3,91 % 5,08 %
KB-Whisper medium 5,40 % 6,58 %
Pianissimo 4,46 % 6,51 %

Pianissimo är alltså inte mest träffsäkert i den jämförelsen. KB-Whisper large gör färre fel. Klangs stora argument är hastigheten: omkring 64 gånger högre genomströmning än KB-Whisper large i deras batchtest på en Nvidia A100.

Det är en leverantörsmätning på serverhårdvara, inte ett löfte om samma skillnad på din laptop. Och genomströmning av inspelat ljud är inte samma sak som fördröjningen i en mötesapp.

För Pianissimo Meet är den avvägningen ändå intressant. Jag behöver tillräckligt bra text medan folk pratar, inte bara en fin utskrift efteråt.

I mitt begränsade lokala GPU-test tog tre sekunders ljud ungefär 0,6 sekunder att transkribera.

Vad är Jev egentligen?

Jev är ingen taligenkänningsmodell. Den läser texten från Pianissimo och lämnar bedömningar som programmet kan använda direkt.

Det finns egentligen bara 3 frågetyper:

  • Choice: välj mellan fördefinierade alternativ, exempelvis vilken kategori ett inkommande ärende tillhör.
  • Score: bedöm något enligt beskrivna nivåer, exempelvis hur relevant ett textstycke är.
  • Noul: ange sannolikheten för att svaret på en ja/nej-fråga är ja.

Choice och Score ger också en sannolikhetsfördelning och ett konfidensmått. Flera frågor kan bedömas parallellt mot samma underlag.

Jag tänker på det som en villkorsregel som kan tolka språk.

Vanlig kod kan kontrollera om ordet ”inferens” finns i texten. Jev kan i stället bedöma om samtalet innehåller ett fackbegrepp som sannolikt behöver förklaras. Jag behöver inte försöka skriva en lista över alla krångliga ord i världen.

En vanlig språkmodell kan också klassificera text och lämna strukturerade svar. Jevs poäng är att vara specialbyggd för den uppgiften. Den skriver inte förklaringen, mejlet eller sammanfattningen. Den hjälper programmet att välja nästa steg.

Vad är grejen med hastigheten?

Jev är byggd för en ganska enkel typ av AI-jobb: att fatta snabba beslut.

I stället för att skriva långa svar kan den till exempel avgöra om något är värt att reagera på, välja mellan några alternativ eller ange hur sannolikt något är.

Det passar väldigt bra i Pianissimo Meet.

Appen behöver inte be en stor språkmodell analysera varenda mening i ett långt möte. Jev kan först fungera som ett snabbt filter och avgöra om något behöver förklaras eller faktakollas. Bara då går frågan vidare.

Jev är fortfarande så nytt att många försöker hitta rätt användningsområden för det men man kan redan se flera exempel på det, mer om det nedan.

Så använder jag Jev i Pianissimo Meet

Appen granskar ett rullande fönster med ungefär de senaste 30 sekunderna, omkring var tredje sekund. Mina aktiva frågor skickas tillsammans, men bedöms var för sig. Samma samtal kan alltså ge både en begreppsförklaring och en faktakoll.

Jag kan ställa in egna trösklar för när ett utslag ska skickas vidare. Vid träff får Gemini den relevanta kontexten och instruktionen för just den hjälpen.

Jev avgör alltså om ett påstående bör undersökas. Den röda faktavarningen kommer först efter nästa steg i kedjan.

Appen försöker också undvika upprepningar. Om transkriberingen rättas måste en tidigare insikt kunna dras tillbaka. Annars riskerar jag att bli tillrättavisad för något jag aldrig sa. Det vore ju en lite väl mänsklig mötesassistent. 😇

Vad har andra byggt med Jev?

Det finns redan konkreta exempel utanför min egen dator.

Browser Use har byggt Jev Ultrafast. Jev väljer nästa operation och vilket element i webbläsaren den gäller. En separat språkmodell skriver text när det behövs. Utvecklarna visar en flygsökning på cirka sju sekunder, men betonar att det är en begränsad demonstration, inte ett generellt tillförlitlighetstest.

Kitze har byggt Unclutter. Tillägget låter Jev bedöma vilka delar av en webbsida som är störande eller oväsentliga. Vanlig kod sköter sedan döljandet och återanvänder sparade regler. Osäkra bedömningar lämnas synliga.

TypeSafe visar också Jev som spelar Doom. Modellen får strukturerad information om spelvärlden, inte själva spelbilden. Det är ett exempel på många snabba beslut i följd, inte bevis för att Jev förstår allt på en skärm.

Gemensamt med Pianissimo Meet är arbetsfördelningen: modellen gör avgränsade bedömningar, medan programmet bestämmer vilka handlingar som överhuvudtaget är möjliga. Exemplen är utvecklarnas egna beskrivningar, inte mina jämförande tester.

Lokalt ljud betyder inte att allt är lokalt

Pianissimo Meet transkriberar ljudet på datorn. Men när automatisk hjälp är påslagen skickas textutdrag till Jev och Gemini via molntjänster. Ingen rå mötesaudio skickas i den kedjan.

Det är alltså en kombination av lokal bearbetning och molntjänster, inte en helt offlinebaserad lösning. Transkript och loggar sparas dessutom lokalt och behöver hanteras därefter.

För mig är möjligheten att välja var olika delar körs en viktig del av värdet. Men man måste beskriva hela kedjan, inte bara sätta etiketten ”lokal AI” på appen.

Key Takeaway

Pianissimo Meet visar varför olika AI-modeller kan komplettera varandra: en transkriberar, en väljer när något behöver uppmärksammas och en formulerar hjälpen. Jevs intressanta bidrag är snabba, avgränsade bedömningar som går att bygga in i vanliga program. Börja med ett konkret arbetsmoment och mät om kombinationen faktiskt hjälper.

Vill du veta mer?

Är du nyfiken på hur liknande AI-stöd skulle kunna fungera i ert företag? Hör av dig till mig på AIOlle för en föreläsning, workshop eller ett samtal om era arbetsflöden. Vi kan börja med ett verkligt behov och ett litet test, utan att ni behöver bygga en hel mötesapp först. 😁