Introductie van Gemini 3.5 Transcribe

  • Diego Melendo Casado, Senior Director, Engineering, Gemini Audio
  • Luke Leonhard, Chief of Staff, Gemini Audio, namens het Gemini Audio Team

Ons nieuwste spraak-naar-tekstmodel is ontworpen voor nauwkeurige en intelligente transcriptie in realtime.

Vandaag introduceren we Gemini 3.5 Transcribe, ons tot nu toe meest nauwkeurige spraak-naar-tekstmodel, ontworpen voor intelligente spraakinteracties. In tegenstelling tot conventionele spraakherkenningsmodellen die moeite hebben met achtergrondruis, complex jargon en het opschonen van spreekfouten (disfluenties), zet Gemini 3.5 Transcribe ruwe audio direct om in nauwkeurige, gepolijste en geformatteerde tekst.

Consumenten profiteren al van dit transcriptiemodel in producten zoals de Gemini-app en op Android, met nieuwe spraakfunctionaliteiten zoals Rambler op Android en in de Gemini-app op macOS. Nu kunnen ontwikkelaars soortgelijke functionaliteiten bouwen met Gemini 3.5 Transcribe in de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform.

We hebben 3.5 Transcribe zo gebouwd dat het naadloos in developer-workflows past, of u nu spraakagenten, realtime ondertitelingshulpmiddelen of analysepijplijnen voor na het bellen bouwt. Het model is beschikbaar via twee aparte API's:

  • Real-time streaming: Levert continue, bidirectionele streaming met een latentie van minder dan een seconde voor interactieve spraakapps via de Live API met gemini-3.5-transcribe-live.
  • Verwerking van vooraf opgenomen audio: Transcribeert opgenomen audio, vergaderingen, call-logs en meer, inclusief sprekeridentificatie en tijdstempels op woordniveau via de Interactions API met gemini-3.5-transcribe.

Nauwkeurigere en intelligentere transcriptie

Gemini 3.5 Transcribe is ontworpen om uw natuurlijke spreekstijl vast te leggen om uw intentie beter te begrijpen en aangepast vocabulaire te herkennen, zodat u taken met uw stem kunt uitvoeren.

  • Slimme transcriptie: Gaat naadloos om met zelfcorrecties (zoals "laten we dinsdag afspreken—nee, woensdag"), verwijdert stopwoorden ("uhm" en "ah") en formateert uw tekst automatisch.
  • Function calling: Het model kan complexe taken (zoals het genereren van afbeeldingen en bestandanalyse) delegeren aan andere Gemini-modellen via functieaanroepen. Momenteel beschikbaar in de Gemini macOS-app.
  • Hogere precisie: Volgens metingen van Artificial Analysis behaalt het model een gemiddelde Word Error Rate (WER) van 4,0% voor streaming en 2,6% voor niet-streaming scenario's. Het presteert sterk in luidruchtige, praktijkomgevingen en legt alfanumerieke entiteiten zoals postcodes en order-ID's nauwkeurig vast.
  • Aangepast vocabulaire: Herkent gespecialiseerd jargon en unieke spellingen door transcripties naadloos aan te passen aan het door u opgegeven aangepaste vocabulaire.
  • Wereldwijde taalondersteuning: Detecteert en transcribeert automatisch meer dan 85 talen en gaat naadloos om met regionale accenten en diverse dialecten.
  • Identificatie van meerdere sprekers: Kent spraak in vooraf opgenomen audio nauwkeurig toe aan maximaal drie sprekers met tijdstempels (ondersteuning voor 3+ sprekers is experimenteel).

Bijschrift: Gemini 3.5 Transcribe verwerkt live taalwisselingen en naadloze streaming-transcriptie. Bekijk hoe Gemini 3.5 Transcribe spreekfouten opschoont met slimme transcriptiefunctionaliteiten. 3.5 Transcribe levert transcriptie met toeschrijving aan meerdere sprekers en tijdstempels op woordniveau.

De prestaties van Gemini 3.5 Transcribe vormen een grote vooruitgang ten opzichte van ons vorige transcriptiemodel, Chirp 3, door nieuwe functionaliteiten, verbeterde Word Error Rates en aanzienlijk lagere latentie. Volgens Artificial Analysis is de tijd tot de definitieve transcriptie bijvoorbeeld met 70% verbeterd. Op de FLEURS-benchmark voor een set top-talen en locaties levert het model nauwkeurige meertalige prestaties die beter zijn dan die van Chirp 3, met een WER van 5,50% in streaming-modus en 5,04% in niet-streaming scenario's.

Ervaar slimme transcriptie en geavanceerde dicteerfuncties

Naast de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform, gaat 3.5 Transcribe verder dan standaard spraak-naar-tekst om werken binnen Google natuurlijker en intuïtiever te maken. Door contextbewust begrip direct te integreren in dagelijkse interfaces zoals Gboard, Antigravity, de Gemini-app en Chrome, worden nuances, intenties en inline-bewerkingen met gemak vastgelegd.

  • Op Gboard voor Android: Via de nieuwe Rambler-functie transformeert 3.5 Transcribe gesproken gedachten in goed geformatteerde tekst door stopwoorden te filteren. U kunt ook uw stem gebruiken om bewerkingen aan te brengen, spelfouten te corrigeren en de schrijfstijl te wijzigen.
  • Op Google Antigravity: Met uw toestemming combineert 3.5 Transcribe schermcontext en chatgeschiedenis om een uiterst nauwkeurige transcriptie te garanderen van bestandsnamen, gedachten van de agent en actieve documenten.
  • In Google AI Studio: U heeft toegang tot 3.5 Transcribe in de Build-modus om ter plekke apps te "vibe coden" met uw stem.
  • In de Gemini-app op macOS: 3.5 Transcribe transcribeert niet alleen uw natuurlijke spraak naar schone, geformatteerde tekst, maar maakt ook spraakcommando's mogelijk die naadloos samenwerken met de schermcontext voor complexe workflows. Door op de achtergrond andere Gemini-modellen aan te roepen voor het zware werk, is het eenvoudig om lokale bestanden samen te vatten, tekst tussen apps te hergebruiken of afbeeldingen te genereren direct bij uw cursor—alleen met uw stem.
  • Binnenkort in Chrome: U kunt in elk webveld praten om te typen, waardoor het moeiteloos wordt om reacties te dicteren, berichten te schetsen of Gemini in Chrome op een natuurlijkere manier aan te sturen met uw stem.

Bijschriften: Gemini 3.5 Transcribe stelt u in staat om bestanden te analyseren, afbeeldingen te genereren en te zoeken in de Gemini-app op macOS met alleen uw stem. Bekijk hoe Gemini 3.5 Transcribe Rambler op Android gebruikt om automatisch stopwoorden te verwijderen en spraak op te schonen. Gemini 3.5 Transcribe maakt gebruik van schermcontext op Google Antigravity om een nauwkeurige transcriptie te garanderen.

Vroege recensies

Door gebruik te maken van de Gemini Live API stellen developer-platforms zoals Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel en Vision Agents ontwikkelaars in staat om met gemak hoogwaardige, spraakgestuurde interfaces te bouwen en te implementeren. Deze platforms beheren de complexe infrastructuur voor realtime mediastreaming op de achtergrond, waardoor ontwikkelaars zich volledig kunnen concentreren op de gebruikerservaring.

Bedrijven zoals vivo, Intellitek Health en Lingopal hebben ook positieve feedback gegeven over 3.5 Transcribe, waarbij ze wijzen op de indrukwekkende latentie, nauwkeurigheid en uitgebreide taalondersteuning.

Start vandaag nog met 3.5 Transcribe

  • Voor ontwikkelaars: Beschikbaar in public preview in de Gemini API via Google AI Studio en Google Antigravity.
  • Voor ondernemingen: Beschikbaar in public preview via het Gemini Enterprise Agent Platform en binnenkort beschikbaar voor Gemini Enterprise for Customer Experience.
  • Voor iedereen: Beschikbaar in de Gemini-app op macOS (Engels), Rambler op Android in selecte landen en talen, en binnenkort in Chrome.