Gids
Een interview transcriberen op je iPhone, zonder cloud
Een interview met een bron die liever niet genoemd wordt is het gevoeligste bestand dat je die week in handen hebt. Het uitschrijven ervan is werk waar niemand op zit te wachten, en dus is er een markt ontstaan die het voor je doet. Bijna al die diensten werken hetzelfde: je audio gaat naar hun server en de tekst komt terug. Voor een teamoverleg is dat een redelijke ruil. Voor een gesprek waarin je anonimiteit hebt beloofd is het een stap die je moeilijk terugdraait.
Wij bouwen Fieldnoter, een app die opnemen en uitschrijven volledig op de iPhone doet, dus lees dit als geschreven door de makers van één van de opties. Wat we willen overbrengen is vooral de aanpak, want die geldt ook als je bij iets anders uitkomt: wat de upload nu eigenlijk betekent, hoe verwerking op het toestel werkt, wat sprekerlabels je opleveren bij een gesprek van twee en waar de techniek gewoon tegen een muur loopt.
In dit artikel
Wat je belooft als je een bron beschermt
Bronbescherming is geen abstractie. Het is een toezegging aan iemand die daar iets voor op het spel zet, en de waarde ervan wordt bepaald door de zwakste schakel in je werkwijze. Je kunt je aantekeningen versleutelen en toch de belofte uithollen door het interview door een dienst te halen die er een kopie van houdt.
Voor onderzoekers ligt het net anders en even hard. Een ethische commissie vraagt tegenwoordig standaard waar interviewaudio wordt verwerkt, en het antwoord “bij een clouddienst” opent een langere discussie. Heb je respondenten anonimiteit toegezegd, dan is de verwerkingsplek onderdeel van die toezegging.
Clouddiensten zijn daarmee nog geen onbetrouwbare partijen. Het probleem zit dieper: een bedrijf dat een kopie van je materiaal beheert kan gevorderd worden of gehackt worden, en dat staat los van hun bedoelingen. Een privacybeleid verandert daar weinig aan, want de kwestie zit in de architectuur en de jurisdictie.
Wat de upload betekent
Bij een clouddienst verlaat de opname je toestel en komt hij op een server terecht. Daarmee ontstaan vragen die je zelf niet kunt beantwoorden. Hoe lang blijft de audio daar staan, ook nadat jij het transcript hebt gedownload? Staat de infrastructuur in de EU, en valt de aanbieder alsnog onder buitenlandse wetgeving? Voor Amerikaanse aanbieders maakt de CLOUD Act die vragen concreet. De AVG-kant werken we uit in notuleren met AI en de AVG.
We willen eerlijk zijn over wat je opgeeft als je die route laat liggen, want clouddiensten en AI-notulisten kunnen dingen die een telefoon niet kan. Ze bieden gedeelde bibliotheken waar een hele redactie of onderzoeksgroep in werkt. Ze sturen een bot je videovergadering in die meeschrijft terwijl jij er niet bij bent. En ze draaien grotere modellen op serverhardware, wat bij echt slechte audio nog steeds verschil maakt. Voor dagelijkse vergadernotities zijn dat redelijke ruilen. Voor materiaal waarbij één kopie op de verkeerde plek een beroepsfout is, zijn het de verkeerde uitgangspunten.
Hoe verwerking op het toestel werkt
Wat er de afgelopen jaren is veranderd, is dat het werk dat een server nodig had nu op de telefoon past. Moderne iPhones hebben een deel van de chip dat Apple voor dit rekenwerk heeft toegevoegd, en de open spraakmodellen waar veel clouddiensten op gebouwd zijn, zijn klein genoeg gemaakt om daarop te draaien. In Fieldnoter gebeurt het hele traject daar: opnemen of importeren, de spraakherkenning, het scheiden van de stemmen en de samenvatting met actiepunten. Er gaat geen audio naar buiten.
Dat is een claim, en claims over privacy horen controleerbaar te zijn. Voor apps op het toestel kost die controle twee minuten.
Zet je toestel in vliegtuigmodus en laat een opname uitschrijven. Komt het volledige transcript terug terwijl alle verbindingen uit staan, dan was er geen server bij betrokken. Blijft de app hangen op een foutmelding, dan ging de audio het toestel af. Doe die test ook op ons; het is de controle die we het liefst op onszelf zien uitgevoerd.
Eén kanttekening noemen we liever zelf dan dat je hem later ontdekt. Bij het instellen van de app wordt een groter spraakmodel eenmalig gedownload, en dat is een echt netwerkmoment. Daarna werkt alles offline. “Raakt nooit het internet” zou dus onjuist zijn; “verwerkt je audio op het toestel” klopt wel. Er is verder geen account, en het App Store-privacylabel staat op Data Not Collected, een claim die Apple toetst. De techniek erachter staat in de factsheet voor IT- en securityteams.
Sprekerlabels bij een interview van twee
Een transcript zonder sprekerlabels is bij een interview half werk. Je zoekt terug wie wat zei, en bij een gesprek van een uur verdwijnt daar een middag in. Sprekerherkenning knipt het transcript op in beurten en zet er een label boven, op hetzelfde toestel als de transcriptie.
Een interview van twee personen is het gunstigste geval dat er is. Twee stemmen, meestal duidelijk verschillend, één microfoon op tafel tussen jullie in. Daar werkt het scheiden van stemmen doorgaans goed en levert het een transcript op dat je van boven naar beneden kunt lezen als een gesprek. De labels beginnen generiek en zijn te vervangen door een echte naam, of je laat ze staan zoals ze zijn. Dat laatste is bij gevoelig materiaal een verdedigbare keuze: als zelfs het transcript risico's oplevert, hoeft de naam van je bron er niet in te staan.
Drie routes naast elkaar
Er zijn grofweg drie manieren om aan een transcript te komen, en ze passen bij verschillende situaties.
| Audio blijft lokaal | Sprekerlabels | Samenvatting | Vliegtuigmodus | Gevoelige bronnen | |
|---|---|---|---|---|---|
| Ingebouwd in de iPhone | Ja | Nee | Beperkt | Ja | Alleen voor losse memo's |
| Clouddienst of AI-notulist | Nee | Ja | Ja | Nee | Zelden |
| App op het toestel | Ja | Ja | Ja | Ja, na de modeldownload | Ja |
De ingebouwde transcriptie van iOS is beter dan mensen denken en kost niets. Voor een snelle memo aan jezelf hoef je niets te installeren. Voor interviewwerk loopt het vast op het ontbreken van sprekerlabels en op het beheren van een reeks gesprekken over langere tijd.
Waar het misgaat
Spraakherkenning is geen opgelost probleem. Dit zijn de situaties waarin je meer nawerk krijgt, ongeacht welke app of dienst je kiest.
- Rumoerige ruimtes. Een café met muziek of een terras aan een drukke straat. Achtergrondgeluid dat in hetzelfde frequentiegebied zit als spraak is het lastigst, en daar is een clouddienst met een groter model soms in het voordeel. Een microfoon dichter bij de spreker helpt meer dan welke softwarekeuze ook.
- Sprekers die door elkaar heen praten. Overlappende spraak is de zwakke plek van sprekerherkenning. Bij een levendige discussie waarin mensen elkaar aanvullen en onderbreken, worden beurten samengevoegd of aan de verkeerde persoon toegeschreven.
- Accenten en dialect. Een zwaar accent of streektaal levert meer fouten op, en een hoog spreektempo maakt dat erger. Dat geldt voor cloudmodellen ook, alleen ligt de drempel daar op een andere plek. Reken bij een sterk accent op een correctieronde.
- Meer dan twee sprekers rond één microfoon. Bij vier of vijf mensen aan tafel wordt het scheiden van stemmen onzekerder, zeker als iemand ver van de telefoon zit.
- Eigennamen en vakjargon. Namen van personen en organisaties die het model niet kent worden fonetisch benaderd. Dat is precies het materiaal dat je in een citaat wilt hebben, dus dat is de eerste plek om na te kijken.
Waar het op neerkomt: het transcript is een werkdocument dat je nakijkt voordat het ergens heen gaat. Elk segment heeft een tijdstempel, dus terugspringen naar de bijbehorende audio kost seconden. Voor citaten die je publiceert is die controle sowieso de norm.
De werkwijze van opname tot archief
Zo ziet de loop eruit bij een interview.
- Vraag toestemming en start de opname. Leg de telefoon tussen jullie in, met het scherm naar boven. Of neem op met de recorder die je gewend bent en importeer het bestand later; beide gaan door dezelfde verwerking op het toestel.
- Laat het transcript maken. Spraakherkenning en het scheiden van de stemmen draaien lokaal, en het duurt ongeveer zo lang als het gesprek zelf.
- Loop de sprekerlabels na. Vervang het generieke label door een naam waar dat kan, en laat het generiek waar dat verstandiger is.
- Gebruik de samenvatting als ingang. De samenvatting met actiepunten wordt op het toestel gemaakt en geeft je de vorm van het gesprek terug. Voor citaten ga je terug naar de audio.
- Beslis wat je bewaart en wat weg kan. Omdat er geen serverkopie bestaat, is een opname die je in de app verwijdert overal weg. Dat maakt een bewaartermijn iets wat je ook echt kunt naleven.
De grens zit bij de export. Zodra je een transcript in een clouddocument plakt, staat de derde partij die je tijdens de verwerking vermeed alsnog in je keten.
Mag je dit gesprek eigenlijk opnemen? De Nederlandse regels op een rij, met de wetsartikelen erbij.
Lees de regels in Nederland →Veelgestelde vragen
Kan ik een interview transcriberen dat ik met een andere recorder heb opgenomen?
Ja. Importeren loopt door dezelfde verwerking op het toestel als een live opname: transcript, sprekerherkenning, samenvatting en actiepunten. Waar het bestand vandaan komt verandert niets aan de plek waar het wordt verwerkt. Wat importeren niet ongedaan maakt is de geschiedenis van het bestand: is de opname met een clouddienst gemaakt, dan kan daar al een kopie staan.
Werkt transcriptie op het toestel echt zonder internet?
Ja, met een eerlijke kanttekening. Bij het instellen van de app wordt een groter spraakmodel eenmalig gedownload; dat is een echt netwerkmoment. Daarna werkt de app offline, en dat kun je nakijken door in vliegtuigmodus een opname te laten uitschrijven.
Hoe goed is de sprekerherkenning bij een interview van twee personen?
Twee sprekers met een duidelijk verschillende stem en één microfoon op tafel is het gunstigste geval, en daar werkt het scheiden van de stemmen doorgaans goed. Het loopt terug bij stemmen die op elkaar lijken en bij mensen die door elkaar heen praten. De labels zijn te corrigeren, wat bij een interview van een uur meestal een paar minuten kost.
Is een transcript nauwkeurig genoeg om uit te citeren?
Voor helder opgenomen audio komt transcriptie op het toestel in de buurt van wat clouddiensten leveren. Voor alles wat je publiceert of indient geldt hetzelfde als altijd: controleer het citaat tegen de opname. Elk segment heeft een tijdstempel, dus die passage terugvinden kost seconden.
Wanneer is een clouddienst juist de betere keuze?
Als je met een team uit dezelfde bibliotheek moet werken, of als je een bot in een videovergadering wilt laten meeschrijven zonder dat je er zelf bij bent. Ook bij zeer rumoerige audio kan een groter model op serverhardware het betere resultaat geven. Voor materiaal waar één kopie op de verkeerde plek een probleem is, wegen die voordelen meestal niet op.
Wat kost Fieldnoter en is er een account nodig?
Er is geen account en geen inlog. De app is gratis te downloaden en bevat vijf gratis transcripties; daarna is het een eenmalige aankoop van 14,99 euro, zonder abonnement. Het App Store-privacylabel staat op Data Not Collected.
We hebben Fieldnoter gebouwd omdat de belofte aan een bron niet mag afhangen van het gereedschap waarmee je het gesprek uitschrijft. Opnemen of importeren, transcriberen, sprekers herkennen en samenvatten gebeurt op je iPhone zelf, zonder account. De vliegtuigmodus-test laat zien of dat klopt, en die zouden we op elke app uitvoeren voordat we er vertrouwelijk materiaal in zetten.
Bekijk Fieldnoter