FÜR ENTWICKLER IM GETEILTEN BÜRO

Prompts sprechen.
Ohne Publikum.

Halte dein iPhone nah an den Mund und drücke zum Sprechen. Du kannst leise bleiben; dein Mac transkribiert lokal und setzt den Text genau dort ein, wo dein Cursor steht.

Ein Entwickler spricht in einem Großraumbüro leise in sein iPhone, während Text auf dem Mac erscheint

01 / DIE EINFACHE IDEE

Der Mac steht auf dem Tisch. Das iPhone kann wenige Zentimeter entfernt sein.

Das MacBook-Mikrofon nimmt neben deiner Stimme auch Tastatur, Lüftung und Gespräche auf. Ist das Mikrofon nah am Mund, kommt deine Stimme zuerst und deutlich stärker an. So musst du nicht lauter werden und die Erkennung muss schlechteres Ausgangsmaterial nicht nachträglich retten.

IPHONE → MAC / SO FÜHLT ES SICH AN

Leise ins iPhone sprechen. Der Text landet direkt in Codex.

Das iPhone übernimmt die Nahaufnahme. Verschlüsseltes Audio geht an den gekoppelten Mac, wird dort lokal erkannt und am aktiven Cursor eingefügt.

Codex / Claude Codeslowmap / prototype
Routenpräferenzen werden erstelltScenicRouteRanker.swift
Erstelle eine Karte für Spazierwege, die Schatten, Lärm und Steigung bewertet, statt nur die schnellste Strecke zu wählen.
Die helle Sprechansicht von undervoice auf einem iPhone 17 Pro Max
AM SCHREIBTISCH01
Leises Sprechen in ein iPhone am Arbeitsplatz

Prompts, ohne sie vorzutragen

Erkläre Änderung, Fehler oder Sonderfall mit leiser Stimme. Das restliche Büro muss nicht zuhören.

NAHBESPRECHUNG02
Ein iPhone wird nah an den Mund gehalten

Deine Stimme bekommt den Vorsprung

Nahbesprechung macht das Büro nicht still. Sie sorgt dafür, dass deine Stimme schon vor der Erkennung stärker ist als der Raum.

IM CODING-FLOW03

Bleib bei deinen Werkzeugen

Der Fokus bleibt in Codex, Claude Code, Xcode, Terminal oder im Browser. Das Transkript erscheint am Cursor.

02 / WAS AM ARBEITSPLATZ ZÄHLT

Nachvollziehbare Zahlen statt Zauberei.

Diese Werte erklären die Nutzung im Alltag: Mikrofonabstand, Audioweg und Schritte nach dem Sprechen.

5–10 cm

Das Mikrofon kommt zu dir

Das iPhone ist wenige Zentimeter vom Mund entfernt; das MacBook bleibt 50–80 cm entfernt auf dem Tisch.

14–24 dB

Weniger Lautstärke bei gleichem Pegel

Reine Abstandsrechnung für 5–10 cm gegenüber 50–80 cm. Raum, Winkel und Mikrofone verändern das Ergebnis.

0 Cloud-Audio

Kein Umweg über einen Transkriptionsdienst

Die Erkennung läuft auf deinem Mac. Ist das Modell installiert, funktioniert sie lokal ohne öffentliches Internet.

0 Audiodateien

Keine Aufnahmen zum Aufräumen

Audio wird im Arbeitsspeicher verarbeitet und danach verworfen—auf beiden Geräten.

0 Copy & Paste

Der Text landet am Cursor

Keine zweite App, kein Zwischenablagen-Pingpong, kein Kontextwechsel.

1 Stunde

Kurzer lokaler Verlauf ab Werk

Der Mac-Verlauf steht standardmäßig auf eine Stunde und lässt sich ganz deaktivieren.

Prüfbare Grenzen:nur gekoppelte Geräte; kein Audio-Upload und keine Audiodateien; Stopp bei Fokuswechsel; keine Eingabe in Passwort- oder Secure-Input-Felder.

03 / MODELLE UND SPRACHEN

Sieben Kernsprachen. Englische Fachbegriffe inklusive.

undervoice verwendet abgestimmte Sprachpakete statt eines vermeintlichen Universalmodells. In Deutsch, Französisch, Spanisch, Chinesisch, Japanisch und Koreanisch kannst du englische Bibliotheksnamen, Variablen und Befehle einfach mitsprechen; dazu gibt es einen reinen Englischmodus.

中文 + EnglishEnglish日本語 + EnglishDeutsch + EnglishFrançais + EnglishEspañol + English한국어 + English
ZH + ENLOCAL

Chinesisch mit englischen Begriffen

Ein bilinguales Streaming-Modell liefert die Vorschau; Paraformer oder FireRedASR2 CTC erzeugt den finalen Text. Satzzeichen entstehen lokal.

Laufzeit
sherpa-onnx
Optimierung
INT8 ONNX
AUSGELEGT AUF
schnelle Vorschau, präziser Abschluss
EN / DE / FR / ESLOCAL

Vier europäische Sprachpakete

NVIDIA Parakeet TDT 0.6B v3 arbeitet in den für das Produkt abgestimmten Paketen für Englisch, Deutsch, Französisch und Spanisch.

Laufzeit
sherpa-onnx
Optimierung
INT8 ONNX
UPSTREAM-BENCHMARK
durchschnittlich 6,34 % WER
JA + ENLOCAL

Japanisch, das englische Begriffe behält

Kotoba Whisper Bilingual v1.0 wurde für Japanisch, Englisch und den Wechsel zwischen beiden trainiert.

Laufzeit
whisper.cpp
Optimierung
Q5_0
UPSTREAM-BENCHMARK
9,3–16,8 % japanische CER
KO + ENLOCAL

Koreanisch mit Namen, Befehlen und Kürzeln

Whisper Large v3 Turbo verarbeitet koreanische Sätze samt englischer Fachsprache bei praktikabler lokaler Laufzeit.

Laufzeit
whisper.cpp
Optimierung
Q5_0
AUSGEWÄHLT FÜR
Mehrsprachigkeit und lokale Geschwindigkeit
Genauigkeitswerte richtig lesen

Bei WER und CER gilt: niedriger ist besser. 6,34 % und 9,3–16,8 % stammen aus veröffentlichten Tests der ungekürzten Ausgangsmodelle. Sie sind kein Gesamtwert für iPhone-Nahaufnahme, quantisierte Modelle und Sprachwechsel in undervoice. Unterschiedliche Datensätze gehören nicht in eine Rangliste.

04 / IPHONE ODER MACBOOK-MIKROFON

Erst die Aufnahme verbessern, dann das Modell beurteilen.

Beide Wege können dasselbe lokale Modell auf dem Mac verwenden. Entscheidend ist, ob das Audio wenige Zentimeter vom Mund oder auf der anderen Seite des Schreibtischs beginnt.

Geteilter ArbeitsplatziPhone nah am MundMacBook-Mikrofon
Abstand Mund–Mikrofon5–10 cm50–80 cm
Bei leiser StimmeDie Stimme erreicht das Mikrofon zuerstStimme, Tastatur, Lüftung und Gespräche treffen gemeinsam ein
Nötige LautstärkeLeise bleibenAuf Tischdistanz oft lauter sprechen
Ort der ErkennungLokal auf deinem MacLokal auf deinem Mac
Passt am bestenGroßraumbüro und DesksharingEinzelbüro oder unkritische Inhalte

Die 14–24 dB sind eine Freifeld-Abschätzung mit 20 × log10(r₂/r₁) für 5–10 cm gegenüber 50–80 cm. Reflexionen, Position und Sprechrichtung verändern reale Werte.

05 / SICHERHEIT UND NETZWERK

Die Aufnahme geht direkt an den Mac, den du ausgewählt hast.

undervoice betreibt keinen Sprach-Relay. Im selben Netz verbindet sich das iPhone direkt mit dem Mac; für andere Netze kannst du dein eigenes Tailscale nutzen. Authentifizierung und Verschlüsselung auf App-Ebene bleiben immer aktiv.

Installation und Berechtigungen
PAIRED

Nur gekoppelte Geräte

Gleiches WLAN reicht nicht. Ein neues iPhone muss ausdrücklich gekoppelt werden.

E2E

Schon auf dem iPhone verschlüsselt

Audio, Transkripte und Steuerdaten sind authentifiziert und Ende-zu-Ende verschlüsselt.

ROTATE

Neuer Schlüssel pro Verbindung

Bei jeder Verbindung wird ein neuer Sitzungsschlüssel abgeleitet.

RAM

Audio wird nie zur Datei

Aufnahmen bleiben im Arbeitsspeicher. Diagnosen enthalten weder Audio noch Transkripttext.

0 CLOUD

Keine undervoice-Sprachcloud

Im lokalen Netz fließt Audio direkt vom iPhone zum Mac; das Modell läuft dort.

REMOTE

Dein privates Netz, deine Wahl

Über anderes WLAN oder Mobilfunk kannst du dein eigenes Tailscale nutzen; die undervoice-Verschlüsselung bleibt bestehen.

06 / ÜBERALL SCHREIBEN

Wo der Cursor steht, landet der Text.

CodexClaude CodeXcodeTerminalJedes Textfeld

„Behalte die öffentliche API, stelle die Wiederholungen auf exponentielles Backoff um und ergänze drei Grenzfalltests.“

hört zu

Beim Start merkt sich der Mac aktive App und Auswahl. Ändert sich der Fokus, pausiert die Eingabe. Passwortfelder und Steuerelemente mit Secure Keyboard Entry bleiben immer unberührt.

undervoice

SPRICH MIT DEINEM MAC, NICHT MIT DEM RAUM

Leise sprechen. Frei entwickeln.

Modell auf dem Mac installieren, Kopplungscode mit dem iPhone scannen und zum Sprechen gedrückt halten.