Bild-OCR
Text aus Bildern erkennen und als bearbeitbare Datei speichern
Lies Text aus einem Foto, Screenshot oder Scan aus und kopiere ihn oder lade ihn als TXT beziehungsweise Markdown herunter. Die Schrifterkennung verarbeitet ein Bild pro Lauf. Prüfe Namen, Beträge und Codes gegen die Quelle, bevor du den erkannten Text übernimmst.
Kosten: Kostenlose Optionen sind verfügbar. Pro-Optionen oder die Nutzung über das kostenlose Kontingent hinaus können Credits benötigen; weitere Angaben stehen in der Anleitung unten.
Text aus einem Bild extrahieren
Ein Bild hochladen
Ziehe ein JPG-, PNG-, WebP-, HEIC-, HEIF-, AVIF-, BMP- oder TIFF-Bild bis 200 MB in die Vorschau. Alternativ klicke auf Laden Sie ein Bild hoch, um Text zu extrahieren. Unter Files findest du auch Bilder aus anderen Bildtools.
Textformat auswählen
In der Karte OCR ist TXT voreingestellt. Wähle Markdown, wenn Überschriften, Listen und Tabellen als Struktur erhalten bleiben sollen. Stelle das Format vor der Texterkennung ein.
Sprachhinweis festlegen
Sprachhinweis beginnt mit Auto-detect, der automatischen Erkennung. Für einen ersten Lauf kannst du diese Einstellung beibehalten. Wenn Zeichen falsch gelesen werden, probiere eine bestimmte Sprache. Damit wird auch ein anderes Erkennungsmodell verwendet.
Schrifterkennung starten
Klicke auf Extract text. Dein Bild bleibt in der Vorschau. Darunter erscheint die Karte Extrahierter Text mit dem erkannten Inhalt und der Zeichenanzahl.
Gegenlesen und übernehmen
Kontrolliere besonders Namen, Geldbeträge, Datumsangaben und Kennungen. Kopieren übernimmt den Text in die Zwischenablage. Herunterladen speichert eine UTF-8-Datei mit dem Namen
ocr-result.txtoderocr-result.md.
TXT, Markdown und Sprachhinweis
Die beiden Einstellungen in OCR betreffen die Texterkennung und Ausgabe. Das hochgeladene Bild wird damit nicht bearbeitet.
- TXT
- Die Standardausgabe ist Klartext ohne Markdown-Formatierung. Erkannte Tabellen erhalten eine Textzeile pro Zeile und Tabulatoren zwischen den Zellen. Beim Einfügen in eine Tabellenkalkulation lassen sich daraus Spalten bilden. Zeichen im eigentlichen Quelltext, etwa
#hashtags,__init__oder<div>auf einem Code-Screenshot, bleiben erhalten. Geeignet für Briefe, Belege, Chatverläufe und Zitate. - Markdown
- Gibt die erkannte Struktur als Markierungen aus: Überschriften mit
#, Listen, Hervorhebungen und Tabellen. Für strukturierte Dokumente und Tabellen wählen. Öffne die.md-Datei in einem Markdown-fähigen Editor; ein reiner Texteditor zeigt die Markierungen und Tabellensyntax. - Sprachhinweis: Auto-detect
- Das Bild geht an GLM-OCR, das Sprache und Schrift automatisch erkennt. Dieses Modell bekommt keinen manuellen Sprachhinweis.
- Sprachhinweis: bestimmte Sprache
- Das Menü bietet English, German, Spanish, French, Italian, Portuguese, Russian, Japanese, Chinese, Arabic und Hindi. Wähle beispielsweise German für Deutsch. Das Bild geht dann an Google Gemini mit einem Hinweis auf Sprache, Schrift und Leserichtung. Das hilft bei mehrdeutigen Zeichen oder Wortgrenzen, etwa bei gemeinsamen chinesischen und japanischen Schriftzeichen oder rechts nach links geschriebenem Arabisch. Andere Sprachen im Bild sollen unverändert mitgelesen werden; der Auftrag sieht keine Übersetzung, Zusammenfassung oder Korrektur vor.
Welcher Dienst erkennt den Text?
Die Verarbeitung läuft über unsere Server. Das gesamte Bild wird an einen externen KI-Dienst übermittelt: Bei Auto-detect an GLM-OCR von Z.ai, bei einer ausgewählten Sprache an Googles Gemini-API. Erreicht Gemini sein Anfragekontingent, wird derselbe Auftrag an das Gemini-Modell über OpenRouter weitergegeben. Berücksichtige diese Übermittlung bei Ausweisen, Kontoauszügen und anderen vertraulichen Bildern.
Der Wechsel zwischen Auto-detect und einer bestimmten Sprache liefert eine unabhängige zweite Lesung mit einem anderen Modell. Das kann bei einer falsch erkannten Zeile helfen. Jeder neue Lauf zählt separat zu deiner Nutzung.
Die Vorlage für die Texterkennung vorbereiten
Scharfe Buchstaben und klar abgegrenzte Textbereiche erleichtern das Erkennen.
Auf den benötigten Text beschneiden
Auch Menüs, Wasserzeichen, Preisschilder und Schrift im Hintergrund können übernommen werden. Mit Bild zuschneiden begrenzt du die Quelle auf den relevanten Bereich.
Seiten und Zeilen gerade ausrichten
Aufrechte, waagerechte Zeilen sind meist leichter zu lesen. Ein seitlich gedrehtes oder schief fotografiertes Blatt kannst du vor der Schrifterkennung mit Bild drehen ausrichten.
Bildschirmfotos direkt aufnehmen
Ein Screenshot enthält scharfe, gleichmäßig beleuchtete Zeichen. Ein Handyfoto vom Monitor kann Spiegelungen, Moiré-Streifen und perspektivische Verzerrungen hinzufügen und dadurch Buchstaben oder Ziffern verwechselbar machen.
Mehrseitige PDF-Scans gemeinsam verarbeiten
Hier wird jeweils ein Bild gelesen. Liegen deine Scans bereits als PDF vor, verarbeitet PDF-OCR alle Seiten oder einen ausgewählten Seitenbereich in einem Auftrag.
Formate, Nutzung und Aufbewahrung
- Eingabe
- JPG, PNG, WebP, HEIC, HEIF, AVIF, BMP und TIFF; kein GIF
- Ausgabe
- Klartext (.txt) oder Markdown (.md), UTF-8; zusätzlich Kopieren in die Zwischenablage
- Dateigröße
- Höchstens 200 MB pro Bild
- Bilder pro Lauf
- Eines
- Verarbeitung
- Über unsere Server mit GLM-OCR von Z.ai oder Google Gemini. Ein Auftrag kann bis zu 30 Minuten laufen; kein automatischer neuer Versuch.
- Nutzung
- Jedes Bild zählt als ein Lauf. Nach Verbrauch des Freikontingents müssen Gäste sich anmelden; jedes weitere Bild kostet 1 Credit.
- Wasserzeichen
- Keines
- Aufbewahrung
- Gespeicherte Uploads und Ergebnisdateien werden bei Gästen nach 48 Stunden, bei kostenlosen Konten nach 30 Tagen automatisch gelöscht. Bezahlte Tarife können Dateien länger speichern.
Häufige Fragen
Wird der Text aus dem Foto übersetzt?
Die Ausgabe bleibt in der Sprache des Originaltexts. Die Auswahl unter Sprachhinweis hilft beim Lesen mehrdeutiger Zeichen und legt keine Zielsprache fest. Auch weitere Sprachen im selben Bild sollen unverändert übernommen werden.
Warum erkennt OCR manche Buchstaben oder Zahlen falsch?
Häufige Gründe sind zu kleine, unscharfe oder kontrastarme Schrift, Schatten und schräg fotografierte Seiten. Ähnliche Zeichen wie 0 und O, 1 und l oder rn und m können verwechselt werden. Prüfe deshalb besonders Beträge und Codes. Nutze eine schärfere Quelle, beschneide auf den Text oder wechsle den Sprachhinweis für eine zweite Lesung mit dem anderen Modell.
Wann ist TXT besser, wann Markdown?
Wähle TXT, um Text in eine E-Mail, ein Formular oder eine Tabellenkalkulation einzufügen. Tabellen werden als Zeilen mit Tabulatoren ausgegeben. Markdown passt, wenn Überschriften, Listen und Tabellen als Struktur erkennbar bleiben sollen, beispielsweise für eine Notiz-App oder ein Wiki.
Erhält ein externer Anbieter mein Bild?
Ja. Bei Auto-detect erhält Z.ai das Bild für GLM-OCR; bei einer ausgewählten Sprache geht es an Google Gemini, bei einem Gemini-Kontingentfehler über OpenRouter. Für auf unseren Servern gespeicherte Uploads und Ergebnisdateien gelten 48 Stunden für Gäste beziehungsweise 30 Tage für kostenlose Konten. Das beschreibt unsere Dateiaufbewahrung.
Was mache ich, wenn kein Text erkannt wurde?
Enthält das Bild keinen lesbaren Text, endet der Lauf mit einer entsprechenden Fehlermeldung. Prüfe, ob die Zeichen groß und scharf genug sind. Entferne unwichtige Bildbereiche mit Bild zuschneiden und starte eine neue Texterkennung.