Der Rücklauf liegt vor, mehrere tausend ausgefüllte Bögen, und gebraucht wird ein auswertbarer Datensatz. Die automatisierte Erfassung schafft solche Mengen in kurzer Zeit: Die Bögen werden gescannt, Software liest Ankreuzfelder, Zahlen und gedruckte Zeichen aus, das Ergebnis landet als Datei in Excel oder SPSS.
Ob das im konkreten Fall funktioniert, entscheidet allerdings nicht die Software, sondern der Bogen. Layout, Feldgestaltung, Druckqualität und der Anteil handschriftlicher Antworten bestimmen, wie viel maschinell erfasst werden kann und wie viel am Ende doch von Hand nachgearbeitet wird. Diese Seite nennt die Kriterien, an denen sich das vorab beurteilen lässt, und beschreibt, wie wir die automatisierte Erfassung im Rahmen der Fragebogendigitalisierung durchführen.
Hinter der automatischen Datenerfassung stehen drei unterschiedliche Erkennungsverfahren. Sie werden auf demselben Bogen kombiniert, arbeiten aber unterschiedlich zuverlässig – und dieser Unterschied entscheidet darüber, welche Fragen sich maschinell auswerten lassen.
OMR, die optische Markierungserkennung, wertet Ankreuz- und Markierungsfelder aus. Sie prüft lediglich, ob ein definierter Bereich geschwärzt ist oder nicht, und ist deshalb das mit Abstand robusteste der drei Verfahren. Die fünfstufige Zustimmungsskala, das angekreuzte Geschlecht, die Auswahl aus einer Antwortliste: Das ist der Bereich, in dem die automatisierte Erfassung ihre Stärke voll ausspielt.
OCR, die optische Zeichenerkennung, liest gedruckte Zeichen. Im Fragebogen betrifft das weniger die Antworten als den Bogen selbst: aufgedruckte Bogen- und Versionsnummern, Standort- oder Abteilungskennungen, Seitenzahlen. Bei sauberem Druck arbeitet sie sehr zuverlässig, weil die Zeichen einer bekannten Schrift folgen.
ICR, die intelligent character recognition, erkennt handschriftliche Zeichen in abgegrenzten Feldern – etwa das Geburtsjahr, die Postleitzahl oder ein Datum, wenn für jede Ziffer ein eigenes Kästchen vorgesehen ist. Genau daran hängt ihre Zuverlässigkeit: Handschrift in einem Kästchenraster ist auswertbar, dieselbe Angabe auf einer freien Linie oft nicht. Ergänzend lässt sich ein Barcode auf dem Bogen vorsehen, über den sich Version, Standort oder Befragungswelle ohne jede Erkennungsunsicherheit zuordnen lassen.
Ob ein Bogen maschinell auslesbar ist, lässt sich vor der Vergabe an einem einzigen Exemplar beurteilen. Sieben Merkmale entscheiden – und sie hängen sämtlich am Bogen, nicht an der Software:
Der Grund für diese Schwelle liegt in der Vorbereitung. Formularanalyse, Erfassungsvorlage und Testlauf fallen einmal an, unabhängig davon, ob anschließend 800 oder 30.000 Bögen durchlaufen. Erst über die Menge verteilt sinkt dieser Aufwand auf einen kleinen Betrag je Bogen. Genau deshalb ist die Stückzahl nie das alleinige Kriterium: Ein einseitiger Bogen mit zwanzig Ankreuzfragen kann sich schon bei 1.500 Rückläufern rechnen, während ein sechsseitiger Bogen mit fünf offenen Fragen auch bei 8.000 Stück überwiegend von Hand erfasst wird. Wie sich Rüst- und Stückkosten im Einzelnen zusammensetzen, steht ausführlich auf unserer Seite zur manuellen Datenerfassung.
Die Beurteilung selbst dauert nicht lange. Ein ausgefüllter Musterbogen und die erwartete Rücklaufzahl genügen uns, um zu sagen, welcher Anteil maschinell läuft, wo Handarbeit nötig bleibt und was das Projekt kostet.
Lässt sich Ihr Bogen maschinell auslesen?
Schicken Sie uns einen ausgefüllten Musterbogen und die erwartete Rücklaufzahl. Sie erhalten eine Einschätzung zur Machbarkeit und ein Festpreisangebot.
Vier Konstellationen führen regelmäßig dazu, dass die maschinelle Erfassung allein nicht trägt. Sie sind bekannt und lassen sich vorher benennen – was sie planbar macht:
Wichtiger als die Aufzählung ist jedoch die Art der Fehler, die dabei entsteht. Menschen machen bei der Erfassung vereinzelte, zufällig verteilte Fehler – ein Zahlendreher hier, eine übersehene Angabe dort. Solche Fehler findet eine Stichprobe zuverlässig, weil sie über den Bestand streuen. Eine falsch justierte Erkennung macht das Gegenteil: Sie liest ein bestimmtes Feld auf jedem Bogen falsch, immer auf dieselbe Weise. Genau deshalb fällt so ein Fehler bei einer Stichprobe am Ende nicht auf – im Gegenteil, er sieht in jeder Kontrolle gleich konsistent aus. Bemerkt wird er oft erst in der Auswertung, wenn eine Verteilung unplausibel wirkt, und dann sind alle Bögen betroffen.
Dagegen hilft keine nachträgliche Kontrolle, sondern nur ein Verfahren, das den Fehler entstehen lässt, solange er noch billig ist:
Nach der Erkennungsgenauigkeit wird häufig als Erstes gefragt, und meist wird eine Prozentzahl erwartet. Eine solche Zahl sagt allerdings wenig, solange nicht dabeisteht, worauf sie sich bezieht: Ankreuzfelder werden nahezu vollständig korrekt gelesen, handschriftliche Ziffern in Kästchen deutlich seltener, handschriftlicher Fließtext nochmals seltener. Dieselbe Software liefert bei gutem Bogen und sauberem Scan völlig andere Werte als bei einer verschmutzten Kopie. Eine belastbare Aussage zur Genauigkeit entsteht deshalb nicht aus einem Datenblatt, sondern aus dem Testlauf mit Ihren eigenen Bögen – und die liefern wir vor der Serienerfassung.
Drei Stufen, von der Analyse des Bogens bis zum geprüften Datensatz. Scannen und Erkennung finden im selben Haus statt – die Bögen wechseln unterwegs nicht den Dienstleister.
Zuerst wird der Bogen selbst zum Bauplan: Jedes auszulesende Feld bekommt Position, Typ und zulässige Werte.
Liegt ein Codeplan aus einer Vorwelle vor, übernehmen wir ihn unverändert – sonst ist die Zeitreihe nicht mehr vergleichbar.
Vor der Serie läuft eine Testmenge aus dem echten Rücklauf durch die fertige Vorlage.
Zeigt der Testlauf, dass ein Bogenteil nicht sauber läuft, wird dieser Teil manuell erfasst – und nicht mit schwachen Erkennungswerten weiterverarbeitet.
Erst nach der Freigabe läuft der gesamte Rücklauf – Vorbereitung, Scan und Erkennung in einem Haus.
Die Papierbögen werden auf Wunsch archiviert, zurückgegeben oder dokumentiert vernichtet.
Die drei Stufen sind einzeln beauftragbar. Häufig übernehmen wir die gesamte Strecke von der Bogenannahme bis zur Datenlieferung. Ebenso möglich ist die reine Erfassung nach einer bestehenden Vorlage, die Formularanalyse vor dem Druck einer neuen Erhebung – oder die Kombination, bei der wir die geschlossenen Fragen maschinell und die offenen von Hand erfassen.
Der günstigste Zeitpunkt, die automatisierte Erfassung vorzubereiten, liegt vor dem Druck. Ein Bogen, der von vornherein für die maschinelle Auswertung gestaltet ist, kostet in der Erfassung einen Bruchteil dessen, was ein nachträglich angepasstes Layout verursacht – und die Gestaltungsentscheidungen kosten in der Fragebogenkonzeption nichts. Die folgenden Punkte decken die Fälle ab, die in der Praxis Probleme machen:
Offene Fragen sind von diesen Regeln ausgenommen – sie werden ohnehin von Hand erfasst. Trotzdem lohnt sich ein klar umrandeter Antwortkasten mit ausreichend Zeilen statt einer freien Fläche: Er begrenzt die Antwortlänge, hält den Text aus den Erkennungsfeldern der Nachbarfrage heraus und erleichtert die spätere Codierung der Freitextantworten. Wenn Sie einen Bogen neu entwerfen, schauen wir im Rahmen der Angebotserstellung gern über den Entwurf, bevor er in den Druck geht.
Geliefert wird kein Bilderstapel und keine Rohdatei, sondern ein Datensatz, mit dem sich sofort arbeiten lässt:
Wenn Sie den Datensatz nicht selbst auswerten möchten, schließen wir die Befragungsauswertung direkt an – von der Häufigkeitsauszählung bis zum fertigen Berichtsband. Ebenso übernehmen wir die Auswertung in SPSS und Excel, wenn Auswertungslogik und Tabellen bereits feststehen.
Fragebögen aus Mitarbeiter-, Patienten- und Kundenbefragungen enthalten personenbezogene Daten, in Teilen besonders schützenswerte. Wer die Erfassung vergibt, bleibt als Verantwortlicher in der Pflicht und muss wissen, wo die Daten tatsächlich verarbeitet werden. Bei uns ist die Antwort kurz: hier.
Bei Mitarbeiterbefragungen kommt ein Punkt hinzu, der über die rechtliche Seite hinausgeht. Die Zusage, dass Antworten anonym bleiben, ist für die Belegschaft nur so glaubwürdig wie der Weg, den die Bögen nehmen. Werden sie im eigenen Haus erfasst, bleibt der Verdacht, dass jemand eine Handschrift zuordnen könnte – und das verändert das Antwortverhalten, lange bevor jemand es nachweisen kann. Ein externer Dienstleister, der die Bögen nachweislich nicht weiterreicht, stützt die Anonymitätszusage praktisch.
Die automatisierte Strecke lohnt sich dort, wo viele Bögen desselben Aufbaus zusammenkommen. In unseren Projekten sind das vor allem diese Erhebungen:
In der Praxis läuft die Mehrzahl der Projekte weder rein maschinell noch rein von Hand. Die geschlossenen Fragen werden automatisiert erfasst, die offenen Antworten und alles, was in Handschrift auf freien Linien steht, manuell – genau dort liegen bei Befragungen oft die interessantesten Aussagen. Dieser hybride Weg kombiniert die Geschwindigkeit der Erkennung mit der Zuverlässigkeit des Lesens durch Menschen und ist bei gemischten Bögen fast immer die günstigste Lösung. Welches Verfahren für Ihre Erhebung überwiegt, hängt an Menge, Seitenzahl und Anteil offener Fragen. Die Kostenlogik dahinter, die Vergleichstabelle beider Verfahren und die Rechnung gegen interne Erfassung stehen ausführlich auf der Seite zur manuellen Datenerfassung.
?Können handschriftlich ausgefüllte Fragebögen automatisch erfasst werden?
Teilweise. Handschriftliche Ziffern und Einzelbuchstaben lassen sich per ICR auslesen, wenn jedes Zeichen ein eigenes Kästchen hat – etwa bei Postleitzahl, Geburtsjahr oder Datum. Handschriftlicher Fließtext auf freien Linien ist maschinell nicht zuverlässig auslesbar und wird von Hand erfasst. In der Praxis heißt das: Ein Bogen mit Ankreuzfragen und wenigen Ziffernfeldern läuft weitgehend automatisiert, ein Bogen mit mehreren offenen Fragen nur teilweise.
?Wie genau ist die automatische Erfassung von Fragebögen?
Die Genauigkeit hängt vom Feldtyp ab, nicht von der Software allein. Ankreuzfelder werden nahezu vollständig korrekt gelesen, handschriftliche Ziffern in Kästchen deutlich seltener, handschriftlicher Text nochmals seltener. Hinzu kommen Bogenqualität und Scanbedingungen. Eine pauschale Prozentangabe sagt deshalb wenig – belastbar wird die Aussage erst durch einen Testlauf mit echten Rückläufern, bei dem die Erkennung Feld für Feld gegen die Originalbögen geprüft wird.
?Ab welcher Menge lohnt sich die automatisierte Erfassung?
Als Orientierung trägt sich die automatisierte Strecke ab etwa 2.000 bis 3.000 Bögen, weil Formularanalyse, Erfassungsvorlage und Testlauf einmalig anfallen und sich erst über die Menge verteilen. Die Schwelle verschiebt sich allerdings deutlich: Ein einseitiger Bogen mit ausschließlich Ankreuzfragen kann sich früher rechnen, ein mehrseitiger Bogen mit vielen offenen Fragen auch bei größerer Auflage nicht.
?Worauf muss ich beim Fragebogen achten, damit er maschinell lesbar ist?
Auf sechs Dinge: quadratische Ankreuzkästchen mit sichtbarer Umrandung statt Linien oder Kreise, ausreichend Abstand zwischen den Feldern, ein eigenes Kästchen für jede handschriftliche Ziffer, sichtbare Zellgrenzen bei Matrixfragen, weißer Feldgrund ohne Farbraster und eine einheitliche Druckvorlage für alle Bögen. Am wirksamsten ist es, den Entwurf vor dem Druck prüfen zu lassen – nachträglich lässt sich am Layout nichts mehr ändern.
?In welchem Format bekomme ich die Daten?
Als Datensatz in Excel oder SPSS, mit Variablen und Beschriftungen nach dem abgestimmten Codeplan; CSV und andere Austauschformate sind ebenfalls möglich. Dazu kommen der dokumentierte Codeplan, ein Prüfprotokoll der Plausibilitätsprüfungen und auf Wunsch ein Bildarchiv der Bögen, über die Bogennummer dem Datensatz zugeordnet.
Musterbogen einschicken, Einschätzung bekommen
Ein ausgefüllter Bogen und die erwartete Rücklaufzahl genügen. Sie erhalten eine Einschätzung, welcher Teil Ihres Fragebogens maschinell läuft und welcher von Hand erfasst wird, dazu ein kostenloses Festpreisangebot und einen verbindlichen Termin. Planen Sie eine neue Erhebung, schauen wir im selben Schritt über den Entwurf, bevor er in den Druck geht.