Was wir lösen

Data Engineering für Pipelines, OCR und Daten-Plattformen

Pipelines, Extraktion und Datenplattformen für Dokumente, Telemetrie und alles dazwischen.

Aus verstreuten Quellen verlässliche Daten machen

Viele Projekte scheitern nicht am Modell, sondern an den Daten davor: verstreut, in unterschiedlichen Formaten, teils als gescannte PDFs. Wir bauen die Pipelines, die daraus verlässliche, strukturierte Daten machen.

Dazu gehören Crawling und Ingestion, OCR und Dokumentenverarbeitung, Extraktion mit LLMs, Datenqualität und die Plattformen, auf denen das alles läuft.

Das Ergebnis sind Daten, auf die nachgelagerte Systeme, Analysen und KI-Features aufbauen können.

Typische Ausgangslage

Bei Blue Elephant Energy lagen öffentliche Bekanntmachungen zu Photovoltaik-Parks verstreut im Web, in unterschiedlichen Formaten und teils als gescannte PDFs. Manuell kam das Akquisitions-Team der Menge nicht hinterher. In Patentkanzleien sollen große Dokumentenbestände durchsuchbar werden.

Wie wir sie angehen

  • Crawling: parallele Extraktionsprozesse, die Millionen von Websites nach relevanten Veröffentlichungen durchsuchen.
  • OCR mit AWS Textract, damit gescannte Dokumente maschinenlesbar werden.
  • Regelbasierte Vorfilter, die Falschtreffer entfernen, bevor LLM-Kosten anfallen.
  • Extraktion mit LLMs: Ein Sprachmodell zieht die relevanten Informationen heraus und strukturiert sie für die Bewertung.
  • Vektorsuche: Für Patent Studio segmentieren wir PDFs und bauen eine Chunking- und Embedding-Pipeline für die Ähnlichkeitssuche.

Die Pipeline für Blue Elephant Energy hat 3 Stufen: Crawl, OCR, LLM. Sie entstand 2024 und läuft seit der Übergabe eigenständig im Live-Betrieb. Über Patent Studio wurden 7.235 Patente durch den Opt-out-Prozess geführt.

Ablauf

Datenprojekte gehen wir in drei Phasen an. Jede Phase endet mit einem Ergebnis, auf dessen Basis Sie entscheiden, ob und wie es weitergeht.

  1. Beratung und Architektur, ab einer Woche: Wir klären, welche Quellen es gibt, in welchen Formaten die Daten vorliegen und welche Systeme die Ergebnisse später nutzen. Ergebnis ist eine Entscheidungsvorlage mit Architektur, Optionen und Aufwandsschätzung.
  2. Prototyping und Prestudy, typisch 2–6 Wochen: Wir prüfen an Beispieldokumenten, wie gut OCR, Vorfilter und Extraktion greifen, und bewerten, was die Umsetzung braucht. Ergebnis sind ein klickbarer Prototyp, eine Risikobewertung und ein belastbarer Umsetzungsplan.
  3. Engineering und Betrieb, Monate bis Jahre: Wir bauen die Pipeline, bringen sie in den Betrieb und übergeben sie so, dass sie ohne uns weiterläuft. Ergebnis ist Software in Produktion, dokumentiert und an Ihr Team übergabefähig.

Die Pipeline für Blue Elephant Energy entstand in drei Monaten im Jahr 2024 und läuft seit der Übergabe eigenständig. Die Phasen im Überblick finden Sie unter Leistungen.

Technologien

Diese Technologien setzen wir in Datenprojekten ein:

  • Crawling und Ingestion: Node.js und TypeScript, parallele Extraktionsprozesse
  • OCR: AWS Textract für gescannte Dokumente und PDFs
  • Extraktion mit LLMs: OpenAI und LangChain
  • Vektorsuche: Chunking- und Embedding-Pipeline mit Azure AI Search
  • Betrieb: Docker, AWS und Azure
  • Werkzeuge für Fachteams: React, Next.js und Tailwind

Für Analysen über große Bestände kombinieren wir klassische Datenanalyse, statistische Verfahren und KI-gestützte Methoden, wie im Projekt mit T-Systems.

Häufige Fragen

Können Sie gescannte PDFs und uneinheitliche Dokumente verarbeiten?

Ja. Bei Blue Elephant Energy lagen öffentliche Bekanntmachungen in unterschiedlichen Formaten und teils als gescannte PDFs vor. Eine OCR-Stufe mit AWS Textract macht sie maschinenlesbar. Regelbasierte Vorfilter entfernen offensichtliche Falschtreffer. Danach zieht ein Sprachmodell die relevanten Informationen heraus und strukturiert sie für die Bewertung durch das Fachteam.

Wie halten Sie die Kosten für Sprachmodelle im Rahmen?

Durch Vorfilter vor der LLM-Stufe. In der Pipeline für Blue Elephant Energy eliminieren regelbasierte Filter offensichtliche Falschtreffer, bevor LLM-Kosten anfallen. Das Sprachmodell wertet nur die verbleibenden Dokumente aus. Die Pipeline hat drei Stufen: Crawl, OCR und LLM. Jede Stufe hat eine klare Aufgabe, damit nachvollziehbar bleibt, wo Aufwand entsteht.

Läuft die Pipeline nach dem Projekt ohne Sie weiter?

Das ist das Ziel. Die Pipeline von Blue Elephant Energy läuft seit Projektabschluss eigenständig im Live-Betrieb. Wir sind dort nicht mehr aktiv beteiligt, das System wurde sauber an den Kunden übergeben. Gebaut hat sie ein erfahrener Engineer in drei Monaten. Ein klar geschnittenes Problem braucht nicht immer ein großes Team.

Wie machen Sie große Dokumentenbestände durchsuchbar?

Mit Vektorsuche. Für Patent Studio segmentieren wir PDFs nach OCR in Abschnitte und bauen eine Chunking- und Embedding-Pipeline. Darauf läuft eine Ähnlichkeitssuche über große Dokumentenbestände mit Azure AI Search. Über Patent Studio wurden 7.235 Patente durch den Opt-out-Prozess geführt. Alle KI-Funktionen sind so gebaut, dass sensible Mandantendaten kontrollierbar bleiben.

Unser Fokus
  • Crawling und Ingestion aus beliebigen Quellen
  • OCR und Dokumentenverarbeitung
  • Extraktion und Anreicherung mit LLMs
  • Datenqualität und Validierung
  • Migrationen zwischen Systemen
  • Vektorsuche und Wissensbasen
Was wir ermöglichen
  • Strukturierte Daten aus unstrukturierten Quellen
  • Pipelines, die eigenständig im Betrieb laufen
  • Verlässliche Grundlage für KI-Features
  • Konsistenz bei großvolumigen Migrationen
  • Zugriff für nachgelagerte Systeme
Haben Sie ein Projekt im Kopf?
Erzählen Sie uns, was Sie bauen. Wir melden uns innerhalb eines Werktags mit einer ehrlichen Einschätzung statt einem Pitch.