Viele Projekte scheitern nicht am Modell, sondern an den Daten davor: verstreut, in unterschiedlichen Formaten, teils als gescannte PDFs. Wir bauen die Pipelines, die daraus verlässliche, strukturierte Daten machen.
Dazu gehören Crawling und Ingestion, OCR und Dokumentenverarbeitung, Extraktion mit LLMs, Datenqualität und die Plattformen, auf denen das alles läuft.
Das Ergebnis sind Daten, auf die nachgelagerte Systeme, Analysen und KI-Features aufbauen können.
Bei Blue Elephant Energy lagen öffentliche Bekanntmachungen zu Photovoltaik-Parks verstreut im Web, in unterschiedlichen Formaten und teils als gescannte PDFs. Manuell kam das Akquisitions-Team der Menge nicht hinterher. In Patentkanzleien sollen große Dokumentenbestände durchsuchbar werden.
Die Pipeline für Blue Elephant Energy hat 3 Stufen: Crawl, OCR, LLM. Sie entstand 2024 und läuft seit der Übergabe eigenständig im Live-Betrieb. Über Patent Studio wurden 7.235 Patente durch den Opt-out-Prozess geführt.
Datenprojekte gehen wir in drei Phasen an. Jede Phase endet mit einem Ergebnis, auf dessen Basis Sie entscheiden, ob und wie es weitergeht.
Die Pipeline für Blue Elephant Energy entstand in drei Monaten im Jahr 2024 und läuft seit der Übergabe eigenständig. Die Phasen im Überblick finden Sie unter Leistungen.
Diese Technologien setzen wir in Datenprojekten ein:
Für Analysen über große Bestände kombinieren wir klassische Datenanalyse, statistische Verfahren und KI-gestützte Methoden, wie im Projekt mit T-Systems.
Ja. Bei Blue Elephant Energy lagen öffentliche Bekanntmachungen in unterschiedlichen Formaten und teils als gescannte PDFs vor. Eine OCR-Stufe mit AWS Textract macht sie maschinenlesbar. Regelbasierte Vorfilter entfernen offensichtliche Falschtreffer. Danach zieht ein Sprachmodell die relevanten Informationen heraus und strukturiert sie für die Bewertung durch das Fachteam.
Durch Vorfilter vor der LLM-Stufe. In der Pipeline für Blue Elephant Energy eliminieren regelbasierte Filter offensichtliche Falschtreffer, bevor LLM-Kosten anfallen. Das Sprachmodell wertet nur die verbleibenden Dokumente aus. Die Pipeline hat drei Stufen: Crawl, OCR und LLM. Jede Stufe hat eine klare Aufgabe, damit nachvollziehbar bleibt, wo Aufwand entsteht.
Das ist das Ziel. Die Pipeline von Blue Elephant Energy läuft seit Projektabschluss eigenständig im Live-Betrieb. Wir sind dort nicht mehr aktiv beteiligt, das System wurde sauber an den Kunden übergeben. Gebaut hat sie ein erfahrener Engineer in drei Monaten. Ein klar geschnittenes Problem braucht nicht immer ein großes Team.
Mit Vektorsuche. Für Patent Studio segmentieren wir PDFs nach OCR in Abschnitte und bauen eine Chunking- und Embedding-Pipeline. Darauf läuft eine Ähnlichkeitssuche über große Dokumentenbestände mit Azure AI Search. Über Patent Studio wurden 7.235 Patente durch den Opt-out-Prozess geführt. Alle KI-Funktionen sind so gebaut, dass sensible Mandantendaten kontrollierbar bleiben.