SdbHub CORE · Datenextraktion

Strukturierte Datenextraktion aus jedem Sicherheitsdatenblatt.

Über 100 geprüfte Datenpunkte aus Abschnitt 1 bis 16 — strukturierte Werte und textuelle Phrasen, jeder Wert mit Fundstelle im Original. Was im SDB steht, kommt heraus. Nichts wird erfunden.

1–16 Abschnitte 100+ Datenpunkte >16 Sprachen Pixelgenaue Evidenz Validierte Daten Ampel-System
Aceton_SDB.pdf → SdbHub CORElive
Quelle · Sicherheitsdatenblatt
CAS 67-64-1S.1
H225 · H319S.2
Flammpunkt < −18 °CS.3
UN 1090 · ADR 3S.14
WGK (unklar)S.12
Geprüfte Daten
CAS-Nr.67-64-1S.1
H-SatzH225S.2
Flammpkt.< −18 °CS.3
UN-Nr.1090S.14
WGKprüfenS.12
Rev.-Datumfehlt
Das Prinzip

Jeder Wert stammt aus dem Dokument — und trägt seine Fundstelle mit sich.

Fragt ein Fachanwender bei einem Wert nach, ist die Antwort einen Klick entfernt: die Originalstelle im SDB, Seite und Position. Kein Suchen im PDF, kein Raten — und nichts, was ein Sprachmodell „sinnvoll" ergänzt hat.

Nur Daten aus dem SDB

Fehlt eine Angabe im Dokument, steht da fehlt. SdbHub CORE ergänzt nichts aus Fremddatenbanken und rät nicht.

Evidenz statt Vertrauen

Zu jedem Wert Seite und Position. Im Splitscreen liegt die Originalstelle direkt neben dem extrahierten Feld — prüfen wird zum Blick.

Keine Halluzination

Werte werden extrahiert und validiert, nie generiert. Unsicheres wird gelb markiert und zur Kontrolle ausgewiesen — statt unauffällig durchzulaufen.

Abschnittstreu zugeordnet

Jeder Wert kommt garantiert aus dem Abschnitt bzw. Unterabschnitt, in dem er im SDB steht — keine Vermischung über Abschnitte hinweg.

Datenumfang

Abschnitt 1 bis 16 — vollständig erfasst.

Aus jedem Abschnitt zieht SdbHub CORE die relevanten Felder — strukturierte Werte ebenso wie textuelle Phrasen, jeweils mit Evidenz.

01

Stoff & Lieferant

HandelsnameVerwendungLieferant
02

Gefahren & Kennzeichnung

H-SätzeP-SätzeGHS-PiktogrammeSignalwort
03

Zusammensetzung

CASEG-Nr.KonzentrationEinstufung
04

Erste-Hilfe-Maßnahmen

PhrasenSymptome
05

Brandbekämpfung

LöschmittelGefahren
06

Unbeabsichtigte Freisetzung

Maßnahmen
07

Handhabung & Lagerung

LGKZusammenlagerung
08

Expositionsbegrenzung

AGWDNEL/PNECPSA
09

Physik. & chem. Eigenschaften

FlammpunktSiedepunktDichtepH
10

Stabilität & Reaktivität

Unverträglichkeiten
11

Toxikologie

LD50 / LC50Wirkungen
12

Umweltbezogene Angaben

PBT/vPvBAbbaubarkeit
13

Entsorgung

AVV-Schlüssel
14

Transport

UN-Nr.ADRIMDG/IATAVerpackungsgr.
15

Rechtsvorschriften

SVHCWGKSevesoBeschränkungen
16

Sonstige Angaben

Volltext H/PRevision

Feingranular bis zum Vorzeichen

Physikalische Werte mit Operator, Einheit und Bezugsbedingung — nicht als gerundete Zahl.

Flammpunkt< −18 °C
Konzentration≥ 99,5 %
Siedepunkt56 °C @ 1013 hPa
Dampfdruck246 hPa @ 20 °C

Einstufung & GHS

Klassifikation, Piktogramme und Signalwort — gegen die extrahierten Phrasen geprüft.

EinstufungFlam. Liq. 2
+Eye Irrit. 2 · STOT SE 3
GHSGHS02 · GHS07
SignalwortGefahr

Phrasen mit Volltext

H-/P-/EUH-Codes inklusive Wortlaut — als Code und als textuelle Phrase mit Evidenz.

H225Leicht entzündbar
H319Verursacht Augenreizung
P210Von Hitze fernhalten

Sieh live, wie viel mehr SdbHub in Sekunden aus deinen Dokumenten ausliest — präzise, automatisiert und bewertet.

Live ansehen
Schwierige Dokumente

Da, wo OCR und Standard-Lösungen aussteigen.

SDBs sind selten sauber: eingescannt, mehrspaltig, mehrsprachig, mehrere Produkte in einem PDF. Genau dafür ist SdbHub CORE gebaut — nicht nur für das Lehrbuch-PDF.

01

Scan- & Bildbereiche

Eingescannte Tabellen und in Bilder eingebettete Angaben, an denen OCR und Vision-Modelle scheitern, rekonstruiert unser Close-Verfahren — der Wert geht nicht verloren.

■ rekonstruiert statt „nicht lesbar"
02

Mehrspaltige Layouts

Zwei- und dreispaltige SDBs werden in korrekter Lesereihenfolge eingelesen — ohne Spalten zu vermischen oder Phrasen über den Umbruch zu zerreißen.

■ korrekte Lesereihenfolge
03

KIT-SDBs erkennen & trennen

Enthält ein Dokument mehrere Produkte, erkennt SdbHub CORE die einzelnen Stoffe und trennt sie in eigenständige Datensätze — jeder mit eigener Evidenz.

■ 1 PDF → n Datensätze
04

Über 16 Sprachen

SdbHub CORE extrahiert sprachunabhängig und ordnet Phrasen normiert zu — auch nicht-lateinische Schriften wie Chinesisch und Sprachen wie Türkisch.

■ >16 Sprachen produktiv
Evidenz · Validierung · Abgleich

Belegt, geprüft, bewertet.

Zu jedem Wert liefert SdbHub CORE Herkunft, Plausibilität und ein Vertrauensmaß — damit deine Fachanwender den Daten ansehen, worauf sie sich verlassen können.

Pixelgenaue Evidenz

Jeder Wert ist auf den Pixel genau lokalisiert — Seite und Bounding-Box. Wirkt eine Angabe fragwürdig, zeigt die EHS-Umgebung die Originalstelle direkt daneben; die Rückfrage beantwortet sich beim Hinsehen. {"page":3,"x":142,"y":388}

Validierung & Scoring → Ampel

Jedes Feld bekommt ein Konfidenz- und Plausibilitätsmaß. Daraus wird die Ampel: grün bestätigt, gelb kontrollieren, rot fehlt. So arbeitest du gezielt Gelb und Rot ab.

Abgleich mit TRGS & ECHA

Extrahierte Angaben werden gegen TRGS-Zuordnungen und ECHA-Listen auf Konsistenz und Aktualität geprüft. Widersprüche werden sichtbar gemacht, nicht stillschweigend korrigiert.

CAS 67-64-1 · Scoring

CAS / EG-Nr.0.99
H-/P-Sätze0.98
Transport (ADR)0.97
WGK0.71
Revisionsdatum
Optional · abgeleitet

Ableitungen sind klar getrennt. Auf Wunsch ergänzt SdbHub CORE Werte, die nicht im SDB stehen (z. B. eine Handschuh-Empfehlung) — immer als „abgeleitet" gekennzeichnet, mit Begründung und nie mit den extrahierten Fakten vermischt.

Engineering & Qualität

Enterprise-KI ist mehr als „mal eben ChatGPT".

Präzision entsteht nicht aus einem guten Prompt, sondern aus einem strukturierten Qualitätsprozess — den wir messbar und kontinuierlich betreiben.

Menschen­ähnlich
Extraktionsqualität
Ø 9Sek.
pro Dokument · Extraktion (v2)
Ø 27Sek.
pro Dokument · inkl. Validierung & Evidenzen (v3)
Läuft kontinuierlich
1Benchmarken
2Qualitätstests
3Vergleichen
4Anomalien erkennen
5Verbessern
6Messen
7Optimieren
Einordnung

SdbHub CORE gegen typische Standard-Lösungen — Fähigkeit für Fähigkeit.

Kein abstrakter Score, sondern konkrete, nachprüfbare Eigenschaften der Extraktion — und wo eine rein modellbasierte Lösung an Grenzen stößt.

FähigkeitSdbHub CORETypische Standard-Lösungen
Pixelgenaue Evidenz – Seite & Bounding Box
Abschnittstreue Zuordnung der Werte~
Ampel-Validierung & Scoring je Wert
„Fehlt“ statt geraten – keine Halluzination
Abgleich gegen TRGS & ECHA
Scans & mehrspaltige Layouts (Close-Verfahren)~
KIT-/Multi-Produkt-SDBs erkennen & trennen
Über 16 Sprachen inkl. Chinesisch & Türkisch~
Reproduzierbar & versioniert über Modell-Updates

✓ enthalten · ~ teilweise · – nicht enthalten. Einordnung auf Basis eigener Tests und des Austauschs mit Kunden; „typische Standard-Lösungen“ stehen für gängige, rein modellbasierte Ansätze ohne kontrollierte Extraktions-Pipeline.

Willst du SdbHub CORE an deinen eigenen SDBs benchmarken? Mit eigenen SDBs benchmarken
API & Output

Eine API-Infrastruktur, auf die du dich verlassen kannst.

Hochverfügbar, horizontal skalierbar und sauber dokumentiert — die Daten landen dort, wo deine Fachanwender ohnehin arbeiten.

GET /v1/sdb/67641 · 200 OK
{
  "name": "Aceton",
  "cas": "67-64-1",
  "score": 0.974,
  "h_phrases": ["H225","H319","H336"],
  "flash_point": {"op":"<","value":-18,"unit":"°C"},
  "lgk": "3", "wgk": 1,
  "adr": {"un":"1090","class":"3","pg":"II"},
  "evidence": {"page":3,"x":142,"y":388},
  "validation": ["wgk_pruefen"]
}

JSON & Swagger-UI

Strukturiertes JSON je Datensatz, vollständige OpenAPI-Doku und interaktive Swagger-UI zum Ausprobieren.

Evidenz & Versionierung

Jeder Datensatz trägt Fundstelle, Score und Version direkt im JSON.

E-Mail-Agent → Excel

Wer keine Integration baut, schickt SDBs per Mail — der Agent liefert die ausgewerteten Daten als fertige Excel-Datei zurück.

In deine Systeme

Direkt in die bestehende Landschaft:

SAP EHSEHSERPPDMPIMREST
01

Höchste Präzision

Getrimmt auf höchste Präzision — mit festen Qualitätsansprüchen an jeden extrahierten Wert.

02

Flexibel erweiterbar

Neue Felder und Prüfungen kommen laufend dazu. Die API wächst mit deinen Anforderungen.

03

Skalierbar in der Nutzung

Vom einzelnen SDB bis zum Massenimport ganzer Bestände — ohne Reibung.

04

Fully managed

Kein Anpassungs-, Wartungs- oder Entwicklungsaufwand. Du integrierst, wir kümmern uns um den Rest.

FAQ

Häufige Fragen zur Extraktion.

Die wichtigsten Antworten rund um Datenumfang, Evidenz, Sprachen und API.

Was ist SdbHub CORE?
SdbHub CORE ist die KI-Datenextraktions-API für Sicherheitsdatenblätter. Sie liest Sicherheitsdatenblätter layoutunabhängig aus und liefert über 100 strukturierte Datenpunkte aus Abschnitt 1 bis 16 — strukturierte Werte und textuelle Phrasen, jeder Wert mit pixelgenauer Fundstelle und Ampel-Validierung.
Welche Daten extrahiert SdbHub CORE aus einem Sicherheitsdatenblatt?
Aus allen 16 Abschnitten: H-/P-Sätze inklusive Volltext, CAS- und EG-Nummern, Einstufung und GHS-Piktogramme, Lagerklasse (LGK) und Wassergefährdungsklasse (WGK), Transportdaten (UN-Nr., ADR), Arbeitsplatzgrenzwerte (AGW) sowie physikalische Werte feingranular mit Operator, Einheit und Bezugsbedingung, etwa Flammpunkt < −18 °C.
Wie verhindert SdbHub CORE halluzinierte oder erfundene Werte?
Nach dem Prinzip „What you see is what you get“: SdbHub CORE liefert ausschließlich Werte, die im Dokument stehen. Fehlt eine Angabe, wird sie als „fehlt“ markiert — nichts wird geraten oder aus Fremddatenbanken ergänzt. Jeder Wert wird validiert und im Ampelsystem (grün, gelb, rot) bewertet.
Was bedeutet pixelgenaue Evidenz?
Zu jedem extrahierten Wert liefert SdbHub CORE die Seite und die exakte Position (Bounding Box) im Original-PDF. In der EHS-Umgebung lässt sich der Wert im Splitscreen direkt neben der Originalstelle prüfen — Rückfragen von Fachanwendern beantworten sich beim Hinsehen.
Welche Sprachen und Dokumenttypen unterstützt SdbHub CORE?
Über 16 Sprachen, einschließlich Chinesisch und Türkisch. SdbHub CORE verarbeitet auch eingescannte und in Bilder eingebettete Bereiche (Close-Verfahren), mehrspaltige Layouts in korrekter Lesereihenfolge sowie KIT-/Multi-Produkt-SDBs, die in eigenständige Datensätze getrennt werden.
Wie wird SdbHub CORE in bestehende Systeme integriert?
Über eine hochverfügbare REST-API mit JSON-Ausgabe und Swagger-/OpenAPI-Dokumentation, einen E-Mail-Agenten für die Excel-Bereitstellung sowie Integrationen in SAP EHS, ERP, PDM und PIM. SdbHub CORE ist ein Fully-Managed-Service ohne Anpassungs-, Wartungs- oder Entwicklungsaufwand.
Wie schnell und präzise ist SdbHub CORE?
Im Schnitt rund 9 Sekunden pro Dokument für die Extraktion (Version 2) und rund 27 Sekunden inklusive Validierung und Evidenzen (Version 3) — bei menschenähnlicher Extraktionsqualität.

Schick uns deine schwierigsten SDBs.

Eingescannt, mehrspaltig, mehrsprachig, KIT — egal. Wir zeigen live, welche Daten SdbHub CORE daraus zieht, mit Evidenz und Ampel zu jedem Wert. Die fachliche Bewertung bleibt bei dir.