Zum Inhalt springen
8 Min. Lesezeit

Föderierte Förderdaten – das Civic Data Lab fördert Open Data

Wer nach einer passenden Förderung sucht, kennt die Herausforderung: Welches Förderprogramm auf Bundes-, Landes- und EU-Ebene, von Stiftungen und anderen Organisationen ist das passende? Im Civic Data Lab (CDL) haben wir deshalb untersucht, wie sich Informationen zu Förderprogrammen als offene, strukturierte und miteinander verknüpfbare Daten zusammenführen lassen. Entstanden ist kein fertiger Datensatz, sondern ein Vorschlag dafür, wie gute Förderdaten aussehen könnten.

Zwei Datenprojekte, ergänzt durch weitere Erkenntnisse für ein gemeinsames Schema

Bei den föderierten Förderdaten hat das CDL die Ergebnisse aus zwei Datenprojekten durch die Initiative einer dritten Partei zu guten Erkenntnissen gebracht. Indem das CDL in Open Data investiert hat, sind solche Daten überhaupt nur möglich geworden. Im Folgenden beschreiben wir, wie wir vorgegangen sind und ermöglichen Euch damit, bei anderen Anwendungsfällen ähnlich vorzugehen. Denn das, was das CDL mit Förderprogrammen gemacht hat, kann auch auf viele andere Projekte übertragen werden. Gern könnt Ihr beim Projekt mitmachen, , indem ihr das vorgeschlagene Schema weiter befüllt. Nach aktuellem Stand vom 2. Oktober 2026 gibt es 5244 Einträge in dem zusammengeführten Datensatz.

Vom Scraper zum Open-Data-Projekt

Ihr kennt das womöglich alle. Die Informationen zu den verschiedenen Förderprogrammen liegen meist auf unterschiedlichen Portalen, sind unterschiedlich aufgebaut und wichtige Angaben verstecken sich häufig im Fließtext. Meist ist es sehr mühsam, sich einen Überblick über die Förderprogramm-Daten zu verschaffen. Genau hier hat das Civic Data Lab bei föderierten Förderdaten angesetzt.

Ursprünglich gab es ein gemeinsames Datenprojekt zur Demokratieförderung mit dem Bundesverband der Arbeiterwohlfahrt (AWO) unter Beteiligung des Civic Data Labs. Dafür wurden Daten aus der Förderdatenbank des Bundes ausgewertet. Aber es gab von Anfang an eine große Hürde: Es gab keine geeignete Schnittstelle, über die sich die Daten strukturiert abrufen ließen. Aus diesem Grund entwickelte CorrelAid für das CDL einen Scraper, der Informationen automatisiert aus der Förderdatenbank ausliest und sie für die weitere Verarbeitung aufbereitet. Inzwischen stellt die Förderdatenbank einen XML-Export bereit. Das ist ein wichtiger Fortschritt. Im Sinne von Open Data sind die Informationen damit aber noch nicht direkt nutzbar. Sie müssen weiterverarbeitet werden, bevor beispielsweise eine übersichtliche Tabelle daraus entstehen kann. Und der Export kann zudem immer nur den aktuellen Stand abbilden. Wird ein Förderprogramm gelöscht, verschwindet es auch aus dem Export.

Dass sich dieser Aufwand dennoch lohnt, zeigte sich unerwartet: Ein Forscher des Zentrums für Angewandte Künstliche Intelligenz (ZAKI) der Ernst-Abbe-Hochschule Jena entdeckte den Scraper und entwickelte auf Basis der Daten ein eigenes Werkzeug, das die Suche nach Förderprogrammen erleichtert. Genau darin liegt ein zentraler Wert von Open Data. Man muss nicht im Vorfeld wissen, wer Daten später wofür nutzen wird. Wenn sie offen zur Verfügung stehen und gut zugänglich sind, können andere daraus neue Anwendungen entwickeln.

Viele Förderportale, viele Datenwelten

Da die Förderdatenbank des Bundes nur eine von vielen Quellen darstellt, hat das CDL zudem die Förderdatenbank der Deutschen Stiftung für Engagement und Ehrenamt (DSEE), das Funding & Tenders Portal der Europäischen Union, den Förderfinder Bayern und das zivilgesellschaftliche Angebot „Fördermittelkompass“ (das einzige mit einer öffentlich dokumentierten Schnittstelle) mit ausgewertet. Der Fördermittelkompass wurde nur als Schema berücksichtigt, da die Daten nur gegen Bezahlung verfügbar sind.

Da jedes dieser Förderportale die jeweiligen Fördermöglichkeiten etwas anders beschreibt, musste hier eine Lösung her. Genau hier wird der föderierte Datenpool interessant. Statt alle Daten in einer zentralen DatenbankDatenbankEine Datenbank ist ein System zur Speicherung und Verwaltung von Daten. Es handelt sich um eine Softwareanwendung, die strukturierte Daten in Tabellen (Spalten und Zeilen) organisiert und effiziente Abfragen und Transaktionen ermöglicht. Datenbanken werden in zahlreichen Bereichen eingesetzt, um große Mengen an Informationen sicher und zugänglich zu halten. neu zu sammeln, können Informationen aus unterschiedlichen Quellen zusammengeführt und nach gemeinsamen Regeln beschrieben werden. Dafür braucht es vor allem ein gemeinsames Schema.

Was ist ein Datenschema?

Ein Schema legt fest, welche Informationen erfasst werden und was sie genau bedeuten.

Am Beispiel des Begriffes „Fördersumme“ ist erkennbar, dass eine Zahl allein nicht ausreicht. Hier haben sich beispielsweise folgende Fragen gestellt:

  • Handelt es sich um den maximal möglichen Betrag?
  • Um die durchschnittliche Förderung?
  • Handelt es sich um den Eigenanteil, den eine Organisation selbst aufbringen muss?

Bei der Entwicklung des Schemas hat sich das CDL deshalb angeschaut, welche Lösungen bereits existieren. Die Förderdatenbank des Bundes unterscheidet beispielsweise nach Förderbereich, Fördergebiet, Förderberechtigten und Förderart. Die DSEE erfasst zusätzliche Angaben, die insbesondere für Vereine und Initiativen interessant sind, etwa wie maximale Fördersummen, förderfähige Kosten oder den vorzeitigen Maßnahmenbeginn. Der Standard XFöderleistungsbeschreibung (XFLB 2.0) wiederum bietet eine detaillierte Begriffshierarchie für staatliche Förderungen. Das EU-Portal bildet unterschiedliche Fristen sehr genau ab.

Jede Quelle hat somit einen Teil der Antwort, aber keine Quelle kann die Gesamtheit abbilden. Hinzu kommt, dass unterschiedliche Systeme, unterschiedliche Begriffe verwenden. Was bei einer Quelle beispielsweise „Umwelt- und Naturschutz“ heißt, kann bei einer anderen „Umwelt-/Naturschutz, Klimaschutz und Tierschutz“ heißen. Inhaltlich kann aber Ähnliches gemeint sein. Maschinen können diese Kategorien trotzdem nicht ohne Weiteres zusammenführen.

Vier Fragen, die Fördersuchende wirklich interessieren

Beim Schema des Civic Data Labs sollte nicht allein von vorhandenen Datenstrukturen ausgegangen werden. Das CDL hat deshalb versucht, die Perspektive zu wechseln:

Was wollen Menschen eigentlich wissen, wenn sie nach einer Förderung suchen? Ob Forschungsgruppe, Initiative oder Nachbarschaftsverein, meistens geht es zunächst um vier Fragen, die alle Suchenden haben:

  • Bin ich antragsberechtigt?
  • Bis wann kann ich einen Antrag stellen?
  • Wie viel Geld kann ich bekommen?
  • Wo und wie stelle ich den Antrag?

Das klingt selbstverständlich. In den untersuchten Portalen lassen sich diese Fragen aber nicht durchgehend über Filter beantworten. Angaben zu Fördersummen oder Fristen stehen beispielsweise häufig nur in der Programmbeschreibung. Um herauszufinden, ob sich die Beschäftigung mit einem Förderprogramm überhaupt lohnt, muss man häufig erst längere Texte lesen.

Ein gemeinsames Modell für Fördermöglichkeiten

Der Vorschlag des CDL für ein Modell für Fördermöglichkeiten trägt den Namen FundingOpportunity. Gemeint ist damit ein Förderangebot einer staatlichen oder nicht-staatlichen Organisation für einen bestimmten Empfängerkreis und einen bestimmten Zweck. Das Schema liegt offen im RDF-Format vor und kann damit selbst weiterverwendet und weiterentwickelt werden.

Das Schema strukturiert unter anderem folgende Informationen:

  • Fördergeber und Art des Fördergebers, beispielsweise Bund, Land, Kommune, EU oder Stiftung.
  • Vereine, Unternehmen, Forschungseinrichtungen, Kommunen oder Privatpersonen (Antragsteller).
  • Zuschuss, Darlehen, Bürgschaft oder Preis als Förderung
  • Mindest- und Höchstsumme sowie Förderquote als Zahlen statt als Angaben im Fließtext.
  • Fristen für einmalige, wiederkehrende oder laufende Förderungen und den jeweiligen Daten.
  • Mit Angaben zur Region, wo gefördert wird und einem Link zur Antragstellung.

Themenbereiche, die sich möglichst über die unterschiedlichen Datenquellen hinweg zusammenführen lassen und erkenne lassen, was gefördert wird.

Wie werden daraus föderierte Förderdaten?

Technisch nutzt das CDL den Directory Builder des föderierten Datenpools. Mit derselben Werkzeugkette wurde bereits ein Verzeichnis sozialer Hilfsangebote aufgebaut. Die Daten durchlaufen mehrere Schritte:

Sie werden aus den jeweiligen Quellen abgerufen,

in ein einheitliches Format gebrach

und auf das gemeinsame Schema übersetzt.

Anschließend wird geprüft, ob dasselbe Förderprogramm in mehreren Quellen vorkommt.

Das ist wichtig, da sich die Angebote der Förderdatenbank des Bundes, der DSEE und anderer Portale überschneiden können. Statt ein Programm mehrfach anzuzeigen, soll daraus ein gemeinsamer Eintrag entstehen, der die Information ergänzt, aus welchen Quellen die Daten stammen. So bleibt die Herkunft nachvollziehbar, während die Informationen gemeinsam nutzbar werden.

Warum wir trotzdem noch nicht am Ziel sind

Das wichtigste Ergebnis des Projekts ist derzeit weniger ein fertiger Datensatz, als ein Vorschlag, wie Förderdaten strukturiert sein sollten. Denn ausgerechnet einige der Informationen, die für Fördersuchende besonders wichtig sind, können aus den bestehenden Quellen nicht zuverlässig übernommen werden. Fördersummen, Förderquoten, Fristen oder Voraussetzungen für die Antragstellung stehen häufig ausschließlich in Fließtexten.

Technisch könnten Sprachmodelle oder andere Verfahren des Natural Language Processing solche Angaben teilweise automatisiert extrahieren. Für dieses Projekt haben wir darauf bewusst verzichtet. Automatische Extraktion kann Fehler produzieren, verursacht zusätzlichen Aufwand und muss bei Änderungen der Ausgangstexte immer wieder neu durchgeführt werden.

Grundsätzlich wäre es von Vorteil, wenn die Informationen bereits an der Quelle strukturiert veröffentlicht würden. Dafür bräuchte es aus Sicht des CDL vor allem drei Dinge:

  • strukturierte Felder für Fördersumme, Fördermodell, Frist und Antragsberechtigung,
  • stabile Kennungen für einzelne Förderprogramme
  • sowie dokumentierte Schnittstellen, die nicht nur den aktuellen Stand, sondern auch historische Daten zugänglich machen.

Mit Open Data können Andere jetzt weitermachen

Das CDL-Projekt ist eine kleine Open-Data-Erfolgsgeschichte: Aus einem Scraper für ein gemeinsames Projekt mit der AWO wurden offene Daten. Ein Forscher in Jena entdeckte sie und entwickelte daraus ein neues Suchwerkzeug. Damit entstand eine Anwendung, die im Civic Data Lab nicht geplant war. Gleichzeitig zeigt das Projekt, wie viel Arbeit weiterhin künftig nötig ist, um bereits öffentliche Informationen als Daten nutzbar zu machen.

Das Schema für Förderdaten ist ein Vorschlag auf diesem Weg und ausdrücklich offen für alle zur Weiterentwicklung. Der föderierte Datenpool lebt davon, dass unterschiedliche Perspektiven und Datenquellen zusammenkommen. Deshalb freuen wir uns über Menschen, die das Schema kommentieren, weitere Förderdatenquellen vorschlagen, Mappings zwischen unterschiedlichen Kategorien beitragen oder an Lösungen für Informationen arbeiten möchten, die bislang nur in Fließtexten vorliegen.

Denn gute Förderdaten helfen nicht nur dabei, schneller die passende Förderung zu finden. Sie zeigen auch, was möglich wird, wenn öffentliche Informationen tatsächlich als offene Daten gedacht werden.

Mitmachen ist also ausdrücklich erwünscht!

Das Projekt und den aktuellen Stand gibt es offen auf GitHub:

Funding Directory Builder:

https://github.com/foederierter-datenpool/funding-directory-builder

Schema:

https://github.com/foederierter-datenpool/funding-directory-builder/blob/main/config/federation.ttl

FDB Scraper:

https://github.com/CorrelAid/fdb_scraper

  • #CDL News
  • #Espresso Talks
  • #Vernetzen

Espresso-Talk: Künstliche Intelligenz in NROs

In unserer vergangenen Ausgabe des Espresso-Talks konnten wir Maximilian Schultz und Franziska Hauer als Gast in der Civic Data Lab Community begrüßen. Sie gaben uns spannende Einblicke in ihr Forschungsprojekt "KINiro – Künstliche Intelligenz in NROs" am Institut für Sozialforschung und Technikfolgenabschätzung (IST) der OTH Regensburg. Gemeinsam mit ihnen ging es über die von ihnen durchgeführte neue Studie zu Bedarf, Akzeptanz und Umsetzungsmöglichkeiten von KI in Nichtregierungsorganisationen (NROs) .
Weiterlesen
  • #CDL News
  • #Espresso Talks
  • #Gastbeiträge

Wo sind die Daten der Zivilgesellschaft? Ein Portal, das Antworten gibt.

Gemeinnützige Organisationen, Vereine und Stiftungen erheben ständig Daten. Umfragen, Messwerte, Projektberichte – ein riesiges Reservoir an Wissen, das täglich entsteht. Und trotzdem: Wer nach diesen Daten sucht, tappt oft im Dunkeln. Die Datensätze existieren, aber sie sind dezentral verteilt, gar nicht veröffentlicht, schwer auffindbar oder und damit für andere praktisch unsichtbar.
Weiterlesen
  • #CDL News
  • #Espresso Talks
  • #Machen
  • #Vernetzen

Model Context Protocol – wie KI-Modelle mit Tools und Daten verbunden werden

Sprachmodelle sind leistungsstark – aber ohne Anbindung an interne Systeme bleiben sie Insellösungen. Das Model Context Protocol (MCP) schließt diese Lücke. Was dahintersteckt, wo es hilft und worauf Organisationen achten sollten.
Weiterlesen