Code
source(here::here("R", "prep.R"))source(here::here("R", "prep.R"))Ziel dieses Kapitels ist es, zu dokumentieren, welches Vorgehen für die Datenaufbereitung verwendet wurde, und anschließend ein Produkt zu entwickeln, um die Daten zugänglicher und transparenter zu machen.
Alle Analysen dieses Buchs laufen gegen denselben aufbereiteten Datensatz. Dafür wurde eine zentrale Datei prep.R geschrieben; diese wird am Anfang jedes Kapitels einmal geladen und stellt alle Objekte bereit, um die Reproduzierbarkeit der Ergebnisse zu gewährleisten.
Was prep.R konkret tut:
Laden: Die Excel-Datei Digitalhaushalt_Open_Data_DOI.xlsx (Blatt „Daten“) wird vollständig eingelesen. Ein zweites Blatt enthält die Metadaten des Projekts.
Filtern: Rund 61 Zeilen ohne Soll-Betrag oder Titeltexte werden entfernt. Der verbleibende Datensatz umfasst alle Haushaltsjahre (2019, 2021, 2023, 2024, 2025).
Funktionenplan aufdröseln: Die dreistellige Funktionskennziffer (funktion) wird in zwei neue Spalten zerlegt: funktion_lvl1 (Hauptfunktion, 1 Ziffer, 9 Klassen) und funktion_lvl2 (Oberfunktion, 2 Ziffern, 56 Klassen). Das erlaubt Analysen auf beiden Ebenen der amtlichen Haushaltssystematik.
Kategorie zusammenführen: Der Rohdatensatz enthält neun separate Binärspalten für die digitalen Themen (_1_infra bis _9_unteilbare_ausg). Jede digitale Zeile setzt genau eine davon auf 1. Diese werden zu einer einzigen numerischen Spalte kategorie (1–9) zusammengefasst; nicht-digitale Zeilen erhalten NA. Die ursprünglichen Spalten entfallen anschließend.
Labels: Für alle Code-Spalten werden benannte Vektoren bereitgestellt – von den neun Digital-Themen (kat_labels) über beide Funktionenplan-Ebenen (hf_labels, of_labels) bis zu den verkürzten Plot-Labels (hf_labels_short).
Grafik- und Tabellenstil: theme_hhc() und hhc_table() / hhc_dt() sind einmal definiert und in allen Kapiteln konsistent.
Beim Aufbau dieser Datengrundlage wurde schnell klar: Der Datensatz ist komplex genug, um eigene Dokumentationsarbeit zu rechtfertigen. Gleichzeitig ist er wertvoll genug, um ihn nicht hinter einer Excel-Datei zu verstecken. Wer die Daten nachnutzen möchte, sollte das direkt aus R heraus tun können, mit Spaltendokumentation und fertigen Lookup-Tabellen.
Daraus entstand DHaushaltR: Ein R-Datenpaket, das den aufbereiteten Digitalhaushalt-Datensatz zusammen mit allen Beschriftungsvektoren frei verfügbar macht. Das Paket ist kein Analysetool, sondern ein Datenzugang: Es liefert digitalhaushalt (ca. 27.000 Haushaltszeilen), die neun kat_labels, beide Funktionenplan-Ebenen, Gruppen- und TexAn-Schlüsselwörter. Damit wird weitere Arbeit mit dem Datensatz möglich, die gut dokumentiert, direkt verwendbar und reproduzierbar ist.
Mögliche Anwendungen hierfür sind Statistik-Kurse und Seminare sowie weitere Arbeit durch die Zivilgesellschaft, Forschende, Journalist:innen und alle, die digitalpolitische Haushaltsentscheidungen nachvollziehen wollen.
Installation:
# install.packages("pak")
pak::pak("juanvivancot/DHaushaltR")Schnelleinstieg:
library(DHaushaltR)
library(dplyr)
data(digitalhaushalt)
# Alle bestätigt digitalen Zeilen, mit lesbarer Kategorie
digitalhaushalt %>%
filter(!is.na(kategorie)) %>%
mutate(thema = kat_labels[as.character(kategorie)]) %>%
count(thema, sort = TRUE)