Imagine a new course on data integration - what would you hope for? which aspects should be taught? (aiming at not just churning out another open refine tutorial)
@AvSchroeder Fallstudie zur Frage, warum es mit Open Refine nicht getan ist. https://zenodo.org/records/6328027 Ähnliches in größerem Maßstab: https://openhumanitiesdata.metajnl.com/articles/10.5334/johd.307 #selfplug
@AvSchroeder und nicht von mir, aber noch größer angelegt: https://culturalanalytics.org/article/id/1097/
@stefan_hessbrueggen spannend. Danke!
Fühle mich bestätigt, aber die Frage bleibt: was brauchen wir stattdessen?
@AvSchroeder wenn man MARC Daten hat, gibt es z. B. pymarc, um die zumindest schon mal zu lesen. https://pymarc.readthedocs.io/en/latest/ Ansonsten: Grips, Ausdauer und regex (regex sind auch in einem Open Refine Kontext eine Wunderwaffe).
Wenn keine Programmierkenntnisse vorhanden sind, kann man auch ein Spreadsheet mit unbearbeiteten Daten vorbereiten und das in Libre Office Calc bearbeiten. Mit regex! :)
@stefan_hessbrueggen Ich habe jetzt mal beide Artikel (und einges andere aus dem Bereich) gelesen. Komme zu der Überzeugung: Data cleaning erfordert informierte Entscheidungen (Domänenwissen), das aber wiederrum selten dokumentiert ist. Eigentlich müsste man das mit-dokumentieren, weil es die Reusability der Datensätze durchaus beeinflusst. Und ich frage mich, ob enriched data zurückgespielt wird in die repos und datenbanken - das scheint mir nicht immer systematisch zu erfolgen / möglich