Imagine a new course on data integration - what would you hope for? which aspects should be taught? (aiming at not just churning out another open refine tutorial)
@AvSchroeder Fallstudie zur Frage, warum es mit Open Refine nicht getan ist. https://zenodo.org/records/6328027 Ähnliches in größerem Maßstab: https://openhumanitiesdata.metajnl.com/articles/10.5334/johd.307 #selfplug
@AvSchroeder und nicht von mir, aber noch größer angelegt: https://culturalanalytics.org/article/id/1097/
@stefan_hessbrueggen spannend. Danke!
Fühle mich bestätigt, aber die Frage bleibt: was brauchen wir stattdessen?
@AvSchroeder wenn man MARC Daten hat, gibt es z. B. pymarc, um die zumindest schon mal zu lesen. https://pymarc.readthedocs.io/en/latest/ Ansonsten: Grips, Ausdauer und regex (regex sind auch in einem Open Refine Kontext eine Wunderwaffe).
Wenn keine Programmierkenntnisse vorhanden sind, kann man auch ein Spreadsheet mit unbearbeiteten Daten vorbereiten und das in Libre Office Calc bearbeiten. Mit regex! :)
@AvSchroeder ich schließe mich @stefan_hessbrueggen an, regex als Wunderwaffe halte ich für sehr wichtig & sinnvoll
Für den Rest deiner Frage fehlt mir leider etwas Kontext, u.a. an wen sich der Kurs richten soll und welche (Fach-)Bereiche abgedeckt werden sollen
@lavaeolus @stefan_hessbrueggen
Regex ist immer gut.
Der Kurs würde sich an Menschen richten, die mit objektzentrierten Daten / naturkundlichen Sammlungen forschen.
Was den Inhalt angeht: Szenarien kann ich mir ausdenken, aber bisher scheint reflexhaft OpenRefine erwähnt zu werden. Ich dachte, ich gehe das Ganze mal von einer anderen Seite aus an. Bin aber noch nicht ganz sicher wie drum die eher offen formulierte Frage.
Vielleicht mit Fokus auf Reusability?