Imagine a new course on data integration - what would you hope for? which aspects should be taught? (aiming at not just churning out another open refine tutorial)
@AvSchroeder Fallstudie zur Frage, warum es mit Open Refine nicht getan ist. https://zenodo.org/records/6328027 Ähnliches in größerem Maßstab: https://openhumanitiesdata.metajnl.com/articles/10.5334/johd.307 #selfplug
@AvSchroeder und nicht von mir, aber noch größer angelegt: https://culturalanalytics.org/article/id/1097/
@stefan_hessbrueggen spannend. Danke!
Fühle mich bestätigt, aber die Frage bleibt: was brauchen wir stattdessen?
@AvSchroeder wenn man MARC Daten hat, gibt es z. B. pymarc, um die zumindest schon mal zu lesen. https://pymarc.readthedocs.io/en/latest/ Ansonsten: Grips, Ausdauer und regex (regex sind auch in einem Open Refine Kontext eine Wunderwaffe).
Wenn keine Programmierkenntnisse vorhanden sind, kann man auch ein Spreadsheet mit unbearbeiteten Daten vorbereiten und das in Libre Office Calc bearbeiten. Mit regex! :)
@AvSchroeder ich schließe mich @stefan_hessbrueggen an, regex als Wunderwaffe halte ich für sehr wichtig & sinnvoll
Für den Rest deiner Frage fehlt mir leider etwas Kontext, u.a. an wen sich der Kurs richten soll und welche (Fach-)Bereiche abgedeckt werden sollen
@lavaeolus @stefan_hessbrueggen
Regex ist immer gut.
Der Kurs würde sich an Menschen richten, die mit objektzentrierten Daten / naturkundlichen Sammlungen forschen.
Was den Inhalt angeht: Szenarien kann ich mir ausdenken, aber bisher scheint reflexhaft OpenRefine erwähnt zu werden. Ich dachte, ich gehe das Ganze mal von einer anderen Seite aus an. Bin aber noch nicht ganz sicher wie drum die eher offen formulierte Frage.
Vielleicht mit Fokus auf Reusability?
@AvSchroeder Ich pinge mal @awinkler, der hat dazu schon viel gemacht.
Vermutlich wären Jupyter-Notebooks mit Code zum Austesten+Nachnutzen bei der Datenverarbeitung, Reuse, etc. hilfreich
Muss da gerade auch an die Quadriga-Fallstudien-OER denken: https://www.quadriga-dk.de/de
@lavaeolus @AvSchroeder @stefan_hessbrueggen Ich bräuchte da auch etwas mehr Kontext. OpenRefine ist halt bei der quantitativen Auswertung nicht so gut. Idem bei hierarchisch verschachtelten Daten.
Edit: "nicht so gut" = ungeeignet
@awinkler @lavaeolus @AvSchroeder @stefan_hessbrueggen ich habe es selber bislang noch nie benutzt, bzw mich damit befasst, aber ich glaube ja, dass #catmandu da ein interessantes Tool darstellt. https://librecat.org/Catmandu/
@awinkler @lavaeolus @AvSchroeder @stefan_hessbrueggen da gibt's ein gut gealtetes meme dazu 😅https://openbiblio.social/@jorol/113582735799947535
@librerli @awinkler @lavaeolus @AvSchroeder @stefan_hessbrueggen Catmandu und Metafacture sind sich mittlerweile recht ähnlich, seitdem wir Metafix als Transformationssprache entwickelt haben, die stark von Catmandu Fix orientiert ist. Damals gab es auch noch Ideen, Fix unabhängig als Transformationssprache zu standardisieren (siehe etwa die Metafix-Projektbeschreibung: https://lobid.org/project/metafacture-fix/).