{"id":1391,"date":"2020-05-29T11:41:15","date_gmt":"2020-05-29T09:41:15","guid":{"rendered":"https:\/\/hannes.enjoys.it\/blog\/?p=1391"},"modified":"2020-10-04T13:36:57","modified_gmt":"2020-10-04T11:36:57","slug":"das-eigene-kleine-deutschlandradio-archiv","status":"publish","type":"post","link":"https:\/\/hannes.enjoys.it\/blog\/2020\/05\/das-eigene-kleine-deutschlandradio-archiv\/","title":{"rendered":"Das eigene kleine Deutschlandradio Archiv"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Mediatheken des \u00d6ffentlich-rechtlichen Rundfunks m\u00fcssen wegen asozialen Arschl\u00f6chern ihre Inhalte <a href=\"https:\/\/de.wikipedia.org\/wiki\/Depublizieren\">depublizieren<\/a>. Wegen anderer Arschl\u00f6cher sind die Inhalte nicht konsequent unter freien Lizenzen, aber das ist ein anderes Thema.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ich hatte mir irgendwann mal angesehen, was es eigentlich f\u00fcr ein Aufwand w\u00e4re, die Inhalte verschiedener Mediatheken in ein privates Archiv zu spiegeln. Mit dem Deutschlandradio hatte ich angefangen und mit den \u00fcblichen Tools t\u00e4glich die neuen Audiobeitr\u00e4ge in ein Google Drive geschoben. Dieses Setup l\u00e4uft jetzt seit mehr als 2 Jahren ohne Probleme und vielleicht hat ja auch wer anders Spa\u00df dran:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Also:<\/p>\n\n\n\n<ul class=\"wp-block-list\"><li>rclone einrichten oder mit eigener Infrastruktur arbeiten (dann die rclone-Zeile mit z.B. rsync ersetzen)<\/li><li>&lt;20 GB Platz haben<\/li><li>Untenstehendes Skript als t\u00e4glichen Cronjob einrichten (und sich den Output zu mailen lassen)<\/li><li><figure class=\"wp-block-video\"><video autoplay=\"\" loop=\"\" muted=\"\" src=\"https:\/\/hannes.enjoys.it\/blog\/wp-content\/uploads\/giphy.mp4\"><\/figure><\/li><\/ul>\n\n\n\n<pre class=\"wp-block-code\"><code>#!\/bin\/bash\n\n# exit if anything fails\n# not a good idea as downloads might 404 :D\nset -e\n\ncd \/home\/dradio\/deutschlandradio\n\n# get all available files\nwget -nv -nc -x \"http:\/\/srv.deutschlandradio.de\/aodlistaudio.1706.de.rpc?drau:page=\"{0..100}\"&amp;drau:limit=1000\"\ngrep -hEo 'http.*mp3' srv.deutschlandradio.de\/* | sort | uniq > urls\n\n# check which ones are new according to the list of done files\ncomm -13 urls_done urls > todo\n\nnumberofnewfiles=$(wc -l todo | awk '{print $1}')\necho \"${numberofnewfiles} new files\"\n\nif (( numberofnewfiles &lt; 1 )); then\n        echo \"exiting\"\n        exit\nfi\n\n# get the new ones\necho \"getting new ones\"\nwget -i todo -nv -x -nc || echo \"true so that set -e does not exit here :)\"\necho \"new ones downloaded\"\n\n# copy them to remote storage\nrclone copy \/home\/dradio_scraper\/deutschlandradio remote:deutschlandradio &amp;&amp; echo \"rclone done\"\n\n## clean up\n# remove files\necho \"cleaning up\"\nrm -r srv.deutschlandradio.de\/\nrm -rv ondemand-mp3.dradio.de\/\nrm urls\n\n# update list of done files\ncat urls_done todo | sort | uniq > \/tmp\/urls_done\nmv \/tmp\/urls_done urls_done\n\n# save todo of today\nmv todo urls_$(date +%Y%m%d)\n\necho \"done\"<\/code><\/pre>\n\n\n\n<p class=\"wp-block-paragraph\">Pro Tag sind es so 2-3 Gigabyte neuer Beitr\u00e4ge.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In zwei Jahren sind rund 2,5 Terabyte zusammengekommen und ~300.000 Dateien, aber da sind eventuell auch die Seiten des Feeds mitgez\u00e4hlt worden und Beitr\u00e4ge, die schon \u00e4lter waren.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Wer mehr will nimmt am besten direkt die Mediathekview-Datenbank als Grundlage.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">N\u00e4chster Schritt w\u00e4re das eigentlich auch t\u00e4glich nach archive.org zu schieben.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Mediatheken des \u00d6ffentlich-rechtlichen Rundfunks m\u00fcssen wegen asozialen Arschl\u00f6chern ihre Inhalte depublizieren. Wegen anderer Arschl\u00f6cher sind die Inhalte nicht konsequent unter freien Lizenzen, aber das ist ein anderes Thema. Ich hatte mir irgendwann mal angesehen, was es eigentlich f\u00fcr ein Aufwand w\u00e4re, die Inhalte verschiedener Mediatheken in ein privates Archiv zu spiegeln. Mit dem Deutschlandradio hatte [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[54,22,32,3,18,40],"tags":[],"class_list":["post-1391","post","type-post","status-publish","format-standard","hentry","category-archiving","category-commandline","category-german","category-guide","category-journalismus","category-small-things"],"_links":{"self":[{"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/posts\/1391","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/comments?post=1391"}],"version-history":[{"count":6,"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/posts\/1391\/revisions"}],"predecessor-version":[{"id":1423,"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/posts\/1391\/revisions\/1423"}],"wp:attachment":[{"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/media?parent=1391"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/categories?post=1391"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/hannes.enjoys.it\/blog\/wp-json\/wp\/v2\/tags?post=1391"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}