web archiving – KB Research http://blog.kbresearch.nl Research at the National Library of the Netherlands Fri, 24 Aug 2018 13:17:55 +0000 en-US hourly 1 https://wordpress.org/?v=4.4.2 NCDD Studiedag: Een web van webarchieven http://blog.kbresearch.nl/2016/11/18/ncdd-studiedag-een-web-van-webarchieven/ http://blog.kbresearch.nl/2016/11/18/ncdd-studiedag-een-web-van-webarchieven/#respond Fri, 18 Nov 2016 11:41:19 +0000 http://blog.kbresearch.nl/?p=2036 Nederland mag dan een klein land zijn, maar we staan wereldwijd wel op nummer 3 wat betreft het aantal uitgereikte domeinnamen – meer dan 5 miljoen. Ruim 14.000 daarvan worden nu door de KB verzameld en gearchiveerd in onze Web Collectie. Gisteren hield de NCDD een studiedag bij het Instituut voor Beeld en Geluid onder de titel Een web van web archieven om de Nederlandse samenwerking bij het bouwen van web collecties te bevorderen.

nominet

Uitsnede van: http://nominet-prod.s3.amazonaws.com/wp-content/uploads/2016/03/Map-Of-The-Online-World.jpg

Dat web archivering nuttig is bleek meteen al uit de door Peter de Bode (KB) samengestelde presentatie van web sites die niet meer online te zien zijn maar wel in ons KB web archief aanwezig zijn. Ook de gastheer Tom de Smet van Beeld en Geluid zei dat hun audiovisuele collectie niet meer los te koppelen is van wat er op het web gebeurt. En dat geldt voor veel organisaties in Nederland. Niet alleen worden web collecties aangelegd omdat het gezien wordt als cultureel erfgoed (zoals door de KB) maar er zijn ook veel organisaties die aan web archivering doen om te voldoen aan de Archiefwet. De NDE werkgroep Web Archivering heeft een onderzoek onder 22 Nederlandse instellingen gedaan om te kijken of er al onderling samengewerkt wordt (de N van NDE is immers “netwerk”). Conclusie is dat dit nog aanzienlijk verbeterd kan worden. De overgrote meerderheid doet pas sinds de laatste 3 jaar iets aan web archivering (de KB sinds 2007), waarbij dan een groot gedeelte dit heeft uitbesteed aan commerciële bedrijven (waardoor ze bijvoorbeeld “geen idee” hadden van de tools die gebruikt werden om de websites binnen te halen: een cruciaal en zeer kwetsbaar onderdeel). Naast het verzamelen van web sites, komt ook de (technisch moeilijke) wens om sociale media te gaan bewaren – waar overigens weer allerlei privacy aspecten aan zitten.

Keynote spreker Herbert van de Sompel (onderzoeker bij Los Alamos National Laboratory, tijdelijk werkzaam bij DANS) demonstreerde een aantal technische oplossingen om ook web archieven die alleen ter plekke en dus niet online raadpleegbaar zijn, toch met elkaar te verbinden, zodat gebruikers weten wie wat bewaart en zelfs een overzicht in de tijd kunnen krijgen op basis van verschillende data waarop een snapshot van de website is gemaakt (memento, memgator ). Ook incomplete pagina’s (het is niet altijd mogelijk alles van een website binnen te halen) zou je op deze wijze kunnen “reconstrueren”, waarbij je je natuurlijk wel moet realiseren in hoeverre dit “authentiek” is.

Filip Boudrez van het Stadsarchief Antwerpen doet al sinds de jaren 90 aan web archivering, waarbij bewijsvorming en verantwoording het uitgangspunt vormen. Hij beschreef de overwegingen bij verschillende stappen en de manieren waarop aan kwaliteitscontrole gedaan wordt, waaronder handmatige controle door vrijwilligers. Documentatie over alle besluitvorming wordt nauwkeurig per web site vastgelegd.

Naast web archivering kennen we tegenwoordig ook web archeologie, dankzij het NDE project van Tjarda de Haan, waarbij De Digitale Stad van Amsterdam gereconstrueerd wordt aan de hand van verzamelde informatie op oude dragers in combinatie met nieuwe technieken.

Rafaël Rozendaal, een web kunstenaar gaf zijn visie op hoe zijn kunst bewaard zou moeten blijven en welke maatregelen hij neemt om zijn kunst zo lang mogelijk werkend te houden, onder het motto “als het niet meer werkt, wordt het archief” (bijvoorbeeld omdat de gebruikte tools niet langer in combinatie werken of het beoogde effect bereiken).

Kees Teszelszky (KB afdeling Onderzoek) toonde de eerste Nederlandse website en vertelde over zijn onderzoek naar de context van de KB Web Collectie in relatie tot wat anderen doen en wat er wellicht meer zou kunnen om het Nederlandse web in web collecties vast te leggen. Samenwerking is ook hier weer het toverwoord.

Dat erfgoed instellingen en overheidsinstellingen elkaar daarbij moeten vinden, vertelde Nick Chapel (Erfgoedinspectie) op basis van het binnenkort te verschijnen rapport: hoewel wettelijk verplicht, schiet de Centrale Overheid nog schromelijk tekort wat betreft het archiveren van hun eigen websites en de bijbehorende sociale media.

In een afsluitend panel werden de NCDD Expert groep Webarchivering gepresenteerd, en werden mogelijke initiatieven met het publiek in de zaal bediscussieerd, onder deskundige leiding van de dagvoorzitter Jantje Steenhuis, stadsarchivaris van Rotterdam.  Aan de slag dus maar, de tijd is er rijp voor!

Barbara Sierman

]]>
http://blog.kbresearch.nl/2016/11/18/ncdd-studiedag-een-web-van-webarchieven/feed/ 0
Oops! Article preserved, references gone http://blog.kbresearch.nl/2015/02/16/oops-article-preserved-references-gone/ http://blog.kbresearch.nl/2015/02/16/oops-article-preserved-references-gone/#respond Mon, 16 Feb 2015 08:46:03 +0000 https://researchkb.wordpress.com/?p=1117 Author: Barbara Sierman
Originally posted on:
http://digitalpreservation.nl/seeds/oops-article-preserved-references-gone/

Scanvans2

Recently an article was published by Klein, Van de Sompel e.a. in PLOS1 (see under), drawing attention to the problem of “reference rot”. Reference rot is a combination of link rot (a reference to a link on the web results in an error message 404) and content drift (the page can be found but the content has been changed.) References in academic publications have a purpose: they underpin the argument. References can point to other scholarly publications but a growing amount of references in scholarly publications refer to sources on the Web. And especially these sources are prone to reference rot (the referenced “publications” having – at least theoretically – a bigger chance of being preserved by national libraries or organisations like CLOCKSS and Portico).

Based on a large set of data, the study shows the impact of reference rot, as well as giving evidence of the fact that many web pages change frequently, not seldom a few days after first being published.

These outcomes will affect a.o. the collections of national libraries and institutional repositories. The authors are worried and conclude that “Our research found that reference rot in scholarly communication is a significant problem that begs for the introduction of a robust solution”. While national libraries preserve academic e-journals and e-books, there is a risk that the references in these publications are no longer there for investigative users. The (future) user might be unable to verify the arguments and conclusions in the publication.

This is a threat to the value of collections. Value consists of several elements. At the KB we used a method called Significance to value our collections. One of the elements is “information value”. This “information value” of the publication is diminishing when verification of the source is no longer possible. Why is it that this risk is not higher on the agenda?

The above mentioned article is restricted to scholarly publications, but with the growing features in e-publications, we might expect this to happen on a larger scale. It is inherent to web-at-large references and will affect a variety of publications, however also in cases the loss of references is less important.

A “robust solution” is not there yet, although this article initiated a creative approach to the link rot problem by my colleague Rene Voorburg (see robustify.js , a website add-on that redirects broken links to archived pages using Memento). David Rosenthal in his excellent blog on this topic doubts whether there will ever be one. He thinks the problem is inherent of the way publishing on the web works. “This is the root of the problem. In the paper world in order to monetize their content the copyright owner had to maximize the number of copies of it. In the Web world, in order to monetize their content the copyright owner has to minimize the number of copies.” Implicitly suggesting that lots of copies should keep the stuff safe!

The reference rot problem is a kind of reality check and shows that even preserved material is incomplete without proper preservation of its context. Content holders should be more aware of this.

You can find the article at:

Klein M, Van de Sompel H, Sanderson R, Shankar H, Balakireva L, et al.(2014) Scholarly Context Not Found: One in Five Articles Suffers from Reference Rot. PLoS ONE 9(12): e115253.http://dx.doi.org/10.1371/journal.pone.0115253

More about this problem can be found at http://robustlinks.mementoweb.org

]]>
http://blog.kbresearch.nl/2015/02/16/oops-article-preserved-references-gone/feed/ 0