Zobrazují se příspěvky se štítkemMETS. Zobrazit všechny příspěvky
Zobrazují se příspěvky se štítkemMETS. Zobrazit všechny příspěvky

úterý 28. března 2017

Dokument "Understanding PREMIS" v nové updatované verzi

Známý úvod do metadatového formátu PREMIS od Priscilly Caplan byl vydán v nové aktualizované verzi. Nová verze reflektuje poslední změny a úpravy PREMISu. Originální verze dokumentu vznikla v roce 2009, aktualizace tedy již byla nutná.

Dostupné na

čtvrtek 30. dubna 2015

Archivematica - co je potřeba upravit pro reálný provoz?

Hybridní soubor jako příklad
Na příkladu ingestu hybridního souboru zde ukážu, čemu je třeba se věnovat, pokud by někdo chtěl používat systém Archivematica v provozu. 

Zkusil jsem do demo Archivematiky ingestovat klasický hybrid - OCR TXT, který obsahuje HTML tagy.
  • Droid/Fido ho chybně identifikují jako html - fmt/96
  • Archivematika ani nemrkne, a uloží to jako html soubor
  • Administrátor se nic nedozví o tom, že vložil soubor s koncovkou txt, který systém identifikuje a validuje jako html
  • Administrátor nemá žádnou možnost jak tohle v systému vyřešit (měl by se dozvědět, že s tím souborem není něco v pořadu a měl by mít nástroje jak to řešit, tak aby soubor skončil v archivu správně validovaný jako txt..)
Podobných hybridů je, především pokud jde o pdf, kolem poměrně dost. Archivematika není schopná s takovými soubory  "spolehlivě" pracovat, protože příliš spoléhá na Droid/Fido, které ale samy o sobě nejsou dokonalé - a pak chybně aplikuje další kroky - extrakci techMD (characterize), normalizaci.

Jaké úpravy mikroslužeb zvážit?  
Pro reálný provoz by to minimálně  chtělo modifikovat mikroslužbu identify, tak aby workflow kváklo, pokud koncovka (nebo i mime type) nesedí s tím, co zjistí Droid nebo Fido....

Ideálně by byly potřeba další výraznější úpravy mikroslužeb, tak aby administrátor mohl podobné situace vyřešit pro tento jeden konkretní soubor případně i pro všechny další přicházející se stejnou chybou v budoucnu....

Služby tvořící transfer a ingest (hlavně characterize a validate) by měly vědět:
  • s jakými vlastnostmi deklarovanými v metadatech třeba v SIP METS objekt přišel (např. v METS SIP může být mime type, originál file name, někdy i PUUID - viz standard NDK)
  • s jakou koncovkou a mime typem objekt přišel (v těle souboru)
  • co zjistil Droid/Fido v identify v předešlém kroku - a měly by si všimnout, pokud to nesedí s tím, co ví ony
  • služba normalize by měla před aplikací normalizace také provádět nějaké kontroly...

Optimalizace AIP METS
V AIP METS Archivematiky jsou rozporné informace.  Archivematice to možná nevadí:-), ale mě, pokud bych měl s takovými daty pracovat, by to asi dost vadilo. Bez rozumné úpravy je informace v METS AIP matoucí, a bylo by dobré předělat služby characterize a create AIP metadata, tak aby dávaly do AIP XML METS jen smysluplné výsledky.

V tomhle jednom triviálním příkladě je v AIP METS:
  • v premis object FormatregistryKey atd - formát fmt/96
  • premis object Charecteristics - výstup z FITS - identify výstup apache tika - unkwnon binary (další blbost - proč apache tiká tady?), vedle toho pak unix file (korektně plain text), NZME (extrakce tecMD - lenght, jinak nic moc), OIS FIle info (size, name, last modified), ffident (nesmysl), tika z znovu text/html, utf-8, jhove (jediný smysluplný výstup).
V tomhle totálním bordelu se o souboru dozvím, že to je "možná fmt/96 možná unkwnon binary nebo plain text, octet stream nebo formát UTF-8" ale v celém AIP METS xml není x-fmt/111 což ten soubor skutečně je....:-) Možná si tvůrčí Archviematiky myslí, že pořádek je pro blbce, otázka je, jestli to je přístup, jakým by mělo být ingestovano (protože o nic jiného než o ingest v Archivematice zatím nejde) větší množství dat. Podle mého názoru nikoli, bez úprav služeb by to do provozu jít někde nemělo...


středa 14. srpna 2013

Co vlastně je digital preservation neboli dlouhodobá ochrana digitálních dat? Informační video a Prezi prezentace.

V uplynulých dnes se objevily dva zdroje, které zjednodušenou formou vysvětlují problémy digital preservation a jejich možná řešení. Prvním je krátké video společnosti Tessella o jejich produktu Preservica. Preservica je vlastně long-term preservation systém umístěný v cloudu, který může zákazník využívat formou předplatného, nepotřebuje ani HW infrastrukturu (IaaS), digital preservation je poskytována jako služba (DPaaS). Tento přístup by mohl být řešením i pro mnoho českých (nejen paměťových) institucí. Video je dostupné tady - https://www.youtube.com/watch?v=GH19MwjYLwI.
Druhým zdrojem je Prezi prezentace "Digital Preservation - Why, What and How" Nira Sherwintera z firmy Ex Libris. Prezentace je pěkně srozumitelným úvodem do problematiky digital preservation. Ke shlédnutí, sdílení atd. je tady http://prezi.com/fcgsodjqhbry/digital-preservation-why-what-and-how/#%21.
Z obou uvedených zdrojů je jasné, že pouhé uložení a správa původních (originálních) souborů není dlouhodobá ochrana digitálních dat, je to jen její předpoklad. Uchování bit streamu nezajistí použitelnost, vyhledatelnost, srozumitelnost souborů a jejich obsahu v budoucnu.

středa 17. července 2013

Publikována zpráva DPC o ochranných metadatech (DPC Technology Watch Report "Preservation metadata")

Britská organizace Digital Preservation Coalition (DPC) zpřístupnila text druhé aktualizované verze reportu "Preservation metadata" - http://dx.doi.org/10.7207/twr13-03. První edice vyšla v roce 2005 a text již bylo potřeba podstatně předělat. Od roku 2005 se jedná o jednu z nejstahovanějších zpráv celé série Technology Watch (http://www.dpconline.org/advice/technology-watch-reports).
Nová verze obšírně popisuje různé aspekty ochranných metadat, zvláště ve vztahu ke standardu PREMIS. V textu naleznete definice ochranných metadat, vývoj pohledu na ně, způsoby využívání v různých institucích, způsob použití PREMIS ve schématu METS, přehled užitečných nástrojů k tvorbě ochranných metadat aj.
Text tak je velmi užitečný pro instituce, které s ochrannými metadaty chtějí začít, ale i pro ty, které je již využívají. Popsána je aktuální situace ve využívání ochranných metadat ve světě, což může být inspirací.

středa 29. září 2010

D-lib 9-10/2010

V posledním čísle D-libu jsou minimálně dva články, které stojí za pozornost: 

Článek shrnuje pětileté zkušenosti Standford Unieversity Library s provozem digitálního repozitáře.   Další vývoj vidí v implementaci modulárního řešení, využití různých volně dostupných služeb (Bag-IT, Curation Micro-Services.) Zajímavé jsou jejich snahy o zjednodušení metadatové modelu, popis zkušeností s METSem.