Příspěvky z iPresu 2017 v Japonsku jsou online (https://ipres2017.jp/programme/). Je tam docela hodně zajímavých textů. Na rozdíl od Pasigu tady jsou k dispozici full texty a některé články jsou i delší a techničtější.
Chtěl bych upozornit na dva zabývající se PDF, ale ja tam řada dalších zajímavých:
Michelle Lindlar, Yvonne Tunnat and Carl Wilson. A Test-Set for Well-Formedness Validation in JHOVE – The Good, the Bad and the Ugly
Marco Klindt. A considered harmful for digital preservation
Zobrazují se příspěvky se štítkemPDF/A. Zobrazit všechny příspěvky
Zobrazují se příspěvky se štítkemPDF/A. Zobrazit všechny příspěvky
středa 4. října 2017
úterý 12. září 2017
Preservation with PDF/A (2nd Edition) DPC Technology Watch Report
Preservation
with PDF/A
(2nd Edition)
DPC Technology Watch Report
17-01 July 2017
Betsy A Fanning AIIM
http://www.dpconline.org/docs/technology-watch-reports/1703-preservation-with-pdf-a-twr-17-01/file
17-01 July 2017
Betsy A Fanning AIIM
http://www.dpconline.org/docs/technology-watch-reports/1703-preservation-with-pdf-a-twr-17-01/file
úterý 24. ledna 2017
Diplomky na UK pouze digitálně
Univerzita Karlova se rozhodla pro archivaci závěrečných kvalifikačních prací (tedy bakalářek, diplomek i rigorózních a disertačních prací) pouze v elektronické podobě. Konkrétním vyjádřením tohoto rozhodnutí je Opatření rektora č. 23/2016, které možnost odevzdání textu omezuje pouze na formát PDF/A (verze 1a nebo 2u). Byla zpřísněna také pravidla pro odevzdávání příloh. Studentům je k dispozici seznam schválených formátů, které budou akceptovány automaticky, a možnost zažádat o přijetí přílohy v neschváleném formátu. Studenti jsou povinni odevzdávat PDF/A od 1. 2. 2016.
Opatření rektora doplňuje metodický pokyn a prozatímní informační stránka pro studenty.
Validace PDF/A bude probíhat pomocí nástroje veraPDF, formáty ostatních souborů budou pouze identifikovány pomocí nástroje Fido.
Otázka zrušení povinnosti odevzdávat i tištěnou verzi práce byla ponechána na rozhodnutí fakult. Je tedy možné, že tištěné verze budou i nadále zpřístupňovány v některých knihovnách.
Opatření rektora doplňuje metodický pokyn a prozatímní informační stránka pro studenty.
Validace PDF/A bude probíhat pomocí nástroje veraPDF, formáty ostatních souborů budou pouze identifikovány pomocí nástroje Fido.
Otázka zrušení povinnosti odevzdávat i tištěnou verzi práce byla ponechána na rozhodnutí fakult. Je tedy možné, že tištěné verze budou i nadále zpřístupňovány v některých knihovnách.
pondělí 16. ledna 2017
Kdy vydá NDA xml profil pro validaci PDF/A?
V návaznosti na předešlou zprávu o publikaci verze 1.0 validátoru PDF/A veraPDF mě napadá, že by vlastně bylo logické, aby Národní archiv (resp. NDA) vydal xml profil pro validaci PDF/A podle jeho požadavků.
Legislativně deklarovaný požadavek na PDF/A-1a potřebuje doplnění a vysvětlení - je validní reprezentací PDF/A-1a takový soubor PDF/A, které neprojde validací PDF/A-2u nebo 3a? Validace úrovně 2u nebo 3a je podrobnější než validace podle profilu úrovně 1a (kontroluje se více pravidel)....
Legislativně deklarovaný požadavek na PDF/A-1a potřebuje doplnění a vysvětlení - je validní reprezentací PDF/A-1a takový soubor PDF/A, které neprojde validací PDF/A-2u nebo 3a? Validace úrovně 2u nebo 3a je podrobnější než validace podle profilu úrovně 1a (kontroluje se více pravidel)....
úterý 10. ledna 2017
veraPDF 1.0 je tu!
Konzorcium veraPDF dnes oznámilo uvolnění verze veraPDF 1.0.
http://verapdf.org/2017/01/10/verapdf-1-0-released/?utm_source=veraPDF+News
veraPDF je PDF/A validátor, open source, vyvíjený v projektu Open Preservation Foundation a PDF Association, validuje všechny části a úrovně ISO 19005 (PDF/A). Je dostupný pod licencemi MPLv2+/GLPv3+.
Jak důležitý krok je to pro použitelnost PDF/A v archivech asi není třeba vysvětlovat, naše archivní legislativa o tom, jak se prokazuje shoda s ISO 19005, taktně mlčí. veraPDF dává archivům do ruky nástroj, který jim umožní posoudit shodu s touto normou nebo s vlastním profilem - v případech, kdy je archiv připraven přijmout PDF/A nedovídající některým požadavkům zcela přesně.
veraPDF je PDF/A validátor, open source, vyvíjený v projektu Open Preservation Foundation a PDF Association, validuje všechny části a úrovně ISO 19005 (PDF/A). Je dostupný pod licencemi MPLv2+/GLPv3+.
Jak důležitý krok je to pro použitelnost PDF/A v archivech asi není třeba vysvětlovat, naše archivní legislativa o tom, jak se prokazuje shoda s ISO 19005, taktně mlčí. veraPDF dává archivům do ruky nástroj, který jim umožní posoudit shodu s touto normou nebo s vlastním profilem - v případech, kdy je archiv připraven přijmout PDF/A nedovídající některým požadavkům zcela přesně.
čtvrtek 8. září 2016
Preforma Experience Workshop - 23.11.2016
Prakticky za rohem, v Berlíně, se v listopadu koná seminář o výsledcích projektu PREFORMA.
http://experienceworkshop.preforma-project.eu/programme/
PREFORMA je zdaleka nejzajímavější aktivita v oblasti dlouhodobé archivace v Evropě - formou PPP EU financovala vývoj tří nástrojů pro dlouhodobou archivaci, resp. pro conformance checking - VeraPDF, DPF Manager, MediaConch.
http://experienceworkshop.preforma-project.eu/programme/
PREFORMA je zdaleka nejzajímavější aktivita v oblasti dlouhodobé archivace v Evropě - formou PPP EU financovala vývoj tří nástrojů pro dlouhodobou archivaci, resp. pro conformance checking - VeraPDF, DPF Manager, MediaConch.
Na semináři by mělo jít především o zkušenosti s těmito nástroji, které dnes mají některé paměťové instituce.
středa 29. června 2016
Máme vůbec chtít normalizovat PDF do PDF/A 1a?
Asi jste si všimli, že i v České republice platí nařízení, podle kterého jsou pro archivaci v Národní digitálním archivu vyžadovány objekty ve formátu PDF/A úrovně 1a.
Existuje Usnesení vlády ČR ze dne 3. listopadu 2008 č. 1338, které podepsal ještě premiér Topolánek, kde se píše:
.............
I . s c h v a l u j e
jako výstupní datový formát statických dokumentů v digitální
podobě ze systémů spisové služby vykonávaných elektronickou
formou za použití výpočetní techniky a jako datový formát
statických dokumentů v digitální podobě připravovaných pro
předání do Národního digitálního archivu
1. formát PDF/A-1a (ISO 19005-1 – Portable Document Format
– Electronic document file format for long-term preservation)
pro statické textové, obrazové a kombinované
dokumenty v digitální podobě,
2. formáty PNG (ISO/IEC 15948:2004 – Portable Network
Graphics) a TIFF (Tagged Image File Format – revize 6
– nekomprimovaný) pro statické obrazové dokumenty v digitální
podobě;
--------------
Tohle je sice nařízení týkající se elektronických spisových služeb, ale v praxi má takové doporučení Národního archivu (mj. vyjádřené například také ve studii proveditelnosti NDA, ZD na NDA a jinde) dalekosáhlý dopad i na další projekty, knihovny, akademické instituce.
Odhlédněme teď od problému, že Usnesení vlády ani žádný další předpis pokud vím neříká, co vlastně je PDF/A 1a - jak ho poznáme - čili, jak technicky prokázat, že nějaký objekt je validní reprezentací PDF/A 1a. V tomhle bude jistě brzy jasněji, a online dostupný validátor PDF/A na webu NDA bude doplněn v polovině dalšího roku o validátor VeraPDF, kterýžto se v ideálním případě stane etalonem pro firmy produkující nástroje pro validaci, konverzi a produkci PDF.
Tím ale nejasnosti nekončí. Zásadní požadavky na PDF/A 1a jsou:
- dokument musí obsahovat fonty se znaky v unicode (resp. znaky musí mít mapování na unicode)
- dokument musí být "tagovaný", tj. musí obsahovat popis všech komponentů (průběžné hlavicky stránek, čísla stránek) a hlavně vyjádření logické struktury.
Zajímavý text na tohle téma na webu Ghostscriptu http://ghostscript.com/FAQ.html k tomu ale uvádí, že není v silách jakéhokoli obecného konvertoru PDF rozeznat v dokumentu poznámky pod čarou nebo nadpisy a korektně je označit, ba ani nemusí být schopen z dokumentu získat a vytvořit správnou logickou strukturu jednotlivých elementů, tak aby bylo zachováno autorem zamýšlené pořadí čtení.
A dál citují standard PDF, kde se píše:
"PDF/A-1 writers should not add
structural or semantic information that is not explicitly or implicitly
present in the source material solely for the purpose of achieving
conformance." ... "It is inadvisable for writers to generate
structural or semantic information using automated processes without
appropriate verification."
Jinými slovy, automaticky z PDF PDF/A 1a dělat nemáme. Podobně se standard PDF vyjadřuje k automatickému převodu/mapování znaků na unicode.
Co si z toho teď odnést?
- pokud máme velkou sbírku existujících PDF a chtěli bychom je ochránit, asi bychom se měli spokojit s PDF/A 1b
- pokud už dokument PDF tagovaný je (jak to poznáme - viz dole k VeraPDF) a je ve fontech mapovaných na unicode, asi je šance, že se nám podaří vytvořit honest PDF/A 1a. Do PDF/A -1a ale nemůžeme s klidným srdcem (automaticky a bez asistence tvůrce dokumentu) dostat nic, co neobsahuje tagování a mapování na unicode
- pokud nám nějaký nástroj poskytuje brute force konverzi do PDF/A 1a, měli bychom si být vědomi toho, že jde o "formální konverzi pro dosažení validace." Takový objekt projde validátory, ale je možné, že aby konverzí do PDF/A 1a prošel, bylo třeba něco oželet (některé znaky nemusí být ok, tak je prostě přeskočil), a struktura a tagování nevyjadřují - možná -záměry tvůrce dokumentu.
- formálně vytvořený PDF/A 1a zkrátka nezaručí to, co PDF/A 1a zaručit má
Jak tady může pomoci VeraPDF (díky Elišce)
VeraPDF lze pustit i na soubory, které nejsou PDF/A 1a, a lze tak zjistit, jak daleko od standardu soubory jsou. Z výstupu extrakce VeraPDF poznáme přesně, kde se objekt od standardu PDF/A 1a liší:
A podmínky jsou pak vidět na githubu v seznamu pravidel:
K tomu směřovala krátká debata na semináři k VeraPDF v Praze na Pasigu. Teoreticky by archiv mohl být spokojen i se "skoro PDF/A 1a." Vytvoří si vlastní validační profil, který bude méně přísný něž striktní PDF/A 1a, a bude přijímat i objekty se známými chybami - například ty, které nejsou v RGB, nebo jim pouze chybí deklarace shody s PDF/A 1a (https://github.com/veraPDF/veraPDF-validation-profiles/wiki/PDFA-Part-1-rules#rule-6711-3) i když jinak se s PDF/A 1a shodují....
pátek 6. května 2016
pondělí 15. února 2016
Rozdíly v identifikaci PDF mezi Fido a Siegfriedem
Kromě toho, že jsou problémy s validací PDF/A (neexistuje standardní validátor - komunitně vyvíjený VeraPDF je stále v beta verzi, běžně používaný Jhove neparsuje celé soubory a shodu s normou pro PDF/A neověřuje tedy plně) jsou rozdíly také v tom, jak jsou jednotlivé nástroje schopné identifikovat PDF/A.
Na souboru ca 12tis PDF souborů z univerzitního repozitáře jsem si vyzkoušel porovnat rozdíly mezi FIDO a novějším Siegfriedem. Bez ohledu na detaily, je trend celkem jasný - Fido identifikuje méně souborů jako PDF/A než Siegfried.
Ty nástroje používají stejný zdroj informací, PRONOM signatures, ale výsledky jsou jiné. Tady je sumarizace výstupu (PDF/A 1b = fmt/354, fmt/95 - PDF/A 1a).
Jak vypadají stejná data při validaci v Jhove? Jhove rozpozná 1551 souborů PDF/A 1b, jeden jediný jako 1a - viz tabulka dole:
Už na první pohled čísla úplně nesedí:
PDF/A 1B: FIDO 946, Siegfried 1197, Jhove 1551
PDF/A 1A: FIDO 1, Siegrfried 5, Jhove 1
Ad PDF/A 1A
Pokud jde o soubory, které některý z nástrojů identifikoval jako PDF/A 1A, tak ani u jednoho se všechny tří nástroje neshodnou.
- soubor, který je podle Jhove PDF/A 1A je podle FIDO jen fmt/18 a podle Siegfried PDF/A 1B. VeraPDF ma problémy s parsováním XMP a PDF/A 1B to podle VeraPDF není
- pět souborů, které identifikoval Siegfried jako PDF/A 1A, jsou podle FIDO fmt/18, čtyři z nich jsou podle Jhove PDF/A 1B, jeden má Jhove profil Linearized PDF, Tagged PDF.
- Dva z nich jsou podle VeraPDF validní PDF/A 1b, má ale problémy s fonty. I přesto jsou validní, vyprodukované na openoffice. Další tří jsou podle VeraPDF nevalidní nebo je nelze validovat.
Ad PDF/A 1B
Soubory, které byly Siegfriedem identifikovány jako PDF/A 1b (fmt/354) jsem zkusil validovat pomocí VeraPDF. Validace VeraPDF proběhla na 1124 souborů a pouze dva byly oznaceny jako validní reprezentace PDF/A 1B. Vzhledem k tomu, že VeraPDF je beta verze, řekněmě, že to není úplně jisté:-)
A sumarizace výstupu z Jhove:
Výsledek je tedy podobný jako u staršího souboru PDF z prvního testu. Za zmínku tady stoji těch 1500 souborů, které nejsou well formed nebo validní. 20% je na relativně nový soubor dat z roku 2015 docela dost.
PDF/A 1B: FIDO 339, Siegfried 408, Jhove 499
PDF/A 1A: FIDO 1, Siegrfried 79, Jhove 0
Ad PDF/A 1A
Jhove nenašel ani jeden PDF/A 1A soubor, zatímco Siegfried jich identifikoval 79 a FIDO jeden.
79 souborů identifikovaných jako PDF/A 1A budou ve většině případů soubory PDF/A 1b vytvořené jedním nejmenovaným komerčním nástrojem, který mají studenti online k dispozici, a který míchá Level A a Level B dohromady.
Ad PDF/A 1B
Pokud pro SF sečteme 79 identifikovaných PDF/A 1A a 408 identifikovaných PDF/A 1B, dostaneme mnohem rozumější čísla, shoda mezi Siegfriedem a Jhovem je tady mnohem větší než u prvního souboru dat. PDF/A 1B: FIDO 339, Siegfried 487, Jhove 499.
Pomocí VeraPDF jsem validoval 408 souborů identifikovaných jako PDF/A 1B Segfriedem, podle VeraPDF jich byla validní jedna desetina, přesně 42. Ze 79 falšených PDF/A bylo podle VeraPDF 76 validních reprezentaci PDF A 1B.
- FIDO je velmi opatrný v tom, co identifikuje jako PDF/A, rozdíl od Siegfriedu a Jhove je velký, někdy 1/3
- Jhove a Siegfried se víceméně shodnou v tom, co je PDF/A, ale už spolu nesouhlasí ohledně verze (Level A vs Level B). Problém ale pro tahle data způsobuje známý konvertor....
- Validace identifikovaných PDF/A pomocí VeraPDF potvrzuje jen část souborů, identifikovaných Siegfriedem (a Jhove) jako validní reprezentace PDF/A 1b.
- V prvním případě, v souboru dat vznikajících před rokem 2011, byly jako validní označeny jen 2 z více než 1100 souborů.
- Ve druhém případe bylo označeno VeraPDF za validní 42 ze 406 identifikovaných jako PDF/A 1b (fmt/354)
- Siegfried dále identifikoval 79 souborů jako PDF/A 1a, z nich 76 prošlo validací VeraPDF jako PDF/A 1b. Tady se Siegfried nechal splést, studenti vytvářeli tyto soubory online nástrojem, který jim univerzita poskytuje, a který míchá obě úrvoně PDF/A 1 dohromady.
Doplněk:
Kromě hlavních textů kvalifikačních prací jsem Siegfriedem identifikoval i soubory příloh (k pracím z roku 2015). Celkem ve 2500 souborech a archivech bylo ca 490tis objektů, se 160 jedinečnými PUIDy, a 60 mime type. 60 formátů (PUID) se vyskytovalo více než 100x. Trvalé uchování takových dat bude asi dost problém:-)
Část 1. První pokus FIDO vs SF, a porovnání výsledků s Jhove a VeraPDF
Na souboru ca 12tis PDF souborů z univerzitního repozitáře jsem si vyzkoušel porovnat rozdíly mezi FIDO a novějším Siegfriedem. Bez ohledu na detaily, je trend celkem jasný - Fido identifikuje méně souborů jako PDF/A než Siegfried.
Ty nástroje používají stejný zdroj informací, PRONOM signatures, ale výsledky jsou jiné. Tady je sumarizace výstupu (PDF/A 1b = fmt/354, fmt/95 - PDF/A 1a).
| fido | sf | |
| fmt/16 | 1001 | 1002 |
| fmt/17 | 3260 | 3258 |
| fmt/18 | 5530 | 5478 |
| fmt/19 | 1415 | 1406 |
| fmt/20 | 758 | 550 |
| fmt/354 | 946 | 1197 |
| fmt/276 | 81 | 81 |
| fmt/95 | 1 | 5 |
| 12992 | 12977 |
Jak vypadají stejná data při validaci v Jhove? Jhove rozpozná 1551 souborů PDF/A 1b, jeden jediný jako 1a - viz tabulka dole:
Verze
PDF
|
počet
|
Version: 1.3
|
3256
|
Version: 1.4
|
6410
|
Version: 1.5
|
1355
|
Version: 1.6
|
791
|
Version: 1.7
|
77
|
Version: 1.2
|
1002
|
Celkem
|
12891
|
Status
|
|
Status: Well-Formed and valid
|
11267
|
Status:
Well-Formed, but not valid
|
1067
|
Status: Not well-formed
|
697
|
Celkem
|
13031
|
Profile
|
|
Profile: ISO PDF/A-1, Level B
|
677
|
Profile: Linearized PDF
|
2513
|
Profile: Linearized PDF, ISO PDF/A-1, Level B
|
873
|
Profile:
Linearized PDF, Tagged PDF
|
69
|
Profile: Tagged PDF
|
10
|
Profile: Tagged PDF, ISO PDF/A-1, Level B
|
1
|
Profile: Tagged PDF, ISO PDF/A-1, Level B, ISO PDF/A-1, Level A
|
1
|
Celkem
|
4144
|
Už na první pohled čísla úplně nesedí:
PDF/A 1B: FIDO 946, Siegfried 1197, Jhove 1551
PDF/A 1A: FIDO 1, Siegrfried 5, Jhove 1
Ad PDF/A 1A
Pokud jde o soubory, které některý z nástrojů identifikoval jako PDF/A 1A, tak ani u jednoho se všechny tří nástroje neshodnou.
- soubor, který je podle Jhove PDF/A 1A je podle FIDO jen fmt/18 a podle Siegfried PDF/A 1B. VeraPDF ma problémy s parsováním XMP a PDF/A 1B to podle VeraPDF není
- pět souborů, které identifikoval Siegfried jako PDF/A 1A, jsou podle FIDO fmt/18, čtyři z nich jsou podle Jhove PDF/A 1B, jeden má Jhove profil Linearized PDF, Tagged PDF.
- Dva z nich jsou podle VeraPDF validní PDF/A 1b, má ale problémy s fonty. I přesto jsou validní, vyprodukované na openoffice. Další tří jsou podle VeraPDF nevalidní nebo je nelze validovat.
Ad PDF/A 1B
Soubory, které byly Siegfriedem identifikovány jako PDF/A 1b (fmt/354) jsem zkusil validovat pomocí VeraPDF. Validace VeraPDF proběhla na 1124 souborů a pouze dva byly oznaceny jako validní reprezentace PDF/A 1B. Vzhledem k tomu, že VeraPDF je beta verze, řekněmě, že to není úplně jisté:-)
Část 2. Druhý pokus FIDO vs FS, a porovnání výsledků s Jhove a VeraPDF
Zkusil jsem další balík dat, novější kvalifikační práce (2015), ca 7900 kusu PDF souborů prací. Výsledek je takový, že FIDO zcela jistě neidentifikuje PDF/A 1b a 1a spolehlivě. U PDF/A celkově za Level A a Level B selhává u ca 30%.
Pozn. Použil jsem defaultní nastavení bufferů FIDO. Je otázka, jestli zvětšení bufferů výsledky zlepší nebo ne.
| fido | sf | |
| fmt/16 | 0 | 0 |
| fmt/17 | 476 | 474 |
| fmt/18 | 1318 | 1178 |
| fmt/19 | 5457 | 5457 |
| fmt/20 | 167 | 167 |
| fmt/354 | 339 | 408 |
| fmt/276 | 158 | 151 |
| fmt/95 | 1 | 79 |
| 7916 | 7914 |
A sumarizace výstupu z Jhove:
format
|
|
Format: PDF
|
7919
|
Verze PDF
|
|
Version: 1.3
|
314
|
Version: 1.4
|
1628
|
Version: 1.5
|
5154
|
Version: 1.6
|
138
|
Version: 1.7
|
122
|
Version: 1.2
|
|
status
|
|
Status: Well-Formed and valid
|
6308
|
Status:
Well-Formed, but not valid
|
517
|
Status: Not well-formed
|
1094
|
profile
|
|
Profile: ISO PDF/A-1, Level B
|
211
|
Profile: Linearized PDF
|
163
|
Profile: Linearized PDF, ISO PDF/A-1, Level B
|
163
|
Profile:
Linearized PDF, Tagged PDF
|
5
|
Profile: Tagged PDF
|
48
|
Profile: Tagged PDF, ISO PDF/A-1, Level B
|
125
|
Profile: Tagged PDF, ISO PDF/A-1, Level B, ISO PDF/A-1, Level A
|
0
|
mime-type
|
|
MIMEtype: application/pdf
|
7919
|
Výsledek je tedy podobný jako u staršího souboru PDF z prvního testu. Za zmínku tady stoji těch 1500 souborů, které nejsou well formed nebo validní. 20% je na relativně nový soubor dat z roku 2015 docela dost.
PDF/A 1B: FIDO 339, Siegfried 408, Jhove 499
PDF/A 1A: FIDO 1, Siegrfried 79, Jhove 0
Ad PDF/A 1A
Jhove nenašel ani jeden PDF/A 1A soubor, zatímco Siegfried jich identifikoval 79 a FIDO jeden.
79 souborů identifikovaných jako PDF/A 1A budou ve většině případů soubory PDF/A 1b vytvořené jedním nejmenovaným komerčním nástrojem, který mají studenti online k dispozici, a který míchá Level A a Level B dohromady.
Ad PDF/A 1B
Pokud pro SF sečteme 79 identifikovaných PDF/A 1A a 408 identifikovaných PDF/A 1B, dostaneme mnohem rozumější čísla, shoda mezi Siegfriedem a Jhovem je tady mnohem větší než u prvního souboru dat. PDF/A 1B: FIDO 339, Siegfried 487, Jhove 499.
Pomocí VeraPDF jsem validoval 408 souborů identifikovaných jako PDF/A 1B Segfriedem, podle VeraPDF jich byla validní jedna desetina, přesně 42. Ze 79 falšených PDF/A bylo podle VeraPDF 76 validních reprezentaci PDF A 1B.
Závěr?
- v souborech (13tis souborů z kvalifikačních praci do roku 2011 a 7900 hlavních PDF kvalifikačních prací z roku 2015) skoro jistě není žadná validní reprezentace PDF/A - 1A- FIDO je velmi opatrný v tom, co identifikuje jako PDF/A, rozdíl od Siegfriedu a Jhove je velký, někdy 1/3
- Jhove a Siegfried se víceméně shodnou v tom, co je PDF/A, ale už spolu nesouhlasí ohledně verze (Level A vs Level B). Problém ale pro tahle data způsobuje známý konvertor....
- Validace identifikovaných PDF/A pomocí VeraPDF potvrzuje jen část souborů, identifikovaných Siegfriedem (a Jhove) jako validní reprezentace PDF/A 1b.
- V prvním případě, v souboru dat vznikajících před rokem 2011, byly jako validní označeny jen 2 z více než 1100 souborů.
- Ve druhém případe bylo označeno VeraPDF za validní 42 ze 406 identifikovaných jako PDF/A 1b (fmt/354)
- Siegfried dále identifikoval 79 souborů jako PDF/A 1a, z nich 76 prošlo validací VeraPDF jako PDF/A 1b. Tady se Siegfried nechal splést, studenti vytvářeli tyto soubory online nástrojem, který jim univerzita poskytuje, a který míchá obě úrvoně PDF/A 1 dohromady.
Doplněk:
Kromě hlavních textů kvalifikačních prací jsem Siegfriedem identifikoval i soubory příloh (k pracím z roku 2015). Celkem ve 2500 souborech a archivech bylo ca 490tis objektů, se 160 jedinečnými PUIDy, a 60 mime type. 60 formátů (PUID) se vyskytovalo více než 100x. Trvalé uchování takových dat bude asi dost problém:-)
pondělí 7. září 2015
When is a PDF not a PDF?
Několik zajímavých příspěvků ze semináře k PDF v kontextu dlouhodobé archivace, který pořádala DPC v červenci 2015.
Slidy jsou dostupné na:
http://preservationmatters.blogspot.cz/2015/09/preserving-documents-forever-when-is.html
Zvlášť prezentace pana Albertiniho je velmi zábavná, z jeho pohledu PDF opravdu nevypadá jako formát, na kterém bychom měli chtít stavět řešení pro trvalou ochranu digitálních informaci:
http://www.dpconline.org/component/docman/doc_download/1419-pdf-oxford-150715-pdf-myths-vs-facts-ange-albertini-
Slidy jsou dostupné na:
http://preservationmatters.blogspot.cz/2015/09/preserving-documents-forever-when-is.html
Zvlášť prezentace pana Albertiniho je velmi zábavná, z jeho pohledu PDF opravdu nevypadá jako formát, na kterém bychom měli chtít stavět řešení pro trvalou ochranu digitálních informaci:
http://www.dpconline.org/component/docman/doc_download/1419-pdf-oxford-150715-pdf-myths-vs-facts-ange-albertini-
úterý 11. srpna 2015
Proč je validace PDF/A důležitá i pokud žádná PDF/A nemáte
Johan van der Knijff z Královské knihovny Nizozemí publikoval další ze svých blogů. Johan se dlouhodobě zabývá obrazovými formáty JPEG 2000 a PDF. Je to zajímavé čtení, přibližující problémy, které se mohou skrývat (a často skrývají) v PDF souborech. Tyto problémy (encryption, hesla, externí odkazy, externí fonty) velmi ztěžují dlouhodobou ochranu obsahu těchto souborů.
Blog zároveň obsahuje linky na relevantní nástroje na validaci PDF/A.
http://blog.kbresearch.nl/2015/07/07/why-pdfa-validation-matters-even-if-you-dont-have-pdfa/
Blog zároveň obsahuje linky na relevantní nástroje na validaci PDF/A.
http://blog.kbresearch.nl/2015/07/07/why-pdfa-validation-matters-even-if-you-dont-have-pdfa/
pondělí 20. července 2015
Nový PDF/A validátor k dispozici (veraPDF)
Již jsme v minulosti zmiňovali projekt PREFORMA a snahu o vytvoření validátoru pro soubory ve formátu PDF. Nyní byla vydána první verze nástroje - ke stažení zde http://downloads.verapdf.org/rel/veraPDF-library-GUI-0.2.0.zip
Nástroj je schopen validovat PDF/A, tedy "oproti" ISO 19005. Verze, která je k dispozici není kompletní, nedoporučuje se používat v ostrém provozu, jde spíše o proof of concept v současné chvíli. Poznámky k vydání naleznete na https://github.com/veraPDF/ veraPDF-library/releases/ latest.
A konečně web nástroje - http://verapdf.org/
Nástroj je schopen validovat PDF/A, tedy "oproti" ISO 19005. Verze, která je k dispozici není kompletní, nedoporučuje se používat v ostrém provozu, jde spíše o proof of concept v současné chvíli. Poznámky k vydání naleznete na https://github.com/veraPDF/
A konečně web nástroje - http://verapdf.org/
pátek 29. května 2015
Preserving Documents Forever: When is a PDF not a PDF? Seminář 15.7. v Oxfordu
Už jsme psali tom, že projekt PREFORMA financovaný ze 7RP, vypsal tender na vytvoření nové sady volně dostupných validátorů nejběžnějších formátů (popis tenderu je na http://www.preforma-project.eu/call-description.html).
Projekt PREFORMA, DPC, OPF, a konzorcium VeraPDF, které v tendru uspělo v první fázi jako dodavatel validátoru PDF/A, pořádají seminář kde by měli prezentovat první výsledky. Kdyby někdo měl šanci se tam podívat, bude to určitě stát za návštěvu.
Projekt PREFORMA, DPC, OPF, a konzorcium VeraPDF, které v tendru uspělo v první fázi jako dodavatel validátoru PDF/A, pořádají seminář kde by měli prezentovat první výsledky. Kdyby někdo měl šanci se tam podívat, bude to určitě stát za návštěvu.
http://www.dpconline.org/events/details/95-preserving-pdfs-jul15?xref=124%3Apreservingpdfs-oxford
První výsledky jsou k dispozici na githubu https://github.com/veraPDF
Z textu pozvánky:
PDF is a ubiquitous format for publishing and sharing digital documents. It provides a useful tool for dissemination and because it is designed to ensure that the look and feel of documents does not change from one environment to the next it seems like a promising basis for the preservation of documents. But it also introduces a variety of preservation challenges for those working to preserve digital information for the long term. For example there are numerous tools to help create PDFs means many of which introduce their own subtle variations to the standard. Browsers have become increasingly tolerant of these eccentricities. That helps users in the short term but makes validation harder in the long run. How are organisations beginning to address these and other issues? What makes a PDF a PDF and how can repository managers tell the difference? And what can we do as a community to solve the PDF preservation problem? These are just some of the questions this briefing day will seek to answer.This briefing day will include an introduction to a new initiative that aims to tackle the complexities of PDF Preservation head on. The VeraPDF Consortium has been funded by the Preforma Project to develop a comprehensive PDF/A validation tool and policy checker. This will ultimately provide a definitive take on PDF/A compliance whilst also acting as a method of identifying PDF characteristics that pose a risk to long term preservation. Participants at the briefing day will have a chance to find out what VeraPDF plans to deliver. More importantly they will also have an opportunity to contribute to its design.The full programme is yet to be finalised but speakers will include Betsy Fanning, author of the DPC’s forthcoming 2nd edition Technology Watch Report ‘Preserving with PDF/a’, Johan van der Knijff from the National Library of the Netherlands, Carl Wilson from the Open Preservation Foundation and Ange Albertini from Google.
pondělí 16. února 2015
Zbavme se PDF, je tady RG?
Na několika fórech probíhá debata o článku, který vysvětluje, proč je PDF nevhodný formát pro publikaci výsledků vědecké práce:
http://www.theguardian.com/higher-education-network/2015/feb/11/researchers-its-time-to-ditch-the-pdf
Shrnu-li, článek říká, že PDF je formát nevhodný pro publikování proto, že neodpovídá tomu, jak dnes lidé na webu komunikují:
http://www.theguardian.com/higher-education-network/2015/feb/11/researchers-its-time-to-ditch-the-pdf
Shrnu-li, článek říká, že PDF je formát nevhodný pro publikování proto, že neodpovídá tomu, jak dnes lidé na webu komunikují:
- je to statický typ formátu, neumožňuje snadné komentování a sdílení. PDF vzniklo v pravěku internetu, kdy nebylo z bezpečnostních důvodů žádoucí, nechat čtenáře, aby s pisateli textů komunikovali přímo tak, aby se tato komunikace stala součástí dokumentu samotného. PDF umožňuje jen jednosměrnou komunikaci....
- dokumenty v PDF jsou nepřehledné, poznámky nebo ilustrace jsou někdo jinde, než je zrovna oko čtenáře, a tohle zdržuje a rozptyluje...
- protože PDF umožňuje jen jednosměrnou komunikaci a vylučuje kontextualizaci obsahu, přispívá PDF tomu, že většinu vědeckých článků čtou jen jejich autoři samotní, recenzenti a editoři.....
středa 23. července 2014
2014-09-01 Preserving PDF - identify, validate, repair
Zajímavá akce OPF týkající se PDF a PDF/A:
http://wiki.opf-labs.org/display/KB/2014-09-01+Preserving+PDF+-+identify%2C+validate%2C+repair
http://wiki.opf-labs.org/display/KB/2014-09-01+Preserving+PDF+-+identify%2C+validate%2C+repair
neděle 23. února 2014
Jaká rizika přináší PDF/A-3? Report NDSA
Americká organizace vydala před týdnem report, ve kterém se zabývá riziky, která může pro dlouhodobou ochranu dat představovat formát PDF/A-3 (ISO 19005-3:2012). Na blog postu http://blogs.loc.gov/digitalpreservation/2014/02/new-ndsa-report-the-benefits-and-risks-of-the-pdfa-3-file-format-for-archival-institutions/ se dočtete více o krátké historii a problémech, které komunita v PDF/A-3 vidí. Vlastní report, který je volně ke stažení zde http://www.digitalpreservation.gov/ndsa/working_groups/documents/NDSA_PDF_A3_report_final022014.pdf.
V čem je tedy problém? Poslední verze PDF/A, tedy PDF/A-3 má oproti PDF/A-2 (ISO 19005-2:2011) novou vlastnost, která může způsobit z pohledu dlouhodobé ochrany spoustu problémů. Zatímco PDF/A-2 umožňovalo zapouzdření souborů pouze pokud i tyto odpovídaly specifikaci PDF/A, tak nová verze PDF/A-3 umožňuje zapouzdření jakýchkoliv souborů do PDF/A-3 souboru. Mohou to tak být např. XML, CSV, CAD, obrazové, exe a jiné soubory, zapouzdřené do PDF/A.
Autoři vidí možnost využití a archivace PDF/A-3 vytvářených v kontrolovaném prostředí, ale rozhodně ne jako formátu pro příjem PDF/A souborů z různých zdrojů, nad kterými nemáte kontrolu. Více viz zpráva samotná.
V čem je tedy problém? Poslední verze PDF/A, tedy PDF/A-3 má oproti PDF/A-2 (ISO 19005-2:2011) novou vlastnost, která může způsobit z pohledu dlouhodobé ochrany spoustu problémů. Zatímco PDF/A-2 umožňovalo zapouzdření souborů pouze pokud i tyto odpovídaly specifikaci PDF/A, tak nová verze PDF/A-3 umožňuje zapouzdření jakýchkoliv souborů do PDF/A-3 souboru. Mohou to tak být např. XML, CSV, CAD, obrazové, exe a jiné soubory, zapouzdřené do PDF/A.
Autoři vidí možnost využití a archivace PDF/A-3 vytvářených v kontrolovaném prostředí, ale rozhodně ne jako formátu pro příjem PDF/A souborů z různých zdrojů, nad kterými nemáte kontrolu. Více viz zpráva samotná.
čtvrtek 14. listopadu 2013
Srovnání nástrojů na validaci a konverzi do PDF/A
Už po několikáté na stejné téma, tentokrát upozornění na dva zajímavé články z Florida digital archive.
V paperu, který prezentovali na iPresu, popisují testování tří komerčních nástrojů na migraci do pdf/a validaci (pdfaPilot, 3-Heights, PDF/A Manager)
https://fclaweb.fcla.edu/uploads/iPRES_PAPER86_Abstract.docx
Na stejné téma pak je krátký článek
https://share.fcla.edu/FDAPublic/Affiliates/FDA_PDF-A_validation_conversion.pdf
kde už popisují zapojení vybraného SW do svých workflow.
V paperu, který prezentovali na iPresu, popisují testování tří komerčních nástrojů na migraci do pdf/a validaci (pdfaPilot, 3-Heights, PDF/A Manager)
https://fclaweb.fcla.edu/uploads/iPRES_PAPER86_Abstract.docx
Na stejné téma pak je krátký článek
https://share.fcla.edu/FDAPublic/Affiliates/FDA_PDF-A_validation_conversion.pdf
kde už popisují zapojení vybraného SW do svých workflow.
pátek 26. července 2013
Rizika formátu PDF pro dlouhodobou ochranu: pokračování pokusů Johana van der Knijffa
Johan na svém blogu na openplanetsfoundation zveřejnil informace o další části svých pokusů s PDF. Tentokrát použil testovací data zveřejněná na Acrobat Engineering Website.
Testoval výkon Apache Preflight 2.0.0, Adobe Acrobat 10.14, Acrobat Preflight 10.1.3 (090)
Testoval dvě skupiny dat, která měla řadu riskantních vlastností (PDF cabinet of horrors:-) jako kryptování, nevložené fonty, multimediální obsah, javascript.
Ze závěrů asi stojí za to zmínit:
- Apache Preflight 2.0.0 neindentifikuje korektně kryptované soubory a soubory chráněné heslem
- při kontrole vložených fontů pomocí Apache Preflight považovat všechny chyby spojené s fonty za potenciální riziko
- multimediální obsah v PDF je pro Apache Preflight přiliš velké sousto - u většiny testovaných souborů nebyl schopen identifikovat specifické vlastnosti související s multimediálním obsahem, javascriptem, vloženými fonty. To by podle Johana nebyl velký problém, pokud bychom chtěli Apache Preflight používat pouze pro testování převoditelnosti PDF do PDF/A. Pokud bychom ale pomocí Apache Preflight chtěli hledat potenciální preservační rizika ve velmi heterogenní sbírce PDF, takt to problém bude.
Testoval výkon Apache Preflight 2.0.0, Adobe Acrobat 10.14, Acrobat Preflight 10.1.3 (090)
Testoval dvě skupiny dat, která měla řadu riskantních vlastností (PDF cabinet of horrors:-) jako kryptování, nevložené fonty, multimediální obsah, javascript.
Ze závěrů asi stojí za to zmínit:
- Apache Preflight 2.0.0 neindentifikuje korektně kryptované soubory a soubory chráněné heslem
- při kontrole vložených fontů pomocí Apache Preflight považovat všechny chyby spojené s fonty za potenciální riziko
- multimediální obsah v PDF je pro Apache Preflight přiliš velké sousto - u většiny testovaných souborů nebyl schopen identifikovat specifické vlastnosti související s multimediálním obsahem, javascriptem, vloženými fonty. To by podle Johana nebyl velký problém, pokud bychom chtěli Apache Preflight používat pouze pro testování převoditelnosti PDF do PDF/A. Pokud bychom ale pomocí Apache Preflight chtěli hledat potenciální preservační rizika ve velmi heterogenní sbírce PDF, takt to problém bude.
pátek 8. února 2013
Validace PDF/A: srovnání validátorů
V jedné konferenci proběhl odkaz na sice trochu starší, ale přesto velmi zajímavý dokument:
Bavaria Report on PDF/A Validation Accuracy
http://www.pdflib.com/fileadmin/pdflib/pdf/pdfa/2009-05-04-Bavaria-report-on-PDFA-validation-accuracy.pdf
Testované validátory:
Adobe Acrobat 9.0
Adobe Acrobat 9.1
Adobe LiveCycle PDF Generator
Apago PDF Appraiser
Callas pdfaPilot
Intarsys PDF/A Live
PDF Tools: 3Heights PDF Validator Shell
Seal Systems: PDF Longlife Suite/PDF Checker
Solid Documents: Solid Framework
Bavaria Report on PDF/A Validation Accuracy
http://www.pdflib.com/fileadmin/pdflib/pdf/pdfa/2009-05-04-Bavaria-report-on-PDFA-validation-accuracy.pdf
Testované validátory:
Adobe Acrobat 9.0
Adobe Acrobat 9.1
Adobe LiveCycle PDF Generator
Apago PDF Appraiser
Callas pdfaPilot
Intarsys PDF/A Live
PDF Tools: 3Heights PDF Validator Shell
Seal Systems: PDF Longlife Suite/PDF Checker
Solid Documents: Solid Framework
čtvrtek 3. ledna 2013
Rizika formátu PDF
Na blogu Open Planets Foundation se objevil zajímavý příspěvek Johana van der Knijffa z holandské Královské knihovny. Upozorňuje na svoji starší práci, kde identifikoval rizika formátu PDF pro dlouhodobou archivaci:
Adobe Portable Document Format, Inventory of long-term preservation risks:
http://www.openplanetsfoundation.org/system/files/PDFInventoryPreservationRisks_0_2_0.pdf
a shrnuje svoje zkušenosti z používáním knihovny Apache Preflight (součást PDFBox) při identifikaci preservačních rizik existující sbírky PDF dokumentů. Apache Preflight je knihovna určená k validaci PDF/A, ovšem Johan ji tady používá trochu jinak. Protože zdaleka ne všechny sbírky PDF dokumentů jsou migrovány podle požadavků standardu PDF/A, Johan se snaží použít Apache Preflight k identifikaci z hlediska dlouhodobé archivace nežádoucích vlastností nearchivních PDF. Netestuje tedy zda a jak Apache Preflight validuje PDF/A, ale testuje, zda je tahle knihovna vhodným nástrojem k identifikaci vlastností, které jsou v PDF/A zakázány.
Identification of preservation risks in PDF with Apache Preflight a first impression:
http://www.openplanetsfoundation.org/system/files/pdfProfilingJvdK19122012.pdf
Jeho závěry nejsou zatím pro Apache Preflight moc optimistické. Především, pokud Apache Preflight identifikuje nějaké odchylky od požadavků PDF/A-1b, zastaví často další zpracování dokumentu, a není tedy schopen dodat kompletní report. Mnohem spolehlivější jsou zatím nástroje Acrobatu, který byl v jeho testech schopen identifikovat všechny rizikové vlastnosti PDF souborů.
Snad se Apache Preflight archivní komunita ujme, a posune jeho vývoj a testování dál. Jinak bude třeba spoléhat pouze na komerční nástroje.
A ještě malé doplnění. Existuje také starší projekt vývoje Jhove ve stejném směru, tedy k ověření kompatibility PDF se specifikací PDF/A: https://github.com/blekinge/jhove-pdf-a
Adobe Portable Document Format, Inventory of long-term preservation risks:
http://www.openplanetsfoundation.org/system/files/PDFInventoryPreservationRisks_0_2_0.pdf
a shrnuje svoje zkušenosti z používáním knihovny Apache Preflight (součást PDFBox) při identifikaci preservačních rizik existující sbírky PDF dokumentů. Apache Preflight je knihovna určená k validaci PDF/A, ovšem Johan ji tady používá trochu jinak. Protože zdaleka ne všechny sbírky PDF dokumentů jsou migrovány podle požadavků standardu PDF/A, Johan se snaží použít Apache Preflight k identifikaci z hlediska dlouhodobé archivace nežádoucích vlastností nearchivních PDF. Netestuje tedy zda a jak Apache Preflight validuje PDF/A, ale testuje, zda je tahle knihovna vhodným nástrojem k identifikaci vlastností, které jsou v PDF/A zakázány.
Identification of preservation risks in PDF with Apache Preflight a first impression:
http://www.openplanetsfoundation.org/system/files/pdfProfilingJvdK19122012.pdf
Jeho závěry nejsou zatím pro Apache Preflight moc optimistické. Především, pokud Apache Preflight identifikuje nějaké odchylky od požadavků PDF/A-1b, zastaví často další zpracování dokumentu, a není tedy schopen dodat kompletní report. Mnohem spolehlivější jsou zatím nástroje Acrobatu, který byl v jeho testech schopen identifikovat všechny rizikové vlastnosti PDF souborů.
Snad se Apache Preflight archivní komunita ujme, a posune jeho vývoj a testování dál. Jinak bude třeba spoléhat pouze na komerční nástroje.
A ještě malé doplnění. Existuje také starší projekt vývoje Jhove ve stejném směru, tedy k ověření kompatibility PDF se specifikací PDF/A: https://github.com/blekinge/jhove-pdf-a
Přihlásit se k odběru:
Příspěvky (Atom)