Zobrazují se příspěvky se štítkemPDF/A. Zobrazit všechny příspěvky
Zobrazují se příspěvky se štítkemPDF/A. Zobrazit všechny příspěvky

středa 4. října 2017

Příspěvky z iPres2017

Příspěvky z iPresu 2017 v Japonsku jsou online (https://ipres2017.jp/programme/). Je tam docela hodně zajímavých textů. Na rozdíl od Pasigu tady jsou k dispozici full texty a některé články jsou i delší a techničtější.

Chtěl  bych upozornit na dva zabývající se PDF, ale ja tam řada dalších zajímavých:


Michelle Lindlar, Yvonne Tunnat and Carl Wilson. A Test-Set for Well-Formedness Validation in JHOVE – The Good, the Bad and the Ugly

Marco Klindt. A considered harmful for digital preservation 

úterý 24. ledna 2017

Diplomky na UK pouze digitálně

Univerzita Karlova se rozhodla pro archivaci závěrečných kvalifikačních prací (tedy bakalářek, diplomek i rigorózních a disertačních prací) pouze v elektronické podobě. Konkrétním vyjádřením tohoto rozhodnutí je Opatření rektora č. 23/2016, které možnost odevzdání textu omezuje pouze na formát PDF/A (verze 1a nebo 2u). Byla zpřísněna také pravidla pro odevzdávání příloh. Studentům je k dispozici seznam schválených formátů, které budou akceptovány automaticky, a možnost zažádat o přijetí přílohy v neschváleném formátu. Studenti jsou povinni odevzdávat PDF/A od 1. 2. 2016.
Opatření rektora doplňuje metodický pokyn a prozatímní informační stránka pro studenty.
Validace PDF/A bude probíhat pomocí nástroje veraPDF, formáty ostatních souborů budou pouze identifikovány pomocí nástroje Fido.
Otázka zrušení povinnosti odevzdávat i tištěnou verzi práce byla ponechána na rozhodnutí fakult. Je tedy možné, že tištěné verze budou i nadále zpřístupňovány v některých knihovnách.

pondělí 16. ledna 2017

Kdy vydá NDA xml profil pro validaci PDF/A?

V návaznosti na předešlou zprávu o publikaci verze 1.0 validátoru PDF/A veraPDF mě napadá, že by vlastně bylo logické, aby Národní archiv (resp. NDA) vydal xml profil pro validaci PDF/A podle jeho požadavků.

Legislativně deklarovaný požadavek na PDF/A-1a potřebuje doplnění a vysvětlení - je validní reprezentací PDF/A-1a takový soubor PDF/A, které neprojde validací PDF/A-2u nebo 3a? Validace úrovně 2u nebo 3a je podrobnější než validace podle profilu úrovně 1a (kontroluje se více pravidel)....


úterý 10. ledna 2017

veraPDF 1.0 je tu!

Konzorcium veraPDF dnes oznámilo uvolnění verze veraPDF 1.0. 
http://verapdf.org/2017/01/10/verapdf-1-0-released/?utm_source=veraPDF+News

veraPDF je PDF/A validátor, open source, vyvíjený v projektu Open Preservation Foundation a PDF Association, validuje všechny části a úrovně ISO 19005 (PDF/A). Je dostupný pod licencemi MPLv2+/GLPv3+.

Jak důležitý krok je to pro použitelnost PDF/A v archivech asi není třeba vysvětlovat, naše archivní legislativa o tom, jak se prokazuje shoda s ISO 19005, taktně mlčí. veraPDF dává archivům do ruky nástroj, který jim umožní posoudit shodu s touto normou nebo s vlastním profilem -  v případech, kdy je archiv připraven přijmout PDF/A nedovídající některým požadavkům zcela přesně.

čtvrtek 8. září 2016

Preforma Experience Workshop - 23.11.2016

Prakticky za rohem, v Berlíně, se v listopadu koná seminář o výsledcích projektu PREFORMA.

http://experienceworkshop.preforma-project.eu/programme/

PREFORMA je zdaleka nejzajímavější aktivita v oblasti dlouhodobé archivace v Evropě - formou PPP EU financovala vývoj tří nástrojů pro dlouhodobou archivaci, resp. pro conformance checking - VeraPDF, DPF Manager, MediaConch.

Na semináři by mělo jít především o zkušenosti s těmito nástroji, které dnes mají některé paměťové instituce. 

středa 29. června 2016

Máme vůbec chtít normalizovat PDF do PDF/A 1a?

Asi jste si všimli, že i v České republice platí nařízení, podle kterého jsou pro archivaci v Národní digitálním archivu vyžadovány objekty ve formátu PDF/A  úrovně 1a. 

Existuje Usnesení vlády ČR ze dne 3. listopadu 2008 č. 1338, které podepsal ještě premiér Topolánek, kde se píše: 
.............
I . s c h v a l u j e jako výstupní datový formát statických dokumentů v digitální podobě ze systémů spisové služby vykonávaných elektronickou formou za použití výpočetní techniky a jako datový formát statických dokumentů v digitální podobě připravovaných pro předání do Národního digitálního archivu 
1. formát PDF/A-1a (ISO 19005-1 – Portable Document Format – Electronic document file format for long-term preservation) pro statické textové, obrazové a kombinované dokumenty v digitální podobě, 

2. formáty PNG (ISO/IEC 15948:2004 – Portable Network Graphics) a TIFF (Tagged Image File Format – revize 6 – nekomprimovaný) pro statické obrazové dokumenty v digitální podobě;

--------------

Tohle je sice nařízení týkající se elektronických spisových služeb, ale v praxi má takové doporučení Národního archivu (mj. vyjádřené například také ve studii proveditelnosti NDA, ZD na NDA a jinde) dalekosáhlý dopad i na další projekty, knihovny, akademické instituce. 

Odhlédněme teď od problému, že Usnesení vlády ani žádný další předpis pokud vím neříká, co vlastně je PDF/A 1a - jak ho poznáme - čili, jak technicky prokázat, že nějaký objekt je validní reprezentací PDF/A 1a.  V tomhle bude jistě brzy jasněji, a online dostupný validátor PDF/A na webu NDA bude doplněn v polovině dalšího roku o validátor VeraPDF, kterýžto se v ideálním případě stane etalonem pro firmy produkující nástroje pro validaci, konverzi a produkci PDF. 

Tím ale nejasnosti nekončí. Zásadní požadavky na PDF/A 1a jsou:  
  • dokument musí obsahovat fonty se znaky v unicode (resp. znaky musí mít mapování na unicode) 
  • dokument musí být "tagovaný", tj. musí obsahovat popis všech komponentů (průběžné hlavicky stránek, čísla stránek) a hlavně vyjádření logické struktury. 
Zajímavý text na tohle téma na webu Ghostscriptu http://ghostscript.com/FAQ.html k tomu ale uvádí, že není v silách jakéhokoli obecného konvertoru PDF rozeznat v dokumentu poznámky pod čarou nebo nadpisy a korektně je označit, ba ani nemusí být schopen z dokumentu získat a vytvořit správnou logickou strukturu jednotlivých elementů, tak aby bylo zachováno autorem zamýšlené pořadí čtení.  
A dál citují standard PDF, kde se píše:
"PDF/A-1 writers should not add structural or semantic information that is not explicitly or implicitly present in the source material solely for the purpose of achieving conformance." ... "It is inadvisable for writers to generate structural or semantic information using automated processes without appropriate verification."
Jinými slovy, automaticky z PDF PDF/A 1a dělat nemáme. Podobně se standard PDF vyjadřuje k automatickému převodu/mapování znaků na unicode.

Co si z toho teď odnést? 
  • pokud máme velkou sbírku existujících PDF a chtěli bychom je ochránit, asi bychom se měli spokojit s PDF/A 1b
  • pokud už dokument PDF tagovaný je (jak to poznáme - viz dole k VeraPDF) a je ve fontech mapovaných na unicode, asi je šance, že se nám podaří vytvořit honest PDF/A 1a. Do PDF/A -1a ale nemůžeme s klidným srdcem (automaticky a bez asistence tvůrce dokumentu) dostat nic, co neobsahuje tagování a mapování na unicode
  • pokud nám nějaký nástroj poskytuje brute force konverzi do PDF/A 1a, měli bychom si být vědomi toho, že jde o "formální konverzi pro dosažení validace." Takový objekt projde validátory, ale je možné, že aby konverzí do PDF/A 1a prošel, bylo třeba něco oželet (některé znaky nemusí být ok, tak je prostě přeskočil), a struktura a tagování nevyjadřují - možná -záměry tvůrce dokumentu.
  • formálně vytvořený PDF/A 1a zkrátka nezaručí to, co PDF/A 1a zaručit má 
Komentář ve FAQ Ghostscriptu končí větou: For these reasons, at present we have no plans to implement PDF/A1-a in pdfwrite. Což je myslím docela výmluvné.

Jak tady může pomoci VeraPDF (díky Elišce) 
VeraPDF lze pustit i na soubory, které nejsou PDF/A 1a, a lze tak zjistit, jak daleko od standardu soubory jsou. Z výstupu extrakce VeraPDF poznáme přesně, kde se objekt od standardu PDF/A 1a liší:

A podmínky jsou pak vidět na githubu v seznamu pravidel:

K tomu směřovala krátká debata na semináři k VeraPDF v Praze na Pasigu. Teoreticky by archiv mohl být spokojen i se "skoro PDF/A 1a." Vytvoří si vlastní validační profil, který bude méně přísný něž striktní PDF/A 1a, a bude přijímat i objekty se známými chybami - například ty, které nejsou v RGB, nebo jim pouze chybí deklarace shody s PDF/A 1a (https://github.com/veraPDF/veraPDF-validation-profiles/wiki/PDFA-Part-1-rules#rule-6711-3) i když jinak se s PDF/A 1a shodují....

pondělí 15. února 2016

Rozdíly v identifikaci PDF mezi Fido a Siegfriedem

Kromě toho, že jsou problémy s validací PDF/A (neexistuje standardní validátor - komunitně vyvíjený VeraPDF je stále v beta verzi, běžně používaný Jhove neparsuje celé soubory a shodu s normou pro PDF/A neověřuje tedy plně) jsou rozdíly také v tom, jak jsou jednotlivé nástroje schopné identifikovat PDF/A.

Část 1. První pokus FIDO vs SF, a porovnání výsledků s Jhove a VeraPDF 


Na souboru ca 12tis PDF souborů z univerzitního repozitáře jsem si vyzkoušel porovnat rozdíly mezi FIDO a novějším Siegfriedem. Bez ohledu na detaily, je trend celkem jasný - Fido identifikuje méně souborů jako PDF/A než Siegfried.

Ty nástroje používají stejný zdroj informací, PRONOM signatures, ale výsledky jsou jiné.  Tady je sumarizace výstupu (PDF/A 1b = fmt/354, fmt/95 - PDF/A 1a).


fido sf
fmt/16 1001 1002
fmt/17 3260 3258
fmt/18 5530 5478
fmt/19 1415 1406
fmt/20 758 550
fmt/354 946 1197
fmt/276 81 81
fmt/95 1 5
12992 12977

Jak vypadají stejná data při validaci v Jhove? Jhove rozpozná 1551 souborů PDF/A 1b, jeden jediný jako 1a - viz tabulka dole:

Verze PDF
počet
  Version: 1.3
3256
  Version: 1.4
6410
  Version: 1.5
1355
  Version: 1.6
791
  Version: 1.7
77
  Version: 1.2
1002
Celkem
12891

Status
  Status: Well-Formed and valid
11267
  Status: Well-Formed, but not valid
1067
  Status: Not well-formed
697
Celkem
13031

Profile
  Profile: ISO PDF/A-1, Level B
677
  Profile: Linearized PDF
2513
  Profile: Linearized PDF, ISO PDF/A-1, Level B
873
  Profile: Linearized PDF, Tagged PDF
69
  Profile: Tagged PDF
10
  Profile: Tagged PDF, ISO PDF/A-1, Level B
1
  Profile: Tagged PDF, ISO PDF/A-1, Level B, ISO PDF/A-1, Level A
1
Celkem
4144



Už na první pohled čísla úplně nesedí:
PDF/A 1B:  FIDO 946, Siegfried 1197, Jhove 1551
PDF/A 1A: FIDO 1, Siegrfried 5, Jhove 1

Ad PDF/A 1A
Pokud jde o soubory, které některý z nástrojů identifikoval jako PDF/A 1A, tak ani u jednoho se všechny tří nástroje neshodnou.
- soubor, který je podle Jhove PDF/A 1A je podle FIDO jen fmt/18 a podle Siegfried PDF/A 1B. VeraPDF ma problémy s parsováním XMP a  PDF/A 1B to podle VeraPDF není
- pět souborů, které identifikoval Siegfried jako PDF/A 1A, jsou podle FIDO fmt/18, čtyři z nich jsou podle Jhove PDF/A 1B, jeden má Jhove profil Linearized PDF, Tagged PDF.
- Dva z nich jsou podle VeraPDF validní PDF/A 1b, má ale problémy s fonty. I přesto jsou validní, vyprodukované na openoffice. Další tří jsou podle VeraPDF nevalidní nebo je nelze validovat.

Ad PDF/A 1B
Soubory, které byly Siegfriedem identifikovány jako PDF/A 1b (fmt/354) jsem zkusil validovat pomocí VeraPDF. Validace VeraPDF proběhla na 1124 souborů a pouze dva byly oznaceny jako validní reprezentace PDF/A 1B. Vzhledem k tomu, že VeraPDF je beta verze, řekněmě, že to není úplně jisté:-)

Část 2. Druhý pokus  FIDO vs FS, a porovnání výsledků s Jhove a VeraPDF 


Zkusil jsem další balík dat, novější kvalifikační práce (2015), ca 7900 kusu PDF souborů prací. Výsledek je takový, že FIDO zcela jistě neidentifikuje PDF/A 1b a 1a spolehlivě. U PDF/A celkově za Level A a Level B selhává u ca 30%. 

Pozn. Použil jsem defaultní nastavení bufferů FIDO. Je otázka, jestli zvětšení bufferů výsledky zlepší nebo ne. 

fido sf
fmt/16 0 0
fmt/17 476 474
fmt/18 1318 1178
fmt/19 5457 5457
fmt/20 167 167
fmt/354 339 408
fmt/276 158 151
fmt/95 1 79
7916 7914

A sumarizace výstupu z Jhove:

format
  Format: PDF
7919
Verze PDF
  Version: 1.3
314
  Version: 1.4
1628
  Version: 1.5
5154
  Version: 1.6
138
  Version: 1.7
122
  Version: 1.2
status
  Status: Well-Formed and valid
6308
  Status: Well-Formed, but not valid
517
  Status: Not well-formed
1094
 profile
  Profile: ISO PDF/A-1, Level B
211
  Profile: Linearized PDF
163
  Profile: Linearized PDF, ISO PDF/A-1, Level B
163
  Profile: Linearized PDF, Tagged PDF
5
  Profile: Tagged PDF
48
  Profile: Tagged PDF, ISO PDF/A-1, Level B
125
  Profile: Tagged PDF, ISO PDF/A-1, Level B, ISO PDF/A-1, Level A
0
mime-type
  MIMEtype: application/pdf
7919
































Výsledek je tedy podobný  jako u staršího souboru PDF z prvního testu. Za zmínku tady stoji těch 1500 souborů, které nejsou well formed nebo validní. 20% je na relativně nový soubor dat z roku 2015 docela dost.

PDF/A 1B:  FIDO 339, Siegfried 408, Jhove 499
PDF/A 1A: FIDO 1, Siegrfried 79, Jhove 0

Ad PDF/A 1A
Jhove nenašel ani jeden PDF/A 1A soubor, zatímco Siegfried jich identifikoval 79 a FIDO jeden.
79 souborů identifikovaných jako PDF/A 1A budou ve většině případů soubory PDF/A 1b vytvořené jedním nejmenovaným komerčním nástrojem, který mají studenti online k dispozici, a který míchá Level A a Level B dohromady.

Ad PDF/A 1B
Pokud pro SF sečteme 79 identifikovaných  PDF/A  1A a 408 identifikovaných PDF/A 1B, dostaneme mnohem rozumější čísla, shoda mezi Siegfriedem a Jhovem je tady mnohem větší než u prvního souboru dat. PDF/A 1B:  FIDO 339, Siegfried 487, Jhove 499.

Pomocí VeraPDF jsem validoval 408 souborů identifikovaných jako PDF/A 1B Segfriedem, podle VeraPDF jich byla validní jedna desetina, přesně 42. Ze 79 falšených PDF/A bylo podle VeraPDF 76 validních reprezentaci PDF A 1B.

Závěr? 

- v souborech (13tis souborů z kvalifikačních praci do roku 2011 a 7900 hlavních PDF kvalifikačních prací z roku 2015) skoro jistě není žadná validní reprezentace PDF/A - 1A
- FIDO je velmi opatrný v tom, co identifikuje jako PDF/A, rozdíl od Siegfriedu a Jhove je velký, někdy 1/3
- Jhove a Siegfried se víceméně shodnou v tom, co je PDF/A, ale už spolu nesouhlasí ohledně verze (Level A vs Level B). Problém ale pro tahle data způsobuje známý konvertor....
- Validace identifikovaných PDF/A pomocí VeraPDF potvrzuje jen část souborů, identifikovaných Siegfriedem (a Jhove) jako validní reprezentace PDF/A 1b.
- V prvním případě, v souboru dat vznikajících před rokem 2011, byly jako validní označeny jen 2 z více než 1100 souborů.
- Ve druhém případe bylo označeno VeraPDF za validní 42 ze 406 identifikovaných jako PDF/A 1b (fmt/354)
- Siegfried dále identifikoval 79 souborů jako PDF/A 1a, z nich 76 prošlo validací VeraPDF jako PDF/A 1b.  Tady se Siegfried nechal splést, studenti vytvářeli tyto soubory online nástrojem, který jim univerzita poskytuje, a který míchá obě úrvoně PDF/A 1 dohromady.



Doplněk:
Kromě hlavních textů kvalifikačních prací jsem Siegfriedem identifikoval i soubory příloh (k pracím z roku 2015). Celkem ve 2500 souborech a archivech bylo ca 490tis objektů, se 160 jedinečnými PUIDy, a 60 mime type. 60 formátů (PUID) se vyskytovalo více než 100x. Trvalé uchování takových dat bude asi dost problém:-)

pondělí 7. září 2015

When is a PDF not a PDF?

Několik zajímavých příspěvků ze semináře k PDF v kontextu dlouhodobé archivace, který pořádala DPC v červenci 2015.

Slidy jsou dostupné na:
http://preservationmatters.blogspot.cz/2015/09/preserving-documents-forever-when-is.html

Zvlášť prezentace pana Albertiniho je velmi zábavná, z jeho pohledu PDF opravdu nevypadá jako formát, na kterém bychom měli chtít stavět řešení pro trvalou ochranu digitálních informaci:
http://www.dpconline.org/component/docman/doc_download/1419-pdf-oxford-150715-pdf-myths-vs-facts-ange-albertini-

úterý 11. srpna 2015

Proč je validace PDF/A důležitá i pokud žádná PDF/A nemáte

Johan van der Knijff z Královské knihovny Nizozemí publikoval další ze svých blogů. Johan se dlouhodobě zabývá obrazovými formáty JPEG 2000 a PDF. Je to zajímavé čtení, přibližující problémy, které se mohou skrývat (a často skrývají) v PDF souborech. Tyto problémy (encryption, hesla, externí odkazy, externí fonty) velmi ztěžují dlouhodobou ochranu obsahu těchto souborů.
Blog zároveň obsahuje linky na relevantní nástroje na validaci PDF/A.
http://blog.kbresearch.nl/2015/07/07/why-pdfa-validation-matters-even-if-you-dont-have-pdfa/

pondělí 20. července 2015

Nový PDF/A validátor k dispozici (veraPDF)

Již jsme v minulosti zmiňovali projekt PREFORMA a snahu o vytvoření validátoru pro soubory ve formátu PDF. Nyní byla vydána první verze nástroje - ke stažení zde http://downloads.verapdf.org/rel/veraPDF-library-GUI-0.2.0.zip
Nástroj je schopen validovat PDF/A, tedy "oproti" ISO 19005. Verze, která je k dispozici není kompletní, nedoporučuje se používat v ostrém provozu, jde spíše o proof of concept v současné chvíli. Poznámky k vydání naleznete na https://github.com/veraPDF/veraPDF-library/releases/latest.
A konečně web nástroje - http://verapdf.org/

pátek 29. května 2015

Preserving Documents Forever: When is a PDF not a PDF? Seminář 15.7. v Oxfordu

Už jsme psali tom, že projekt PREFORMA financovaný ze 7RP, vypsal tender na vytvoření nové sady volně dostupných validátorů nejběžnějších formátů (popis tenderu je na http://www.preforma-project.eu/call-description.html).

Projekt PREFORMA, DPC, OPF, a konzorcium VeraPDF, které v tendru uspělo v první fázi jako dodavatel validátoru PDF/A, pořádají seminář kde by měli prezentovat první výsledky. Kdyby někdo měl šanci se tam podívat, bude to určitě stát za návštěvu.

http://www.dpconline.org/events/details/95-preserving-pdfs-jul15?xref=124%3Apreservingpdfs-oxford

První výsledky jsou k dispozici na githubu https://github.com/veraPDF

Z textu pozvánky: 

PDF is a ubiquitous format for publishing and sharing digital documents. It provides a useful tool for dissemination and because it is designed to ensure that the look and feel of documents does not change from one environment to the next it seems like a promising basis for the preservation of documents. But it also introduces a variety of preservation challenges for those working to preserve digital information for the long term. For example there are numerous tools to help create PDFs means many of which introduce their own subtle variations to the standard. Browsers have become increasingly tolerant of these eccentricities. That helps users in the short term but makes validation harder in the long run. How are organisations beginning to address these and other issues? What makes a PDF a PDF and how can repository managers tell the difference? And what can we do as a community to solve the PDF preservation problem? These are just some of the questions this briefing day will seek to answer.This briefing day will include an introduction to a new initiative that aims to tackle the complexities of PDF Preservation head on. The VeraPDF Consortium has been funded by the Preforma Project to develop a comprehensive PDF/A validation tool and policy checker. This will ultimately provide a definitive take on PDF/A compliance whilst also acting as a method of identifying PDF characteristics that pose a risk to long term preservation. Participants at the briefing day will have a chance to find out what VeraPDF plans to deliver. More importantly they will also have an opportunity to contribute to its design.The full programme is yet to be finalised but speakers will include Betsy Fanning, author of the DPC’s forthcoming 2nd edition Technology Watch Report ‘Preserving with PDF/a’, Johan van der Knijff from the National Library of the Netherlands, Carl Wilson from the Open Preservation Foundation and Ange Albertini from Google.

pondělí 16. února 2015

Zbavme se PDF, je tady RG?

Na několika fórech probíhá debata o článku, který vysvětluje, proč je PDF nevhodný formát pro publikaci výsledků vědecké práce:
http://www.theguardian.com/higher-education-network/2015/feb/11/researchers-its-time-to-ditch-the-pdf

Shrnu-li, článek říká, že PDF je formát nevhodný pro publikování proto, že neodpovídá tomu, jak dnes lidé na webu komunikují:
  • je to statický typ formátu, neumožňuje snadné komentování a sdílení. PDF vzniklo v pravěku internetu, kdy nebylo z bezpečnostních důvodů žádoucí, nechat čtenáře, aby s pisateli textů komunikovali přímo tak, aby se tato komunikace stala součástí dokumentu samotného. PDF umožňuje jen jednosměrnou komunikaci....
  • dokumenty v PDF jsou nepřehledné, poznámky nebo ilustrace jsou někdo jinde, než je zrovna oko čtenáře, a tohle zdržuje a rozptyluje...
  • protože PDF umožňuje jen jednosměrnou komunikaci a vylučuje kontextualizaci obsahu, přispívá PDF tomu, že většinu vědeckých článků čtou jen jejich autoři samotní, recenzenti a editoři.....
Organizace spoluzaložená autorem článku Ijadem Madischem (http://www.researchgate.net/) proto navrhla formát RG: https://explore.researchgate.net/display/news/2015/02/12/Introducing+the+RG+Format

neděle 23. února 2014

Jaká rizika přináší PDF/A-3? Report NDSA

Americká organizace vydala před týdnem report, ve kterém se zabývá riziky, která může pro dlouhodobou ochranu dat představovat formát PDF/A-3  (ISO 19005-3:2012). Na blog postu http://blogs.loc.gov/digitalpreservation/2014/02/new-ndsa-report-the-benefits-and-risks-of-the-pdfa-3-file-format-for-archival-institutions/ se dočtete více o krátké historii a problémech, které komunita v PDF/A-3 vidí. Vlastní report, který je volně ke stažení zde http://www.digitalpreservation.gov/ndsa/working_groups/documents/NDSA_PDF_A3_report_final022014.pdf.
V čem je tedy problém? Poslední verze PDF/A, tedy PDF/A-3 má oproti PDF/A-2 (ISO 19005-2:2011) novou vlastnost, která může způsobit z pohledu dlouhodobé ochrany spoustu problémů. Zatímco PDF/A-2 umožňovalo zapouzdření souborů pouze pokud i tyto odpovídaly specifikaci PDF/A, tak nová verze PDF/A-3 umožňuje zapouzdření jakýchkoliv souborů do PDF/A-3 souboru. Mohou to tak být např. XML, CSV, CAD, obrazové, exe a jiné soubory, zapouzdřené do PDF/A.
Autoři vidí možnost využití a archivace PDF/A-3 vytvářených v kontrolovaném prostředí, ale rozhodně ne jako formátu pro příjem PDF/A souborů z různých zdrojů, nad kterými nemáte kontrolu. Více viz zpráva samotná.


čtvrtek 14. listopadu 2013

Srovnání nástrojů na validaci a konverzi do PDF/A

Už po několikáté na stejné téma, tentokrát upozornění na dva zajímavé články z Florida digital archive.

V paperu, který prezentovali na iPresu, popisují testování tří komerčních nástrojů na migraci do pdf/a validaci (pdfaPilot, 3-Heights, PDF/A Manager)
https://fclaweb.fcla.edu/uploads/iPRES_PAPER86_Abstract.docx

Na stejné téma pak je krátký článek
https://share.fcla.edu/FDAPublic/Affiliates/FDA_PDF-A_validation_conversion.pdf
kde už popisují zapojení vybraného SW do svých workflow.




pátek 26. července 2013

Rizika formátu PDF pro dlouhodobou ochranu: pokračování pokusů Johana van der Knijffa

Johan na svém blogu na openplanetsfoundation zveřejnil informace o další části svých pokusů s PDF. Tentokrát použil testovací data zveřejněná na Acrobat Engineering Website.

Testoval výkon Apache Preflight 2.0.0, Adobe Acrobat 10.14, Acrobat Preflight 10.1.3 (090)

Testoval dvě skupiny dat, která měla řadu riskantních vlastností (PDF cabinet of horrors:-) jako kryptování, nevložené fonty, multimediální obsah, javascript.

Ze závěrů asi stojí za to zmínit:
- Apache Preflight 2.0.0 neindentifikuje korektně kryptované soubory a soubory chráněné heslem
- při kontrole vložených fontů pomocí Apache Preflight považovat všechny chyby spojené s fonty za potenciální riziko
- multimediální obsah v PDF je pro Apache Preflight přiliš velké sousto - u většiny testovaných souborů nebyl schopen identifikovat specifické vlastnosti související s multimediálním obsahem, javascriptem, vloženými fonty. To by podle Johana nebyl velký problém, pokud bychom chtěli Apache Preflight používat pouze pro testování převoditelnosti PDF do PDF/A. Pokud bychom ale pomocí Apache Preflight chtěli hledat potenciální preservační rizika ve velmi heterogenní sbírce PDF, takt to problém bude.

pátek 8. února 2013

Validace PDF/A: srovnání validátorů

V jedné konferenci proběhl odkaz na sice trochu starší, ale přesto velmi zajímavý dokument:
Bavaria Report on PDF/A Validation Accuracy
http://www.pdflib.com/fileadmin/pdflib/pdf/pdfa/2009-05-04-Bavaria-report-on-PDFA-validation-accuracy.pdf

Testované validátory:
Adobe Acrobat 9.0
Adobe Acrobat 9.1
Adobe LiveCycle PDF Generator
Apago PDF Appraiser
Callas pdfaPilot
Intarsys PDF/A Live
PDF Tools: 3Heights PDF Validator Shell
Seal Systems: PDF Longlife Suite/PDF Checker
Solid Documents: Solid Framework

čtvrtek 3. ledna 2013

Rizika formátu PDF

Na blogu Open Planets Foundation se objevil zajímavý příspěvek Johana van der Knijffa z holandské Královské knihovny. Upozorňuje na svoji starší práci, kde identifikoval rizika formátu PDF pro dlouhodobou archivaci:

Adobe Portable Document Format, Inventory of long-term preservation risks:
http://www.openplanetsfoundation.org/system/files/PDFInventoryPreservationRisks_0_2_0.pdf

a shrnuje svoje zkušenosti z používáním knihovny Apache Preflight (součást PDFBox) při identifikaci preservačních rizik existující sbírky PDF dokumentů. Apache Preflight je knihovna určená k validaci PDF/A, ovšem Johan ji tady používá trochu jinak. Protože zdaleka ne všechny sbírky PDF dokumentů jsou migrovány podle požadavků standardu PDF/A, Johan se snaží použít Apache Preflight k identifikaci z hlediska dlouhodobé archivace nežádoucích vlastností nearchivních PDF. Netestuje tedy zda a jak Apache Preflight validuje PDF/A, ale testuje, zda je tahle knihovna vhodným nástrojem k identifikaci vlastností, které jsou v PDF/A zakázány.

Identification of preservation risks in PDF with Apache Preflight a first impression:
http://www.openplanetsfoundation.org/system/files/pdfProfilingJvdK19122012.pdf

Jeho závěry nejsou zatím pro Apache Preflight moc optimistické. Především, pokud Apache Preflight identifikuje nějaké odchylky od požadavků PDF/A-1b, zastaví často další zpracování dokumentu, a není tedy schopen dodat kompletní report. Mnohem spolehlivější jsou zatím nástroje Acrobatu, který byl v jeho testech schopen identifikovat všechny rizikové vlastnosti PDF souborů.

Snad se Apache Preflight archivní komunita ujme, a posune jeho vývoj a testování dál. Jinak bude třeba spoléhat pouze na komerční nástroje.

A ještě malé doplnění. Existuje také starší projekt vývoje Jhove ve stejném směru, tedy k ověření kompatibility PDF se specifikací PDF/A:  https://github.com/blekinge/jhove-pdf-a