使用POI轉換word doc文件

使用POI轉換word doc文件

目錄

1       轉換爲Html文件

2       轉換爲Xml文件

3       轉換爲Text文件

 

       POI中還存在有針對於word doc文件進行格式轉換的功能。我們可以將word的內容轉換爲對應的Html文件,也可以把它轉換爲底層用來描述doc文檔的xml文件,還可以把它轉換爲底層用來描述doc文檔的xml格式的text文件。這些格式轉換都是通過AbstractWordConverter特定的子類來完成的。

 

1       轉換爲Html文件

       doc文檔轉換爲對應的Html文檔是通過WordToHtmlConverter類進行的。它會盡量的利用Html的方式來呈現原文檔的樣式。示例代碼:

   /**
    * Word轉換爲Html
    * @throws Exception
    */
   @Test
   public void testWordToHtml() throws Exception {
      InputStream is = new FileInputStream("D:\\test.doc");
      HWPFDocument wordDocument = new HWPFDocument(is);
      WordToHtmlConverter converter = new WordToHtmlConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
      //對HWPFDocument進行轉換
      converter.processDocument(wordDocument);
        Writer writer = new FileWriter(new File("D:\\converter.html"));
       Transformer transformer = TransformerFactory.newInstance().newTransformer();
       transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
       //是否添加空格
        transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
       transformer.setOutputProperty( OutputKeys.METHOD, "html" );
       transformer.transform(
                   new DOMSource(converter.getDocument() ),
                   new StreamResult( writer ) );
   }

2       轉換爲Xml文件

       doc文檔轉換爲對應的Xml文件是通過WordToFoConverter類進行的。它可以把doc文檔轉換爲底層用來描述doc文檔的Xml文檔。示例代碼:

   /**
    * Word轉Fo
    * @throws Exception
    */
   @Test
   public void testWordToFo() throws Exception {
      InputStream is = new FileInputStream("D:\\test.doc");
      HWPFDocument wordDocument = new HWPFDocument(is);
      WordToFoConverter converter = new WordToFoConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
      //對HWPFDocument進行轉換
      converter.processDocument(wordDocument);
        Writer writer = new FileWriter(new File("D:\\converter.xml"));
       Transformer transformer = TransformerFactory.newInstance().newTransformer();
       transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
       //是否添加空格
        transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
//     transformer.setOutputProperty( OutputKeys.METHOD, "html" );
       transformer.transform(
                   new DOMSource(converter.getDocument() ),
                   new StreamResult( writer ) );
   }
 

 

3       轉換爲Text文件

       doc文檔轉換爲text文檔是通過WordToTextConverter來進行的。它可以把doc文檔轉換爲底層用於描述doc文檔的Xml格式的text文檔。示例代碼:

   /**
    * Word轉換爲Text
    * @throws Exception
    */
   @Test
   public void testWordToText() throws Exception {
      InputStream is = new FileInputStream("D:\\test.doc");
      HWPFDocument wordDocument = new HWPFDocument(is);
      WordToTextConverter converter = new WordToTextConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
      //對HWPFDocument進行轉換
      converter.processDocument(wordDocument);
        Writer writer = new FileWriter(new File("D:\\converter.txt"));
       Transformer transformer = TransformerFactory.newInstance().newTransformer();
       transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
       //是否添加空格
        transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
       transformer.setOutputProperty( OutputKeys.METHOD, "text" );
       transformer.transform(
                   new DOMSource(converter.getDocument() ),
                   new StreamResult( writer ) );
   }

 

 

 (注:本文是基於poi3.9所寫)

發表評論
所有評論
還沒有人評論,想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.
相關文章