POI读写大数据量excel，解决超过几万行而导致内存溢出的问题

Posted 2020-10-21 牧梦者

tags:

篇首语：本文由小常识网(cha138.com)小编为大家整理，主要介绍了POI读写大数据量excel，解决超过几万行而导致内存溢出的问题相关的知识，希望对你有一定的参考价值。

1. Excel2003与Excel2007

两个版本的最大行数和列数不同，2003版最大行数是65536行，最大列数是256列，2007版及以后的版本最大行数是1048576行，最大列数是16384列。

excel2003是以二进制的方式存储，这种格式不易被其他软件读取使用；而excel2007采用了基于XML的ooxml开放文档标准，ooxml使用XML和ZIP技术结合进行文件存储，XML是一个基于文本的格式，而且ZIP容器支持内容的压缩，所以其一大优势是可以大大减小文件的尺寸。

2. 大批量数据读写

2.1 大批量数据写入

对于大数据的Xlsx文件的写入，POI3.8提供了SXSSFSXSSFWorkbook类，采用缓存方式进行大批量写文件。

详情可以查看poi官网示例：http://poi.apache.org/spreadsheet/how-to.html#sxssf 或 http://blog.csdn.net/daiyutage/article/details/53010491

2.2 大批量数据读取

POI读取Excel有两种模式，一种是用户模式，一种是SAX事件驱动模式，将xlsx格式的文档转换成CSV格式后进行读取。用户模式API接口丰富，使用POI的API可以很容易读取Excel，但用户模式消耗的内存很大，当遇到很大sheet、大数据网格，假空行、公式等问题时，很容易导致内存溢出。POI官方推荐解决内存溢出的方式使用CVS格式解析，即SAX事件驱动模式。下面主要是讲解如何读取大批量数据：

2.2.1 pom.xml所需jar包

 1 <project xmlns="http://maven.apache.org/POM/4.0.0" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
 2   xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/maven-v4_0_0.xsd">
 3   <modelVersion>4.0.0</modelVersion>
 4   <groupId>POIExcel</groupId>
 5   <artifactId>POIExcel</artifactId>
 6   <packaging>war</packaging>
 7   <version>1.0-SNAPSHOT</version>
 8   <name>POIExcel Maven Webapp</name>
 9   <url>http://maven.apache.org</url>
10   <dependencies>
11     <dependency>
12       <groupId>junit</groupId>
13       <artifactId>junit</artifactId>
14       <version>3.8.1</version>
15       <scope>test</scope>
16     </dependency>
17 
18     <dependency>
19       <groupId>org.apache.poi</groupId>
20       <artifactId>poi</artifactId>
21       <version>3.17</version>
22     </dependency>
23 
24     <dependency>
25       <groupId>org.apache.poi</groupId>
26       <artifactId>poi-ooxml</artifactId>
27       <version>3.17</version>
28     </dependency>
29 
30     <dependency>
31       <groupId>org.apache.poi</groupId>
32       <artifactId>poi-ooxml-schemas</artifactId>
33       <version>3.17</version>
34     </dependency>
35 
36     <dependency>
37       <groupId>com.syncthemall</groupId>
38       <artifactId>boilerpipe</artifactId>
39       <version>1.2.1</version>
40     </dependency>
41 
42     <dependency>
43       <groupId>xerces</groupId>
44       <artifactId>xercesImpl</artifactId>
45       <version>2.11.0</version>
46     </dependency>
47 
48     <dependency>
49       <groupId>xml-apis</groupId>
50       <artifactId>xml-apis</artifactId>
51       <version>1.4.01</version>
52     </dependency>
53 
54     <dependency>
55       <groupId>org.apache.xmlbeans</groupId>
56       <artifactId>xmlbeans</artifactId>
57       <version>2.6.0</version>
58     </dependency>
59 
60     <dependency>
61       <groupId>sax</groupId>
62       <artifactId>sax</artifactId>
63       <version>2.0.1</version>
64     </dependency>
65 
66     <dependency>
67       <groupId>org.apache.commons</groupId>
68       <artifactId>commons-lang3</artifactId>
69       <version>3.7</version>
70     </dependency>
71 
72   </dependencies>
73   <build>
74     <finalName>POIExcel</finalName>
75   </build>
76 </project>

2.2.2 POI以SAX解析excel2007文件

解决思路：通过继承DefaultHandler类，重写process()，startElement()，characters()，endElement()这四个方法。process()方式主要是遍历所有的sheet，并依次调用startElement()、characters()方法、endElement()这三个方法。startElement()用于设定单元格的数字类型（如日期、数字、字符串等等）。characters()用于获取该单元格对应的索引值或是内容值（如果单元格类型是字符串、INLINESTR、数字、日期则获取的是索引值；其他如布尔值、错误、公式则获取的是内容值）。endElement()根据startElement()的单元格数字类型和characters()的索引值或内容值，最终得出单元格的内容值，并打印出来。

  1 package org.poi;
  2 
  3 import org.apache.poi.openxml4j.opc.OPCPackage;
  4 import org.apache.poi.ss.usermodel.BuiltinFormats;
  5 import org.apache.poi.ss.usermodel.DataFormatter;
  6 import org.apache.poi.xssf.eventusermodel.XSSFReader;
  7 import org.apache.poi.xssf.model.SharedStringsTable;
  8 import org.apache.poi.xssf.model.StylesTable;
  9 import org.apache.poi.xssf.usermodel.XSSFCellStyle;
 10 import org.apache.poi.xssf.usermodel.XSSFRichTextString;
 11 import org.xml.sax.Attributes;
 12 import org.xml.sax.InputSource;
 13 import org.xml.sax.SAXException;
 14 import org.xml.sax.XMLReader;
 15 import org.xml.sax.helpers.DefaultHandler;
 16 import org.xml.sax.helpers.XMLReaderFactory;
 17 
 18 import java.io.InputStream;
 19 import java.util.ArrayList;
 20 import java.util.List;
 21 
 22 /**
 23  * @author y
 24  * @create 2018-01-18 14:28
 25  * @desc POI读取excel有两种模式，一种是用户模式，一种是事件驱动模式
 26  * 采用SAX事件驱动模式解决XLSX文件，可以有效解决用户模式内存溢出的问题，
 27  * 该模式是POI官方推荐的读取大数据的模式，
 28  * 在用户模式下，数据量较大，Sheet较多，或者是有很多无用的空行的情况下，容易出现内存溢出
 29  * <p>
 30  * 用于解决.xlsx2007版本大数据量问题
 31  **/
 32 public class ExcelXlsxReader extends DefaultHandler {
 33 
 34     /**
 35      * 单元格中的数据可能的数据类型
 36      */
 37     enum CellDataType {
 38         BOOL, ERROR, FORMULA, INLINESTR, SSTINDEX, NUMBER, DATE, NULL
 39     }
 40 
 41     /**
 42      * 共享字符串表
 43      */
 44     private SharedStringsTable sst;
 45 
 46     /**
 47      * 上一次的索引值
 48      */
 49     private String lastIndex;
 50 
 51     /**
 52      * 文件的绝对路径
 53      */
 54     private String filePath = "";
 55 
 56     /**
 57      * 工作表索引
 58      */
 59     private int sheetIndex = 0;
 60 
 61     /**
 62      * sheet名
 63      */
 64     private String sheetName = "";
 65 
 66     /**
 67      * 总行数
 68      */
 69     private int totalRows=0;
 70 
 71     /**
 72      * 一行内cell集合
 73      */
 74     private List<String> cellList = new ArrayList<String>();
 75 
 76     /**
 77      * 判断整行是否为空行的标记
 78      */
 79     private boolean flag = false;
 80 
 81     /**
 82      * 当前行
 83      */
 84     private int curRow = 1;
 85 
 86     /**
 87      * 当前列
 88      */
 89     private int curCol = 0;
 90 
 91     /**
 92      * T元素标识
 93      */
 94     private boolean isTElement;
 95 
 96     /**
 97      * 判断上一单元格是否为文本空单元格
 98      */
 99     private boolean startElementFlag = true;
100     private boolean endElementFlag = false;
101     private boolean charactersFlag = false;
102 
103     /**
104      * 异常信息，如果为空则表示没有异常
105      */
106     private String exceptionMessage;
107 
108     /**
109      * 单元格数据类型，默认为字符串类型
110      */
111     private CellDataType nextDataType = CellDataType.SSTINDEX;
112 
113     private final DataFormatter formatter = new DataFormatter();
114 
115     /**
116      * 单元格日期格式的索引
117      */
118     private short formatIndex;
119 
120     /**
121      * 日期格式字符串
122      */
123     private String formatString;
124 
125     //定义前一个元素和当前元素的位置，用来计算其中空的单元格数量，如A6和A8等
126     private String prePreRef = "A", preRef = null, ref = null;
127 
128     //定义该文档一行最大的单元格数，用来补全一行最后可能缺失的单元格
129     private String maxRef = null;
130 
131     /**
132      * 单元格
133      */
134     private StylesTable stylesTable;
135 
136     /**
137      * 遍历工作簿中所有的电子表格
138      * 并缓存在mySheetList中
139      *
140      * @param filename
141      * @throws Exception
142      */
143     public int process(String filename) throws Exception {
144         filePath = filename;
145         OPCPackage pkg = OPCPackage.open(filename);
146         XSSFReader xssfReader = new XSSFReader(pkg);
147         stylesTable = xssfReader.getStylesTable();
148         SharedStringsTable sst = xssfReader.getSharedStringsTable();
149         XMLReader parser = XMLReaderFactory.createXMLReader("org.apache.xerces.parsers.SAXParser");
150         this.sst = sst;
151         parser.setContentHandler(this);
152         XSSFReader.SheetIterator sheets = (XSSFReader.SheetIterator) xssfReader.getSheetsData();
153         while (sheets.hasNext()) { //遍历sheet
154             curRow = 1; //标记初始行为第一行
155             sheetIndex++;
156             InputStream sheet = sheets.next(); //sheets.next()和sheets.getSheetName()不能换位置，否则sheetName报错
157             sheetName = sheets.getSheetName();
158             InputSource sheetSource = new InputSource(sheet);
159             parser.parse(sheetSource); //解析excel的每条记录，在这个过程中startElement()、characters()、endElement()这三个函数会依次执行
160             sheet.close();
161         }
162         return totalRows; //返回该excel文件的总行数，不包括首列和空行
163     }
164 
165     /**
166      * 第一个执行
167      *
168      * @param uri
169      * @param localName
170      * @param name
171      * @param attributes
172      * @throws SAXException
173      */
174     @Override
175     public void startElement(String uri, String localName, String name, Attributes attributes) throws SAXException {
176         //c => 单元格
177         if ("c".equals(name)) {
178 
179             //前一个单元格的位置
180             if (preRef == null) {
181                 preRef = attributes.getValue("r");
182 
183             } else {
184                 //中部文本空单元格标识 ‘endElementFlag’ 判断前一次是否为文本空字符串，true则表明不是文本空字符串，false表明是文本空字符串跳过把空字符串的位置赋予preRef
185                 if (endElementFlag){
186                     preRef = ref;
187                 }
188             }
189 
190             //当前单元格的位置
191             ref = attributes.getValue("r");
192             //首部文本空单元格标识 ‘startElementFlag’ 判断前一次，即首部是否为文本空字符串，true则表明不是文本空字符串，false表明是文本空字符串, 且已知当前格，即第二格带“B”标志，则ref赋予preRef
193             if (!startElementFlag && !flag){ //上一个单元格为文本空单元格，执行下面的，使ref=preRef；flag为true表明该单元格之前有数据值，即该单元格不是首部空单元格，则跳过
194                 // 这里只有上一个单元格为文本空单元格，且之前的几个单元格都没有值才会执行
195                 preRef = ref;
196             }
197 
198             //设定单元格类型
199             this.setNextDataType(attributes);
200             endElementFlag = false;
201             charactersFlag = false;
202             startElementFlag = false;
203         }
204 
205         //当元素为t时
206         if ("t".equals(name)) {
207             isTElement = true;
208         } else {
209             isTElement = false;
210         }
211 
212         //置空
213         lastIndex = "";
214     }
215 
216 
217 
218     /**
219      * 第二个执行
220      * 得到单元格对应的索引值或是内容值
221      * 如果单元格类型是字符串、INLINESTR、数字、日期，lastIndex则是索引值
222      * 如果单元格类型是布尔值、错误、公式，lastIndex则是内容值
223      * @param ch
224      * @param start
225      * @param length
226      * @throws SAXException
227      */
228     @Override
229     public void characters(char[] ch, int start, int length) throws SAXException {
230         startElementFlag = true;
231         charactersFlag = true;
232         lastIndex += new String(ch, start, length);
233     }
234 
235     /**
236      * 第三个执行
237      *
238      * @param uri
239      * @param localName
240      * @param name
241      * @throws SAXException
242      */
243     @Override
244     public void endElement(String uri, String localName, String name) throws SAXException {
245         //t元素也包含字符串
246         if (isTElement) {//这个程序没经过
247             //将单元格内容加入rowlist中，在这之前先去掉字符串前后的空白符
248             String value = lastIndex.trim();
249             cellList.add(curCol, value);
250             endElementFlag = true;
251             curCol++;
252             isTElement = false;
253             //如果里面某个单元格含有值，则标识该行不为空行
254             if (value != null && !"".equals(value)) {
255                 flag = true;
256             }
257         } else if ("v".equals(name)) {
258             //v => 单元格的值，如果单元格是字符串，则v标签的值为该字符串在SST中的索引
259             String value = this.getDataValue(lastIndex.trim(), "");//根据索引值获取对应的单元格值
260 
261             //补全单元格之间的空单元格
262             if (!ref.equals(preRef)) {
263                 int len = countNullCell(ref, preRef);
264                 for (int i = 0; i < len; i++

   
 (c)2006-2024 SYSTEM All Rights Reserved  IT常识