POI读写大数据量excel,解决超过几万行而导致内存溢出的问题
Posted 牧梦者
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了POI读写大数据量excel,解决超过几万行而导致内存溢出的问题相关的知识,希望对你有一定的参考价值。
1. Excel2003与Excel2007
两个版本的最大行数和列数不同,2003版最大行数是65536行,最大列数是256列,2007版及以后的版本最大行数是1048576行,最大列数是16384列。
excel2003是以二进制的方式存储,这种格式不易被其他软件读取使用;而excel2007采用了基于XML的ooxml开放文档标准,ooxml使用XML和ZIP技术结合进行文件存储,XML是一个基于文本的格式,而且ZIP容器支持内容的压缩,所以其一大优势是可以大大减小文件的尺寸。
2. 大批量数据读写
2.1 大批量数据写入
对于大数据的Xlsx文件的写入,POI3.8提供了SXSSFSXSSFWorkbook类,采用缓存方式进行大批量写文件。
详情可以查看poi官网示例:http://poi.apache.org/spreadsheet/how-to.html#sxssf 或 http://blog.csdn.net/daiyutage/article/details/53010491
2.2 大批量数据读取
POI读取Excel有两种模式,一种是用户模式,一种是SAX事件驱动模式,将xlsx格式的文档转换成CSV格式后进行读取。用户模式API接口丰富,使用POI的API可以很容易读取Excel,但用户模式消耗的内存很大,当遇到很大sheet、大数据网格,假空行、公式等问题时,很容易导致内存溢出。POI官方推荐解决内存溢出的方式使用CVS格式解析,即SAX事件驱动模式。下面主要是讲解如何读取大批量数据:
2.2.1 pom.xml所需jar包
1 <project xmlns="http://maven.apache.org/POM/4.0.0" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" 2 xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/maven-v4_0_0.xsd"> 3 <modelVersion>4.0.0</modelVersion> 4 <groupId>POIExcel</groupId> 5 <artifactId>POIExcel</artifactId> 6 <packaging>war</packaging> 7 <version>1.0-SNAPSHOT</version> 8 <name>POIExcel Maven Webapp</name> 9 <url>http://maven.apache.org</url> 10 <dependencies> 11 <dependency> 12 <groupId>junit</groupId> 13 <artifactId>junit</artifactId> 14 <version>3.8.1</version> 15 <scope>test</scope> 16 </dependency> 17 18 <dependency> 19 <groupId>org.apache.poi</groupId> 20 <artifactId>poi</artifactId> 21 <version>3.17</version> 22 </dependency> 23 24 <dependency> 25 <groupId>org.apache.poi</groupId> 26 <artifactId>poi-ooxml</artifactId> 27 <version>3.17</version> 28 </dependency> 29 30 <dependency> 31 <groupId>org.apache.poi</groupId> 32 <artifactId>poi-ooxml-schemas</artifactId> 33 <version>3.17</version> 34 </dependency> 35 36 <dependency> 37 <groupId>com.syncthemall</groupId> 38 <artifactId>boilerpipe</artifactId> 39 <version>1.2.1</version> 40 </dependency> 41 42 <dependency> 43 <groupId>xerces</groupId> 44 <artifactId>xercesImpl</artifactId> 45 <version>2.11.0</version> 46 </dependency> 47 48 <dependency> 49 <groupId>xml-apis</groupId> 50 <artifactId>xml-apis</artifactId> 51 <version>1.4.01</version> 52 </dependency> 53 54 <dependency> 55 <groupId>org.apache.xmlbeans</groupId> 56 <artifactId>xmlbeans</artifactId> 57 <version>2.6.0</version> 58 </dependency> 59 60 <dependency> 61 <groupId>sax</groupId> 62 <artifactId>sax</artifactId> 63 <version>2.0.1</version> 64 </dependency> 65 66 <dependency> 67 <groupId>org.apache.commons</groupId> 68 <artifactId>commons-lang3</artifactId> 69 <version>3.7</version> 70 </dependency> 71 72 </dependencies> 73 <build> 74 <finalName>POIExcel</finalName> 75 </build> 76 </project>
2.2.2 POI以SAX解析excel2007文件
解决思路:通过继承DefaultHandler类,重写process(),startElement(),characters(),endElement()这四个方法。process()方式主要是遍历所有的sheet,并依次调用startElement()、characters()方法、endElement()这三个方法。startElement()用于设定单元格的数字类型(如日期、数字、字符串等等)。characters()用于获取该单元格对应的索引值或是内容值(如果单元格类型是字符串、INLINESTR、数字、日期则获取的是索引值;其他如布尔值、错误、公式则获取的是内容值)。endElement()根据startElement()的单元格数字类型和characters()的索引值或内容值,最终得出单元格的内容值,并打印出来。
1 package org.poi; 2 3 import org.apache.poi.openxml4j.opc.OPCPackage; 4 import org.apache.poi.ss.usermodel.BuiltinFormats; 5 import org.apache.poi.ss.usermodel.DataFormatter; 6 import org.apache.poi.xssf.eventusermodel.XSSFReader; 7 import org.apache.poi.xssf.model.SharedStringsTable; 8 import org.apache.poi.xssf.model.StylesTable; 9 import org.apache.poi.xssf.usermodel.XSSFCellStyle; 10 import org.apache.poi.xssf.usermodel.XSSFRichTextString; 11 import org.xml.sax.Attributes; 12 import org.xml.sax.InputSource; 13 import org.xml.sax.SAXException; 14 import org.xml.sax.XMLReader; 15 import org.xml.sax.helpers.DefaultHandler; 16 import org.xml.sax.helpers.XMLReaderFactory; 17 18 import java.io.InputStream; 19 import java.util.ArrayList; 20 import java.util.List; 21 22 /** 23 * @author y 24 * @create 2018-01-18 14:28 25 * @desc POI读取excel有两种模式,一种是用户模式,一种是事件驱动模式 26 * 采用SAX事件驱动模式解决XLSX文件,可以有效解决用户模式内存溢出的问题, 27 * 该模式是POI官方推荐的读取大数据的模式, 28 * 在用户模式下,数据量较大,Sheet较多,或者是有很多无用的空行的情况下,容易出现内存溢出 29 * <p> 30 * 用于解决.xlsx2007版本大数据量问题 31 **/ 32 public class ExcelXlsxReader extends DefaultHandler { 33 34 /** 35 * 单元格中的数据可能的数据类型 36 */ 37 enum CellDataType { 38 BOOL, ERROR, FORMULA, INLINESTR, SSTINDEX, NUMBER, DATE, NULL 39 } 40 41 /** 42 * 共享字符串表 43 */ 44 private SharedStringsTable sst; 45 46 /** 47 * 上一次的索引值 48 */ 49 private String lastIndex; 50 51 /** 52 * 文件的绝对路径 53 */ 54 private String filePath = ""; 55 56 /** 57 * 工作表索引 58 */ 59 private int sheetIndex = 0; 60 61 /** 62 * sheet名 63 */ 64 private String sheetName = ""; 65 66 /** 67 * 总行数 68 */ 69 private int totalRows=0; 70 71 /** 72 * 一行内cell集合 73 */ 74 private List<String> cellList = new ArrayList<String>(); 75 76 /** 77 * 判断整行是否为空行的标记 78 */ 79 private boolean flag = false; 80 81 /** 82 * 当前行 83 */ 84 private int curRow = 1; 85 86 /** 87 * 当前列 88 */ 89 private int curCol = 0; 90 91 /** 92 * T元素标识 93 */ 94 private boolean isTElement; 95 96 /** 97 * 判断上一单元格是否为文本空单元格 98 */ 99 private boolean startElementFlag = true; 100 private boolean endElementFlag = false; 101 private boolean charactersFlag = false; 102 103 /** 104 * 异常信息,如果为空则表示没有异常 105 */ 106 private String exceptionMessage; 107 108 /** 109 * 单元格数据类型,默认为字符串类型 110 */ 111 private CellDataType nextDataType = CellDataType.SSTINDEX; 112 113 private final DataFormatter formatter = new DataFormatter(); 114 115 /** 116 * 单元格日期格式的索引 117 */ 118 private short formatIndex; 119 120 /** 121 * 日期格式字符串 122 */ 123 private String formatString; 124 125 //定义前一个元素和当前元素的位置,用来计算其中空的单元格数量,如A6和A8等 126 private String prePreRef = "A", preRef = null, ref = null; 127 128 //定义该文档一行最大的单元格数,用来补全一行最后可能缺失的单元格 129 private String maxRef = null; 130 131 /** 132 * 单元格 133 */ 134 private StylesTable stylesTable; 135 136 /** 137 * 遍历工作簿中所有的电子表格 138 * 并缓存在mySheetList中 139 * 140 * @param filename 141 * @throws Exception 142 */ 143 public int process(String filename) throws Exception { 144 filePath = filename; 145 OPCPackage pkg = OPCPackage.open(filename); 146 XSSFReader xssfReader = new XSSFReader(pkg); 147 stylesTable = xssfReader.getStylesTable(); 148 SharedStringsTable sst = xssfReader.getSharedStringsTable(); 149 XMLReader parser = XMLReaderFactory.createXMLReader("org.apache.xerces.parsers.SAXParser"); 150 this.sst = sst; 151 parser.setContentHandler(this); 152 XSSFReader.SheetIterator sheets = (XSSFReader.SheetIterator) xssfReader.getSheetsData(); 153 while (sheets.hasNext()) { //遍历sheet 154 curRow = 1; //标记初始行为第一行 155 sheetIndex++; 156 InputStream sheet = sheets.next(); //sheets.next()和sheets.getSheetName()不能换位置,否则sheetName报错 157 sheetName = sheets.getSheetName(); 158 InputSource sheetSource = new InputSource(sheet); 159 parser.parse(sheetSource); //解析excel的每条记录,在这个过程中startElement()、characters()、endElement()这三个函数会依次执行 160 sheet.close(); 161 } 162 return totalRows; //返回该excel文件的总行数,不包括首列和空行 163 } 164 165 /** 166 * 第一个执行 167 * 168 * @param uri 169 * @param localName 170 * @param name 171 * @param attributes 172 * @throws SAXException 173 */ 174 @Override 175 public void startElement(String uri, String localName, String name, Attributes attributes) throws SAXException { 176 //c => 单元格 177 if ("c".equals(name)) { 178 179 //前一个单元格的位置 180 if (preRef == null) { 181 preRef = attributes.getValue("r"); 182 183 } else { 184 //中部文本空单元格标识 ‘endElementFlag’ 判断前一次是否为文本空字符串,true则表明不是文本空字符串,false表明是文本空字符串跳过把空字符串的位置赋予preRef 185 if (endElementFlag){ 186 preRef = ref; 187 } 188 } 189 190 //当前单元格的位置 191 ref = attributes.getValue("r"); 192 //首部文本空单元格标识 ‘startElementFlag’ 判断前一次,即首部是否为文本空字符串,true则表明不是文本空字符串,false表明是文本空字符串, 且已知当前格,即第二格带“B”标志,则ref赋予preRef 193 if (!startElementFlag && !flag){ //上一个单元格为文本空单元格,执行下面的,使ref=preRef;flag为true表明该单元格之前有数据值,即该单元格不是首部空单元格,则跳过 194 // 这里只有上一个单元格为文本空单元格,且之前的几个单元格都没有值才会执行 195 preRef = ref; 196 } 197 198 //设定单元格类型 199 this.setNextDataType(attributes); 200 endElementFlag = false; 201 charactersFlag = false; 202 startElementFlag = false; 203 } 204 205 //当元素为t时 206 if ("t".equals(name)) { 207 isTElement = true; 208 } else { 209 isTElement = false; 210 } 211 212 //置空 213 lastIndex = ""; 214 } 215 216 217 218 /** 219 * 第二个执行 220 * 得到单元格对应的索引值或是内容值 221 * 如果单元格类型是字符串、INLINESTR、数字、日期,lastIndex则是索引值 222 * 如果单元格类型是布尔值、错误、公式,lastIndex则是内容值 223 * @param ch 224 * @param start 225 * @param length 226 * @throws SAXException 227 */ 228 @Override 229 public void characters(char[] ch, int start, int length) throws SAXException { 230 startElementFlag = true; 231 charactersFlag = true; 232 lastIndex += new String(ch, start, length); 233 } 234 235 /** 236 * 第三个执行 237 * 238 * @param uri 239 * @param localName 240 * @param name 241 * @throws SAXException 242 */ 243 @Override 244 public void endElement(String uri, String localName, String name) throws SAXException { 245 //t元素也包含字符串 246 if (isTElement) {//这个程序没经过 247 //将单元格内容加入rowlist中,在这之前先去掉字符串前后的空白符 248 String value = lastIndex.trim(); 249 cellList.add(curCol, value); 250 endElementFlag = true; 251 curCol++; 252 isTElement = false; 253 //如果里面某个单元格含有值,则标识该行不为空行 254 if (value != null && !"".equals(value)) { 255 flag = true; 256 } 257 } else if ("v".equals(name)) { 258 //v => 单元格的值,如果单元格是字符串,则v标签的值为该字符串在SST中的索引 259 String value = this.getDataValue(lastIndex.trim(), "");//根据索引值获取对应的单元格值 260 261 //补全单元格之间的空单元格 262 if (!ref.equals(preRef)) { 263 int len = countNullCell(ref, preRef); 264 for (int i = 0; i < len; i++EXCEL大数据量导出的解决方案