107

我在一个字符串中有一个完整的 XML 文档,并且想要一个Document对象。谷歌出现了各种各样的垃圾。什么是最简单的解决方案?(在 Java 1.5 中)

解决方案感谢Matt McMinn,我已经确定了这个实现。它对我来说具有适当的输入灵活性和异常粒度。(很高兴知道错误是否来自格式错误的 XML SAXException- 或者只是错误的 IO - IOException。)

public static org.w3c.dom.Document loadXMLFrom(String xml)
    throws org.xml.sax.SAXException, java.io.IOException {
    return loadXMLFrom(new java.io.ByteArrayInputStream(xml.getBytes()));
}

public static org.w3c.dom.Document loadXMLFrom(java.io.InputStream is) 
    throws org.xml.sax.SAXException, java.io.IOException {
    javax.xml.parsers.DocumentBuilderFactory factory =
        javax.xml.parsers.DocumentBuilderFactory.newInstance();
    factory.setNamespaceAware(true);
    javax.xml.parsers.DocumentBuilder builder = null;
    try {
        builder = factory.newDocumentBuilder();
    }
    catch (javax.xml.parsers.ParserConfigurationException ex) {
    }  
    org.w3c.dom.Document doc = builder.parse(is);
    is.close();
    return doc;
}
4

4 回答 4

154

哇!

这段代码有一个潜在的严重问题,因为它忽略了在 中指定的字符编码String(默认为 UTF-8)。当您调用String.getBytes()平台时,默认编码用于将 Unicode 字符编码为字节。所以,解析器可能认为它正在获取 UTF-8 数据,而实际上它正在获取 EBCDIC 或其他东西……不漂亮!

相反,使用带有 InputSource 的 parse 方法,它可以用 Reader 构造,如下所示:

import java.io.StringReader;
import org.xml.sax.InputSource;
…
        return builder.parse(new InputSource(new StringReader(xml)));

这似乎没什么大不了的,但对字符编码问题的无知会导致类似于 y2k 的阴险代码腐烂。

于 2008-08-28T23:16:54.800 回答
82

这在 Java 1.5 中对我有用——为了便于阅读,我去掉了特定的异常。

import javax.xml.parsers.DocumentBuilderFactory;
import javax.xml.parsers.DocumentBuilder;
import org.w3c.dom.Document;
import java.io.ByteArrayInputStream;

public Document loadXMLFromString(String xml) throws Exception
{
    DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();

    factory.setNamespaceAware(true);
    DocumentBuilder builder = factory.newDocumentBuilder();

    return builder.parse(new ByteArrayInputStream(xml.getBytes()));
}
于 2008-08-28T20:11:00.160 回答
9

刚刚遇到了类似的问题,除了我需要一个 NodeList 而不是 Document,这就是我想出的。它与以前的解决方案基本相同,将根元素作为 NodeList 进行了扩充,并使用了 erickson 的建议,即使用 InputSource 而不是字符编码问题。

private String DOC_ROOT="root";
String xml=getXmlString();
Document xmlDoc=loadXMLFrom(xml);
Element template=xmlDoc.getDocumentElement();
NodeList nodes=xmlDoc.getElementsByTagName(DOC_ROOT);

public static Document loadXMLFrom(String xml) throws Exception {
        InputSource is= new InputSource(new StringReader(xml));
        DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();
        factory.setNamespaceAware(true);
        DocumentBuilder builder = null;
        builder = factory.newDocumentBuilder();
        Document doc = builder.parse(is);
        return doc;
    }
于 2008-09-05T15:57:59.983 回答
1

为了在 Java 中操作 XML,我总是倾向于使用 Transformer API:

import javax.xml.transform.Source;
import javax.xml.transform.TransformerException;
import javax.xml.transform.TransformerFactory;
import javax.xml.transform.dom.DOMResult;
import javax.xml.transform.stream.StreamSource;

public static Document loadXMLFrom(String xml) throws TransformerException {
    Source source = new StreamSource(new StringReader(xml));
    DOMResult result = new DOMResult();
    TransformerFactory.newInstance().newTransformer().transform(source , result);
    return (Document) result.getNode();
}   
于 2014-08-05T11:01:20.950 回答