1

我读过一些 SO 答案,说 JAXB 有一个错误,它归咎于 XML 的性质,导致它不能与 UTF-8 一起使用。我的问题是,那么解决方法是什么?我可能会得到用户输入的 unicode 字符,复制并粘贴到我需要在其他地方保存、编组、解组和重新显示的数据字段中。

(更新)更多背景:

Candidate c = new Candidate();
c.addSubstitution("3 4ths", "\u00BE");
c.addSubstitution("n with tilde", "\u00F1");
    c.addSubstitution("schwa", "\u018F");
    c.addSubstitution("Sigma", "\u03A3");
    c.addSubstitution("Cyrillic Th", "\u040B");     
    jc = JAXBContext.newInstance(Candidate.class);
    Marshaller marshaller = jc.createMarshaller();
    marshaller.setProperty(Marshaller.JAXB_FORMATTED_OUTPUT, true);
    marshaller.setProperty(Marshaller.JAXB_ENCODING, "UTF-8");
    ByteArrayOutputStream os = new ByteArrayOutputStream();
    marshaller.marshal(c, os);
    String xml = os.toString();
    System.out.println(xml);    
    jc = JAXBContext.newInstance(Candidate.class);
    Unmarshaller jaxb = jc.createUnmarshaller();
    ByteArrayInputStream is = new ByteArrayInputStream(xml.getBytes());
    Candidate newCandidate = (Candidate) jaxb.unmarshal(is);
    for(Substitution s:c.getSubstitutions()) {
        System.out.println(s.getSubstitutionName() + "='" + s.getSubstitutionValue() + "'");
    }

这是我放在一起的一个小测试。我得到的确切字符并不完全在我的控制之下。用户可以将带有波浪号的 N 粘贴到该字段或其他任何内容中。

4

1 回答 1

8

这是您的测试代码中的问题:

ByteArrayInputStream is = new ByteArrayInputStream(xml.getBytes());

您正在使用平台默认编码将字符串转换为字节数组。不要那样做。您已指定要使用 UTF-8,因此在创建字节数组时必须这样做:

ByteArrayInputStream is = new ByteArrayInputStream(xml.getBytes("UTF-8"));

同样不要使用ByteArrayOutputStream.toString(),它再次使用平台默认编码。实际上,您根本不需要将输出转换为字符串:

ByteArrayOutputStream os = new ByteArrayOutputStream();
marshaller.marshal(c, os);
byte[] xml = os.toByteArray();
jc = JAXBContext.newInstance(Candidate.class);
Unmarshaller jaxb = jc.createUnmarshaller();
ByteArrayInputStream is = new ByteArrayInputStream(xml);

这对您使用的字符应该没有问题 - 它仍然存在无法在 XML 1.0 中表示的问题(U+0020 以下的字符,除了\r,\n\t),仅此而已。

于 2013-08-12T18:39:05.743 回答