java - 在 Java 中使用 XPATH 处理分层 XML 文档。效率？

Question

这个问题的变体现在已经在这里被问过好几次了，但我的问题更多是关于在 Java 中使用 XPATH 的一般效率问题。

我的任务：获取有关地理位置的维基百科文章，并从中创建分层数据结构。

我已经获得了 wiki 页面的 XML 版本，并根据直观的模式重新格式化。我还制作了一系列非常简单的类来代表不同级别的行政等级，例如：

public class Province implements java.io.Serializable {

private ArrayList<City> cities = new ArrayList<City>();
private String hanzi;
private String pinyin;


public Province(String hanzi, String pinyin) {
this.hanzi = hanzi;
this.pinyin = pinyin;
}

以及添加城市的方法、一些 getter 和 setter 方法以及 toString()。

这是我正在处理的 XML 文件类型的示例：

<mediawiki>
     <page>
           <title>Tianjin</title>
           <revision>
                    <id>2064019</id>
                    <text xml:space="preserve">
                              <province>
                                       <hanzi>天津</hanzi>
                                       <pinyin>Tianjin</pinyin>

                                       <Level2>
                                               <hanzi>和平</hanzi>
                                               <pinyin>Heping</pinyin>
                                               <zip>300000</zip>
                                       </Level2>

                                       <Level2>
                                                <hanzi>河东</hanzi>
                                                <pinyin>Hedong</pinyin>
                                                <zip>300000</zip>
                                        </Level2>

                                </province>
                    </text>
            </revision>
      </page>

...

</mediawiki>

在这一点上，我基本上有一个功能设置，但是代码非常重复，并且没有考虑到地理数据固有的分层性质。理想情况下，我可以停在某个级别（假设“专注”于特定省份），并且从那时起仅以相对的方式引用事物，以最大限度地减少我必须爬过整个文档的次数。举个例子（注意，我使用了对传统 Document 设置的抽象，但下面的方法几乎完全对应于传统方法）：

XPathReader reader = new XPathReader("sourceXML\\Provinces.xml");           
String expression = "/mediawiki/page";
NodeList allProvinces = (NodeList)reader.read(expression, XPathConstants.NODESET);

for(int i=0; i < allProvinces.getLength(); i++) {
     expression = "/mediawiki/page[" + i + "]/revision/text/province/hanzi";
     String hanzi = reader.read(expression, XPathConstants.STRING).toString();

     expression = "/mediawiki/page[" + i + "]/revision/text/province/pinyin";
     String pinyin = reader.read(expression, XPathConstants.STRING).toString();

     Province currProv = new Province(hanzi, pinyin);         



     expression = "/mediawiki/page[" + i + "]/revision/text/province/Level2";
     NodeList level2 = (NodeList)reader.read(expression, XPathConstants.NODESET);

     for(int j=1; j < level2.getLength(); j++) {
           expression = "/mediawiki/page[" + i + "]/revision/text/province/Level2[" + j + "]/hanzi";
           String hanzi2 = reader.read(expression, XPathConstants.STRING).toString();   

           expression = "/mediawiki/page[" + i + "]/revision/text/province/Level2[" + j + "]/pinyin";
           String pinyin2 = reader.read(expression, XPathConstants.STRING).toString();  

         City currCity = new City(hanzi2, pinyin2);
         currProv.add(currCity);
...
     }
}

坦率地说，这似乎很愚蠢。我没有考虑到一旦我达到我关心的级别，这些字符串的所有内容都是相同的。我没有引用任何类型的相对路径，每当我遍历文档的一部分时，我实际上是遍历了整个内容。如果我能暂时屏蔽原始 XML 文档的其余部分并只关注我所在的省，并以相对的方式提及此后的所有内容，那就太好了。

我应该特别指出，“读取”抽象背后的成本是多么昂贵：

xPath.compile(expression);
String result = xPathExpression.evaluate (xmlDocument, returnType);

我本质上是在重新编译一个相同的模式，但结局略有不同？加载感兴趣的部分然后用“currProv/hanzi”之类的东西引用它的孩子怎么样？

我已经研究过解析 XML 的其他方法，并且“Digester”似乎做了类似于我想要http://commons.apache.org/digester/core.html的事情，但我已经在这个 XPATH 中拥有了几乎所有东西执行。

我一直怀疑这个问题的解决方案非常简单......但我不能完全掌握解决方案。无论如何，我感谢您的时间！

score 1 · Accepted Answer

相对嵌套的 XPath 是要走的路。

我领导 EclipseLink JAXB 实现 (MOXy)，我们通过 @XmlPath 注释提供此功能。如果您已经拥有 XPath，这将是一个相对简单的映射。

有关更多信息，请参阅：

java - 在 Java 中使用 XPATH 处理分层 XML 文档。效率？

1 回答 1

Related

Reference