Oracle
 sql >> Base de Dados >  >> RDS >> Oracle

Analisar tabela HTML com Oracle


Seu path está procurando por um td sob o tr; mas há dois, daí o erro "sequência de vários itens" que você está vendo. Você pode fazer referência a cada td tag por sua posição, como td[1] etc. É muito dependente da estrutura da tabela ser conforme o esperado.

Com este exemplo específico você pode fazer:
with tbl as
(
    select xmltype('
        <table>
          <tbody>
            <tr class="blue"><td>code</td><td>rate</td></tr>
            <tr class="gray_1"><td><span>USD</span><em>1</em></td><td>476.16</td></tr>
            <tr class="gray_2"><td><span>AUD</span><em>1</em></td><td>327.65</td></tr>
            <tr class="gray_9"><td><span>IRR</span><em>100</em></td><td>1.13</td></tr>
            <tr class="blue"><td>some comment</td><td>some comment</td></tr>
            <tr class="gray_1"><td><span>EUR</span><em>1</em></td><td>526.54</td></tr>
          </tbody>
        </table>
    ') xml_data from dual
)
select
    x.class, x.currency, x.amount, to_number(x.rate) as rate
from
    tbl
cross join
    xmltable('/table/tbody/tr'
        passing tbl.xml_data
        columns
            class varchar2(10) path '@class',
            currency varchar2(3) path 'td[1]/span',
            amount number path 'td[1]/em',
            rate varchar2(50) path 'td[2]'
    ) x
where
    x.currency is not null

que obtém:
CLASS      CUR     AMOUNT       RATE
---------- --- ---------- ----------
gray_1     USD          1     476.16
gray_2     AUD          1     327.65
gray_9     IRR        100       1.13
gray_1     EUR          1     526.54

No entanto, não será necessária muita variação no HTML para quebrá-lo. Veja esta resposta por alguns motivos ele é frágil, e por que geralmente é considerado imprudente tentar analisar HTML como XML.