=raw

HTML文書をパースする

=/raw HTML文書の構造は、以下のようにタグとテキストが連なったものである。 -----------------------------------------------| testtexttexttext -----------------------------------------------| ※ この時点では、との区別はつけていない。 この文書をパースするための第一ステップは、最初のタグを見つけることである。 一見すると、最初の < の文字を見つければいいような気がする。 しかし以下の例では、最初の < はテキストとして認識され、 その後の
TEST
は、タグ+テキスト+タグとして認識される。 -----------------------------------------------| <
TEST
-----------------------------------------------| では次のケースはどうだろうか? -----------------------------------------------| TEST -----------------------------------------------| この場合、 が一つのタグとして認識される。 (タグのまん中に < が混入しているが、Chromeはこのようにタグを認識するのである。) では、< の後に、なにか文字があれば、タグとして認識されるのだろうか? 事はそう単純ではない。次の例を見てみよう。 -----------------------------------------------| <1
TEST
-----------------------------------------------| この場合、<1 はテキストとして認識され、残りの
TEST
は、タグ+テキスト+タグとして認識される。 つまり、< の文字がタグの最初の文字となるかどうかは、< の次の文字で決まるようだ。 そこで、< の後にcharcodeが0から127までの文字をつけて試してみた。 =raw
check-0-to-127.php =/raw =raw check-unicode.php =/raw 【結論】