div.class > p:first-child)parser.select().child().text 流畅语法.text、.html、.count 等属性直接获取数据select() 全量遍历,selectFirst() 首元素优化io.fullpath() 处理相对路径getObjectCount() 可监控资源使用情况table.gc() 实现 RAII,对象超出作用域自动释放selectFirst() 避免创建多元素集合,提升单元素查询速度getLastError() 提供详细的错误信息,便于调试removeNode() 动态删除 DOM 节点,灵活操作◆ 三层架构:接口层 → 公共逻辑层 → 选择器层,职责清晰,易于扩展
| 分类 | 方法 | 说明 |
|---|---|---|
| 管理 | loadHtml(html) | 加载 HTML 文本 |
| 管理 | loadFile(path) | 加载 HTML 文件 |
| 选择 | select(css) | CSS 选择器 → 返回选择器对象 |
| 选择 | selectFirst(css) | 仅选第一个匹配(性能优化) |
| 提取 | getText(index) | 获取文本(去除前后空格) |
| 提取 | getTextRaw(index) | 获取原始文本(保留空格) |
| 提取 | getHtml(index) | 获取 HTML 代码 |
| 提取 | getAttr(attr, index) | 获取元素属性 |
| 提取 | getAllText(spr) | 获取所有匹配文本(可自定义分隔符) |
| 选择 | child(index) | 获取子元素选择器 |
| 管理 | close() / release() | 释放资源(可自动析构) |
* 基于 GoQuery 底层优化,比纯 Lua/Python 解析快 10-50 倍
godking.htmlParser 是一个集 高性能、易用性、稳定性 于一体的 HTML 解析库,
无论是爬虫开发、数据提取还是 HTML 分析,都能显著提升开发效率与运行速度。