热点:

    网页抓取转MDX词典指南

      [   原创  ]   作者:
    收藏文章 暂无评论

    简易网页抓取与MDX教程制作

    1、 获取网站首页,新建一个TXT文件,写入所有待抓取词条的URL地址。

    2、 将文本文件命名为download.txt,并将其与wget.exe程序置于同一目录下(如D:DOPF)。若下载的wget可执行文件名称包含版本号(例如wget-1.21.4.exe),请先将其重命名为wget.exe。随后,打开命令提示符(cmd.exe),依次执行以下操作:切换至目标目录——输入cd /d D:DOPF,再运行下载命令——键入wget -i download.txt。该命令将按文本文件中列出的URL地址批量下载资源。

    3、 下载处理后,共获得16698个链接。

    4、 同样使用 wget -i download.txt 命令批量下载文件中列出的所有 HTML 页面,后续操作将变得非常简单。

    5、 通过文本分析发现,词典条目内容位于首个标签与标签之间的区域。

    6、 借助TextForever工具提取文本内容。

    7、 提取完成后,共合并生成16695个HTML文件。在制作这本词典的过程中,我曾考虑是否需在文件内容前添加文件名。虽然某些场景下此举有助于关键词提取,但经反复测试验证,最终确定应在文件内容末尾统一添加一个空行,以确保格式规范、解析稳定且兼容性更佳。

    8、 获取dopf-src.txt文件,对其进行处理,生成符合MDX格式构建要求的文本文件。

    9、 MDX合并后的文本呈现如下:

    10、 词典源文件为XML格式,但MDict桌面版原生不支持XML+CSS渲染(需升级内核方可实现)。因此,需将XML标签统一转换为标准HTML标签。经过一系列格式转换与结构优化,最终生成兼容性良好的HTML文本。

    11、 编写CSS

    12、 途中虽遇小问题,但逐一解决,最终顺利完成。

    13、 看起来是否比在线版更顺眼些?

    soft.zol.com.cn true https://soft.zol.com.cn/1247/12472542.html report 1316 简易网页抓取与MDX教程制作 1、 获取网站首页,新建一个TXT文件,写入所有待抓取词条的URL地址。 2、 将文本文件命名为download.txt,并将其与wget.exe程序置于同一目录下(如D:DOPF)。若下载的wget可执行文件名称包含版本号(例如wget-1.21.4.exe),请先将其重命名为...
    不喜欢(0) 点个赞(0)
    随时随地资讯查报价 就上ZOL手机客户端,点击或扫描二维码下载
    立即下载

    Wget

    更新时间:2018年08月03日

    用户评分:10 | 1人点评

    软件类型:免费软件

    软件语言:英文

    Wget
    • 更新时间:2018年08月03日
    • 软件大小:1.7MB
    • 软件分类:下载工具
    • 语言种类:英文
    • 软件评级:1 人点评