- 大家好,我是同学小张,日常分享AI知识和实战案例
- 欢迎 点赞 + 关注 👏,持续学习,持续干货输出。
- +v: jasper_8017 一起交流💬,一起进步💪。
- 微信公众号也可搜【同学小张】 🙏
本站文章一览:
Web检索是AI大模型应用的一个热门应用方向。其涉及的主要步骤如下:
参考:https://python.langchain.com/docs/use_cases/web_scraping
(1)用户提问,联网检索
(2)通过URLs记载网页HTML数据
(3)加载到的数据通过转换,获取关注的内容,形成文本
(4)对文本进行分块、向量化、存储
(5)调用大模型进行总结、答案生成
其实就是RAG的基本流程,只不过知识库不再局限在你自己的知识库,而是利用在线检索,搜罗互联网上的数据作为相关知识。
搜罗数据的过程,可以有两种方法,一种是调用检索的API,例如GoogleSearch的API,直接获取检索结果。另一种方法,就是靠爬虫,将网页数据抓取下来,存入向量数据库使用。
本文我们探讨一下爬虫的相关的使用方法。