1m read
大模型网页抓取原理
aiweb
LLMs don't scrape pages from your machine — the platform's server makes the HTTP request, so no cookies, no JWT, no login state ever leaves your device. This post walks through which pages are actually fetchable (public yes, login-gated no), and the four workarounds for gated content: copy HTML from DevTools, save locally, screenshot, or wire up a browser MCP server.
大模型总结网页,不是本地抓取,是服务端代抓。
流程:
text给出 URL → 云端服务器发出 HTTP 请求 → 目标网站返回 HTML ↓ HTML 转纯文本/Markdown ↓ 小模型按 prompt 提取关键信息 → 返回给用户
关键点:
- 请求 IP 是从大模型服务商的服务器发出的。
- 不需要登录。服务端没有 cookie、JWT、session,对目标网站是匿名访客。
- 每次请求独立,上次抓的内容不会带到下次。
能抓和不能抓的:
| 情况 | 结果 |
|---|---|
| 公开网页(如维基百科) | 可以抓 |
| 带分享链接的页面 | 部分内容未登录也能看,可能成功 |
| 必须登录 | 失败 |
登录后内容的处理方式:
- F12 复制 HTML:Elements 面板右键内容节点 → Copy outerHTML,直接贴给模型。
- 另存为本地:
Cmd+S存 HTML,或者Cmd+P存 PDF,再给模型阅读。 - 截图:把图存本地,让识图的 AI 做识别。
- 搭浏览器 MCP 工具:Puppeteer/Playwright MCP server,复用本地浏览器 profile,保留登录态。