Skip to main content
POST
利用 LLM 从网页中提取结构化数据
注意:此 API 的新 v2 版本 现已推出,具备改进的功能和性能。

授权

Authorization
string
header
必填

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

请求体

application/json
urls
string<uri>[]
必填

用于提取数据的 URL。URL 应采用 glob 格式。

当设为 true 时,提取过程会通过网页搜索获取更多数据

ignoreInvalidURLs
boolean
默认值:false

如果在 urls 数组中指定了无效 URL,这些 URL 会被忽略。请求不会因此整体失败,而是会使用剩余的有效 URL 执行提取操作,并在响应的 invalidURLs 字段中返回这些无效 URL。

ignoreSitemap
boolean
默认值:false

为 true 时,网站扫描过程中会忽略 sitemap.xml 文件

includeSubdomains
boolean
默认值:true

设为 true 时,还会扫描所提供 URL 的子域名

prompt
string

用于引导抽取过程的提示词

schema
object

用于定义提取后数据结构的模式。必须符合 JSON Schema 规范。

scrapeOptions
object
showSources
boolean
默认值:false

如果为 true,用于提取数据的来源将会包含在响应的 sources 字段中

threatProtection
Threat Protection Override · object

此请求的 威胁防护 单次请求覆盖配置。你提供的字段只会替换本次请求中组织策略里的对应字段;未提供的字段将保留组织级别的值。你的团队必须已启用威胁防护(企业版功能),否则该请求将被 403 拒绝。如果你的组织已禁用单次请求覆盖,任何包含此对象的请求都会被 403 拒绝。如果你的团队强制启用了威胁防护,则不能将 mode 设为 off

响应

提取成功

id
string
invalidURLs
string[] | null

如果 ignoreInvalidURLs 为 true,则此字段是一个数组,包含请求中指定的无效 URL。若没有无效 URL,则该数组为空。若 ignoreInvalidURLs 为 false,则此字段为 undefined。

success
boolean