如何用一次住宅代理试用做出可信的采购决策
住宅代理常被一个“成功率”数字比较。这个数字看似客观,但如果测试只有几十次请求、反复访问同一缓存页面、把容易和困难市场混在一起,或把自动重试也算成新的成功,它就可能严重误导采购。
有效的试用应回答更具体的问题:在真实需要的路由、市场、目标类型、会话规则与流量结构下,该供应商是否有足够证据达到验收门槛,而且有效结果的成本是否可接受?
这需要测试设计,而不是简单测速。

先定义成功,再发送请求
为每个使用场景写出可由程序判断的成功定义。HTTP 200 不等于业务成功。
对获准的公开数据采集任务,一次有效成功可以要求:
- 已验证预期代理路由,并确认不会直连回退;
- 国家或城市符合供应商声明的定位容差;
- 目标返回预期内容,而不是封锁页、同意墙或通用错误页;
- 响应处于规定的延迟预算内;
- 会话行为符合轮换或粘性策略;
- 未采集凭据、个人数据或受限制内容;
- 请求符合目标规则、合同和获准速率。
分别保存传输成功、内容有效、地理有效和合规有效。这样采购方才能判断问题出在网关、出口池、目标站还是测试本身。
选择正确的分析单位
分母应代表相互独立的成功机会。把自动重试当成新试验,会夸大样本量并掩盖不稳定性。
使用一个 trial_id 归并:初始请求、策略允许的全部重试、所选代理会话和最终结果。分别报告首次成功率与有限重试后的试验成功率。前者反映用户可感知可靠性,后者反映重试策略的恢复能力。
不要把同一粘性会话中的重复请求都当成独立出口样本。一百次调用可以验证会话稳定性,却不能代表一百个独立出口。
测试前完成分层
全球平均值可能掩盖不可用市场。应按采购决策建立分层:
| 维度 | 示例 | 为什么分开 |
|---|---|---|
| 地理 | 北美、欧洲、APAC 或指定国家 | 地址池深度和路由不同 |
| 目标类型 | 搜索、零售、公开目录、广告验证页 | 防护强度与响应大小不同 |
| 协议 | HTTP、HTTPS CONNECT、SOCKS5 | 解析和隧道行为不同 |
| 会话模式 | 轮换、5 分钟粘性、账户固定 | 复用会改变可靠性与成本 |
| 工作负载 | HTML、JSON、图片页面、浏览器导航 | 带宽和延迟分布不同 |
| 时间窗口 | 当地工作时间、夜间、周末 | 供应与拥塞可能变化 |
不要让大量容易样本支配总分。若欧洲占生产流量 40%,应按接近该权重采样,或在分别报告每个分层后再计算加权生产分数。
从决策反推样本计划
试用前固定:
- 每个关键分层的最低可接受成功概率;
- 置信水平,常用 95%;
- 最大可接受不确定性;
- 值得识别的供应商差异;
- 请求与带宽预算;
- 每个目标和时段的最大试验数;
- 遇到限流、错误或政策信号时的停止条件。
小样本适合发现明显配置问题,不足以支持采购承诺。10 次全部成功也不能证明服务可靠率是 100%,因为底层真实成功率仍有很宽的不确定范围。
先运行小型校准批次,根据观察到的波动和故障构成设计主试用。如果采购方要区分 95% 与 90% 可靠率,所需样本远大于只区分 95% 与 60% 的测试。
使用区间,而不只看百分比
每个分层计算 p = 成功数 / 试验数,并为真实成功概率计算置信区间。Wilson 区间在接近 0 或 1 以及中等样本量时,通常比简单正态近似更稳健。
k 次成功、n 次独立试验、95% 置信水平时可用 z = 1.96:
p = k / n
denominator = 1 + z² / n
center = (p + z² / (2n)) / denominator
half_width = z × sqrt((p(1-p) / n) + (z² / (4n²))) / denominator
lower = center - half_width
upper = center + half_width
示例:200 次试验成功 184 次,原始成功率为 92%,95% Wilson 区间约为 87.4% 至 95.0%。如果采购规则要求下界至少 90%,即使标题成功率超过 90%,该结果也不能通过。
若 200 次中成功 190 次,原始成功率为 95%,区间约为 91.0% 至 97.3%,在同一规则下可以通过。
这种门槛有意保持保守:它判断证据是否支持要求,而不是观察百分比是否刚好越线。
把延迟当作分布
平均延迟会隐藏长尾。至少记录代理连接、TLS、首字节、总响应、响应字节数与超时阶段;样本允许时报告中位数、p90、p95 与 p99。
只比较等价结果的延迟。快速返回封锁页不是性能成功;有限重试最终成功,也不应抹掉首次失败给用户造成的等待。成功与失败试验应分别计算分位数。
核算有效结果成本
每 GB 单价不等于每次有效结果的成本:
试用有效成本 = 分摊订阅成本
+ 流量成本
+ 基础设施成本
+ 人工复核成本
每次有效成功成本 = 试用有效成本 / 有效成功数
将重试流量、失败响应体、浏览器静态资源、会话建立以及最低承诺中被试用占用的部分计入成本。如果某供应商因为大量返回小型封锁页而消耗流量较少,这不是效率优势。
成本也要按分层报告。全球均价很低的服务,可能在两个关键国家里最昂贵。
建立中立试验记录
每个试验一行,而不是每个网络尝试一行:
trial_id
provider_alias
started_at_utc
market
target_class
protocol
session_policy
route_verified
direct_fallback_blocked
attempt_count
first_attempt_success
eventual_success
content_valid
geography_valid
policy_valid
failure_layer
status_class
ttfb_ms
total_ms
bytes_transferred
cost_allocation
分析时使用供应商别名,减少熟悉品牌带来的偏见。结果表中不要保存原始代理密码、Cookie、个人数据或完整目标 URL。
随机化并控制测试时间
上午测试 A、晚间故障时测试 B,会引入时间偏差。应在同一获准窗口交错测试:
- 开始前生成运行顺序;
- 在每个分层内轮换供应商次序;
- 使用相同测试身份与浏览器策略;
- 固定目标、请求形状、视口、同意和超时;
- 限制并发,避免制造目标站限流;
- 目标发出限流或访问限制信号时立即停止。
随机化不等于可以增加流量。能够解决采购问题的最小合规样本才是正确样本。
按层分类故障
| 故障层 | 示例 | 采购动作 |
|---|---|---|
| 测试配置 | 错误凭据引用、无效测试案例 | 修复后只重跑受影响试验 |
| 代理网关 | 身份验证、隧道、TLS、连接失败 | 用脱敏时间戳升级处理 |
| 出口池 | 地理错误、出口不健康、会话不稳 | 检查定位与池质量 |
| 目标站 | 封锁页、限流、维护 | 按目标规则停止或改期 |
| 内容验证 | 模板错误、缺少必要字段 | 检查解析器与页面状态 |
| 政策 | 未授权路径、同意或 robots 限制 | 排除且不得转为重试 |
配置错误不能静默消失。报告原始数量、排除原因、修正后重跑数量与最终分母。
预先固定采购门槛
可信的门槛可以要求:
- 每个关键分层的 95% Wilson 下界达到要求;
- 首次成功与有限重试成功分别报告;
- 有效成功的 p95 延迟低于上限;
- 地理有效率达到门槛;
- 无直连回退与凭据泄露;
- 每次有效成功成本低于上限;
- 没有未解决的合规或目标政策问题;
- 至少两个获准时间窗口的结果一致。
看到结果后不得修改门槛。如果业务要求确实改变,应记录新要求,并一致地重新测试或重算所有供应商。
试用发布清单
- [ ] 使用场景、目标、账户、市场与速率均已授权。
- [ ] 成功及全部故障类别在测试前已定义。
- [ ] 以试验而非重试作为分析单位。
- [ ] 关键市场与目标类型分别分层。
- [ ] 等价时间窗口内已随机化供应商顺序。
- [ ] 已阻止直连回退并记录路由验证。
- [ ] 原始成功率同时提供 Wilson 置信区间。
- [ ] 仅为可比结果计算中位数和尾延迟。
- [ ] 有效成本包含重试与最低承诺。
- [ ] 结果揭晓前已固定验收门槛。
- [ ] 未保留凭据、Cookie、个人数据与多余 URL。
- [ ] 限流、同意和访问政策信号会停止相应测试。
可结合 98IP 的浏览器与代理并发规划、代理故障与目标站限流区分及代理诊断归档脱敏指南实施。
FAQ
住宅代理试用需要多少请求?
没有统一数字。它取决于验收门槛、置信水平、值得识别的最小差异、分层数量和允许流量。先做校准批次,再计算主样本,不要把有限总量分散到过多无法单独决策的分层。
可以直接比较供应商宣传的成功率吗?
宣传数字应视为待验证的声明。不同供应商可能使用不同目标、地区、重试规则、时间窗口和成功定义,只有受控试用能统一这些条件。
重试成功算不算成功?
可以报告有限重试后的试验成功,但必须同时报告首次成功率和尝试次数。恢复请求仍消耗时间、带宽与目标容量。
总体最好但某个必需国家失败怎么办?
若该国家属于关键分层,全球平均值不能覆盖失败。只有在运营复杂度、合规和成本可接受时,才考虑多供应商路由策略。
合规说明
仅对获准的目标、账户、数据和代理路由执行试用。遵守目标条款、robots 指令、用户同意、隐私法律、合同限制和限流信号。不得利用轮换或重试规避封锁、制造流量、隐藏身份或采集受限信息。统计严谨不能让未授权测试变得合规。
研究记录:NIST Engineering Statistics Handbook 关于比例置信区间与样本量的指南,以及 SciPy 对精确和 Wilson 二项比例置信区间的说明。外部研究地址仅保存在内部运营记录中。