Ձեր CDN-ը կարող է չեղարկել robots.txt-ը. ինչպե՞ս գտնել այն շերտը, որը մերժում է AI սողուններին

92 կայքերի վերլուծությունը ցույց է տալիս, որ շատ սեփականատերեր տեղյակ չեն, որ իրենց սերվերները կամ CDN-ները կարող են արգելափակել AI սողուններին (crawlers), չնայած իրենց robots.txt ֆայլերին: Հետազոտությունը պարզել է, որ փորձարկված կայքերի 24%-ը 403 սխալ է վերադարձնում AI բոտերին՝ միաժամանակ բովանդակություն տրամադրելով բրաուզերներին: Այս արգելափակումները հաճախ տեղի են ունենում CDN մակարդակում (օրինակ՝ Cloudflare) կամ սերվերային կոնֆիգուրացիաների միջոցով, այլ ոչ թե robots.txt ֆայլի միջոցով: Հեղինակը շեշտում է, որ կայքի սեփականատերերը պետք է ստուգեն իրենց ենթակառուցվածքը՝ համոզվելու համար, որ տեխնիկական իրականացումը համապատասխանում է իրենց քաղաքականությանը: Հոդվածը տրամադրում է գործնական քայլեր՝ curl-ի միջոցով պարզելու, թե որ շերտն է պատասխանատու մերժման համար, և առաջարկում է կոնֆիգուրացիայի օրինակներ Cloudflare-ի և nginx-ի համար՝ AI բոտերի հասանելիությունը ճիշտ կառավարելու համար:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Habr-ում հրապարակված նոր հոդվածում հեղինակը մանրամասն վերլուծում է C ծրագրավորման լեզվում ABI-անհամատեղելիության խնդիրը։ ABI-խզումը տեղի է ունենում, ե…
Habr-ի հոդվածում հեղինակը վերլուծում է chunk() մեթոդի ոչ ճիշտ աշխատանքի խնդիրը ֆոնային առաջադրանքներում մեծ ծավալի տվյալներ մշակելիս: 300 հազար օգտատե…
OriginTrace. Պաշտպանություն բովանդակության գողությունից՝ Sanity Context MCP-ի միջոցով
OriginTrace-ը արհեստական բանականության վրա հիմնված նոր գործիք է, որը նախատեսված է ծրագրավորողներին օգնելու բացահայտել և պայքարել բովանդակության գողութ…



