Ինչպես մենք չափեցինք գովազդային խոստումները կանոնավոր արտահայտություններով և ինչու առաջին արտահանումը սխալվեց կրկնակի

Հոդվածի հեղինակները կիսվում են ֆրանչայզ վաճառող էջերի վերլուծության համար տվյալների հավաքագրման իրենց փորձով: Քանի որ այս ոլորտում պատրաստի տվյալների բազաներ չկային, թիմը մշակեց սեփական սկրիպտը, որն օգտագործում է կանոնավոր արտահայտություններ (regex) վեբ էջերում հիմնական հատկանիշները գտնելու համար: Այնուամենայնիվ, տվյալների հավաքագրման առաջին փորձը ոչ ճշգրիտ էր. ձեռքով ստուգումը ցույց տվեց, որ սկրիպտը որոշ ցուցանիշների գծով սխալվել է ավելի քան երկու անգամ: Նյութում մանրամասն վերլուծվում են այն պատճառները, թե ինչու կանոնավոր արտահայտությունները կարող են գտնել տեքստային ձևական համապատասխանություն, բայց բաց թողնել դրա իրական իմաստը: Հեղինակները քննարկում են այս մոտեցման սահմանափակումները և առաջարկում են տվյալների պարսինգի օպտիմալացման ռազմավարություններ այն դեպքերի համար, երբ կանոնավոր արտահայտություններից ամբողջությամբ հրաժարվելը հնարավոր չէ: Հոդվածը օգտակար կլինի տվյալների հետ աշխատող մասնագետների համար:
This is a summary. Read the full article at the original source:
HabrԿապակցված
dbtcharts-ի թիմը ներկայացրել է տվյալների վիզուալիզացիայի նոր մոտեցում, որը հատուկ նախագծված է զրուցային ինտերֆեյսների համար: Քանի որ LLM-ները և չաթի վ…
Ես նկարագրեցի 1245 աղյուսակ LLM-ի միջոցով, և որոնման արդյունավետությունը վատթարացավ
Ծրագրավորող Աշիշ Սինհան վերլուծել է տվյալների բազայի սխեմաների համար LLM-ի միջոցով նկարագրական մետատվյալներ ստեղծելու անսպասելի բացասական հետևանքները:…
Ծրագրավորող Ֆելիպե Գամբետա դե Սոուզան ներկայացրել է «Open Economics» նախագիծը՝ բաց կոդով հարթակ, որը նախատեսված է Բրազիլիայի մասնատված պաշտոնական տնտե…



