آموزش دستورالعمل‌های فایل Robots.txt


تاریخ : update ۰۵ آبان ۱۴۰۳
access_alarms زمان مطالعه: 5 دقیقه
Robots.txt File

فایل Robots.txt یک فایل متنی و مجموعه‌ای از دستورالعمل‌ها برای بات‌های موتور جستجو است. این فایل بخشی از robots exclusion protocol (REP) بوده و شامل چند استاندارد مختلف درباره نحوه کراول کردن بات های موتور جستجو است. از این فایل معمولا برای مدیریت فعالیت ربات‌های کرال کننده استفاده می‌شود. REP همچنین شامل هدایتگر های متا روبوت، سابدایراکتوری ها(Sub Directory)، دستورهایی مبتنی بر نحوه رفتار بات با لینک های (Follow یا Nofollow) است.

فایل Robots.txt چه کاربردی دارد؟

در هر سایت صفحات مختلفی وجود دارد که اهمیت و ارزش این صفحات با یکدیگر متفاوت است. متخصصین سئو از راه‌های گوناگونی استفاده می‌کنند تا ورود ربات‌ها و نوع رفتار آن‌ها در سایت را کنترل کنند. چرا که برخی صفحه‌ها وجود دارند که نیازی نیست تا توسط ‌های گوگل Crawl شده و مورد ارزیابی قرار گیرند. به همین دلیل ما از Robots.txt استفاده می‌کنیم تا مشخص کنیم چه صفحاتی باید مورد بررسی موتورهای جستجو قرار گیرند.

این فایل را می‌توانید یک سری مشخصات رفتاری در نظر بگیرید که در یک محیط عمومی نصب شده تا آن را رعایت کنیم. همانطور که انتظار می‌رود ربات‌های نوع خوب از دستورالعمل‌های این فایل استفاده می‌کنند.

در واقع ربات‌ها دو نوع خوب و بد دارند که ربات‌های کرال کننده از نوع خوب و همچنین ضروری برای هر وب‌سایتی هستند. این ربات‌ها صفحات مختلف سایت را برای نمایش در صفحات نتایج موتورهای جستجو کرال می‌کنند. فایل Robots فعالیت این بات‌ها را مدیریت می‌کند تا صفحات مفید را کرال و از نمایش صفحاتی که برای نمایش عمومی نیستند، خودداری کنند.

Robots.txt چگونه کار می کند؟

با توجه به فرمتی که این فایل دارد خبری از کدهای HTML نیست. فایل Robots هر سایتی را می‌توانید با وارد robots.txt/ بعد از آدرس دامنه آن سایت مشاهده کنید. در حالت عادی این فایل به کاربران نشان داده نمی‌شود. اما ربات‌های موتور جستجو قبل از کرال کردن ابتدا به سراغ این فایل می‌آیند تا به نوعی دستورالعمل خود را مشاهده کنند.

فایل robots.txt

نکته‌ای که وجود دارد این است که این فایل برای یک دامنه از است. یعنی اگر سایت شما دامنه زیر مجموعه یا Subdomain دارد هر ساب دامین فایل Robots مختص به خود را دارد.

همچنین در این فایل می‌توانید سایت مپ Sitemap را نیز قرار دهید تا ربات‌ها به شکل بهتری سایت شما را کرال کنند. با انجام این کار مطمئن می‌شوید که تمامی صفحات مهم توسط ربات‌ها بررسی و ایندکس شده‌اند.

فایل robots.txt چیست و چه کاربردی دارد؟

فایل Robots کجاست؟

برای دسترسی و ویرایش این فایل به هاست سایت خود مراجعه کنید و سپس در قسمت Root می‌توانید آن را پیدا کنید.

[* :User-agent] در فایل Robots.txt به چه معناست؟

هر کاربر که در اینترنت فعال است دارای اطلاعاتی مانند نوع مرورگر، موقعیت جغرافیایی، نسخه سیستم عامل و… است. این عبارت [* :User-agent] نیز به وبسایت‌ها کمک می‌کند تا محتوایی سازگار با سیستم کاربر نشان دهند. ویژگی دیگر [* :User-agent] این است که صاحب سایت بداند که چه نوع ربات‌هایی به سایت ورود می‌کنند.

دیگر مقادیری که می‌توان برای “User-agent” در موتور جستجو گوگل استفاده کرد، عبارت‌اند از:

    • Googlebot برای ربات‌های گوگل
    • Googlebot-Image برای تصاویر
  • Googlebot-News برای خبرها
  • Googlebot-Video برای ویدیو

چرا باید از Robots.txt استفاده کنیم؟

  • مدیریت ترافیک ایجاد شده از سمت ربات‌ها
  • تعیین دسترسی یا عدم دسترسی ربات‌ها به صفحات وب‌سایت
  • مدیریت Crawl Budget
  • جلوگیری از انتشار محتوای تکراری (Duplicate Content)

فایل Robots.txt چیست؟

فرمت فایل Robots.txt

در حقیقت این فایل تعیین می کند که آیا بات‌ها می‌توانند قسمت‌هایی از وب سایت را کروال کنند یا خیر. تعیین کردن این امر نیز با دستورهای allowing و disallowing به صورت زیر انجام می‌شود.

User-agent: [user-agent name]

Disallow: [URL string not to be crawled]

البته این مثال ساده را می‌توان کامل‌تر و اجزای دیگری نیز به آن اضافه کرد. داخل این فایل هر دستور عمل در یک خط به صورت نوشته می‌شود.

نوشتن فایل Robots.txt

برای ساخت این فایل در ابتدا Note Pad یا یک ویرایشگر متن که فرمت خروجی آن txt است را باز کنید. همچنین فرمت encoding نیز باید UTF-۸ باشد.

۴ تا از مهم‌ترین دستورای Robots.txt

  • User-agent : جهت مشخص کردن موتور جستجورگر (Google و Bing و…)
  • Disallow : بخش‌های غیر مجاز
  • Allow : بخش‌های مجاز
  • Sitemap : جهت مشخص کردن آدرس نقشه سایت

دستور Disallow در فایل Robots.txt چگونه کار می‌کند؟

ربات‌ها صفحاتی که بعد از Disallow می‌آیند دسترسی ندارند یا آن‌ها را در موتور جستجو ایندکس نمی‌کنند. اما این صفحات لزوما پنهان نیستند. فقط نمی‌خواهیم به صورت عمومی منتشر شوند. همچنین اگر جلوی Disallow چیزی قرار ندهید به این معنی است که ربات می‌تواند هر چیزی که در یک سایت وجود دارد را ایندکس کند.

مسدود کردن یک فایل یا یک صفحه خاص

برای مثال اگر بخواهیم صفحه‌ای کرال و ایندکس نشود می‌توانیم لینک آن صفحه را در دستور Disallow قرار دهیم. پس از آن دیگر ربات این صفحه یا فایل مورد نظر ما را در نتایج گوگل نشان نمی‌دهد.

پنهان کردن کل سایت از ربات‌ها

قرار دادن “/” در جلوی Disallow به این معناست که هیچ محتوایی را از سایت مورد نظر در موتورهای جستجو نشان ندهد. بعنی با قرار دادن یک اسلش کل سایت از صفحات نتایج موتور جستجو حذف می‌شود.

تاخیر در کرال کردن سایت

با استفاده از دستور “Crawl-Delay” در فایل Robots.txt می‌توانید تعیین کنید که محتوای منتشر شده در وب‌سایت شما بعد گذشت چه مدتی توسط ربات‌ها کرال و بررسی شود. اما این دستور در موتور جستجو گوگل کار نمی‌کند و باید از طریق سرویس سرچ کنسول اقدام کنید.

استفاده از دستور Allow

این دستور به این معناست که فقط صفحات و فایل‌هایی که در این دستور قرار می‌گیرند، توسط بات‌ها کرال شوند و دیگر محتوا ایندکس نشوند.

نکات قابل توجه

  • برای پیدا شدن باید در بالاترین دایرکتوری سایت قرار داده شود.
  • نام فایل نباید کوچکترین تغییری کند و دقیقا robots.txt می باشد.
  • برخی بات ها ممکن است این فایل را در کل نادیده بگیرند.
  • این فایل عمومی است کافیست در انتهای هر دامینی آن را با اسلش وارد کنید
  • هر روت دامین و ساب دامین باید فایل مخصوص به خود را داشته باشند و نمی توان از یک فایل برای هر دو استفاده کرد.

جمع‌بندی

در این مقاله با فایل Robots.txt و کاربرد آن آشنا شدیم. همچنین نحوه کار با آن را یاد گرفتیم. استفاده درست و بهینه از این فایل می‌تواند به بهینه‌سازی و عملکرد بهتر سایت شما کمک کند. همچنین می‌توانید ظرفیت کرال باجت سایت خود را مدیریت کنید تا نتیجه بهتری بگیرید. امیدوارم که اطلاعات مفید و کمک کننده‌ای را در این مقاله به شما ارائه کرده باشم.


مطالب پیشنهادی »

تفاوت‌های لینک فالو و نوفالو چیست؟

آشنایی کامل با الگوریتم‌های گوگل

این مطلب برای شما مفید بود ؟
5/5 - (2 امتیاز)
edit نویسنده : امیر افشاری کاوه
امیر افشاری
داستان آشنایی من با کسب و کارهای دیجیتال و دنیای وب به سال 96 برمی‌گرده. از اون سال تجربیات مختلفی رو در این مسیر به دست آوردم. اینجام تا اطلاعات مفیدی که به شما کمک می‌کنه رو به اشتراک بذارم.
priority_high سوالات متداول

  • keyboard_arrow_down فایل Robots.txt چیست؟

    این فایل برای ایجاد دسترسی و محدود کردن ربات های گوگل و سایر موتورهای جستجوگر به کار می رود.

  • keyboard_arrow_down چرا از فایل Robots استفاده می کنیم؟

    بعضی از صفحات سایت ما هستند که به دلایل مختلف تمایل به ثبت آنها در موتورهای جستجو نداریم. با کمک این فایل این موضوع را برای ربات های گوگل مشخص می کنیم.

  • keyboard_arrow_down چرا این فایل اهمیت زیادی دارد؟

    با کمک این فایل ما امکان مدیریت Crawl Budget را داریم، همچنین می توانیم ترافیک مصرفی ربات ها را کنترل کرده و مهمتر از همه دسترسی یا عدم دسترسی ربات ها را به صفحات وب مشخص می کنیم.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مشاوره رایگان phone_in_talk ۰۲۱ ۲۲۹۲۴۶۸۵