فایل Robots.txt یک فایل متنی و مجموعهای از دستورالعملها برای باتهای موتور جستجو است. این فایل بخشی از robots exclusion protocol (REP) بوده و شامل چند استاندارد مختلف درباره نحوه کراول کردن بات های موتور جستجو است. از این فایل معمولا برای مدیریت فعالیت رباتهای کرال کننده استفاده میشود. REP همچنین شامل هدایتگر های متا روبوت، سابدایراکتوری ها(Sub Directory)، دستورهایی مبتنی بر نحوه رفتار بات با لینک های (Follow یا Nofollow) است.
فایل Robots.txt چه کاربردی دارد؟
در هر سایت صفحات مختلفی وجود دارد که اهمیت و ارزش این صفحات با یکدیگر متفاوت است. متخصصین سئو از راههای گوناگونی استفاده میکنند تا ورود رباتها و نوع رفتار آنها در سایت را کنترل کنند. چرا که برخی صفحهها وجود دارند که نیازی نیست تا توسط های گوگل Crawl شده و مورد ارزیابی قرار گیرند. به همین دلیل ما از Robots.txt استفاده میکنیم تا مشخص کنیم چه صفحاتی باید مورد بررسی موتورهای جستجو قرار گیرند.
این فایل را میتوانید یک سری مشخصات رفتاری در نظر بگیرید که در یک محیط عمومی نصب شده تا آن را رعایت کنیم. همانطور که انتظار میرود رباتهای نوع خوب از دستورالعملهای این فایل استفاده میکنند.
در واقع رباتها دو نوع خوب و بد دارند که رباتهای کرال کننده از نوع خوب و همچنین ضروری برای هر وبسایتی هستند. این رباتها صفحات مختلف سایت را برای نمایش در صفحات نتایج موتورهای جستجو کرال میکنند. فایل Robots فعالیت این باتها را مدیریت میکند تا صفحات مفید را کرال و از نمایش صفحاتی که برای نمایش عمومی نیستند، خودداری کنند.
Robots.txt چگونه کار می کند؟
با توجه به فرمتی که این فایل دارد خبری از کدهای HTML نیست. فایل Robots هر سایتی را میتوانید با وارد robots.txt/ بعد از آدرس دامنه آن سایت مشاهده کنید. در حالت عادی این فایل به کاربران نشان داده نمیشود. اما رباتهای موتور جستجو قبل از کرال کردن ابتدا به سراغ این فایل میآیند تا به نوعی دستورالعمل خود را مشاهده کنند.

نکتهای که وجود دارد این است که این فایل برای یک دامنه از است. یعنی اگر سایت شما دامنه زیر مجموعه یا Subdomain دارد هر ساب دامین فایل Robots مختص به خود را دارد.
همچنین در این فایل میتوانید سایت مپ Sitemap را نیز قرار دهید تا رباتها به شکل بهتری سایت شما را کرال کنند. با انجام این کار مطمئن میشوید که تمامی صفحات مهم توسط رباتها بررسی و ایندکس شدهاند.

فایل Robots کجاست؟
برای دسترسی و ویرایش این فایل به هاست سایت خود مراجعه کنید و سپس در قسمت Root میتوانید آن را پیدا کنید.
[* :User-agent] در فایل Robots.txt به چه معناست؟
هر کاربر که در اینترنت فعال است دارای اطلاعاتی مانند نوع مرورگر، موقعیت جغرافیایی، نسخه سیستم عامل و… است. این عبارت [* :User-agent] نیز به وبسایتها کمک میکند تا محتوایی سازگار با سیستم کاربر نشان دهند. ویژگی دیگر [* :User-agent] این است که صاحب سایت بداند که چه نوع رباتهایی به سایت ورود میکنند.
دیگر مقادیری که میتوان برای “User-agent” در موتور جستجو گوگل استفاده کرد، عبارتاند از:
-
- Googlebot برای رباتهای گوگل
- Googlebot-Image برای تصاویر
- Googlebot-News برای خبرها
- Googlebot-Video برای ویدیو
چرا باید از Robots.txt استفاده کنیم؟
- مدیریت ترافیک ایجاد شده از سمت رباتها
- تعیین دسترسی یا عدم دسترسی رباتها به صفحات وبسایت
- مدیریت Crawl Budget
- جلوگیری از انتشار محتوای تکراری (Duplicate Content)

فرمت فایل Robots.txt
در حقیقت این فایل تعیین می کند که آیا باتها میتوانند قسمتهایی از وب سایت را کروال کنند یا خیر. تعیین کردن این امر نیز با دستورهای allowing و disallowing به صورت زیر انجام میشود.
User-agent: [user-agent name]
Disallow: [URL string not to be crawled]
البته این مثال ساده را میتوان کاملتر و اجزای دیگری نیز به آن اضافه کرد. داخل این فایل هر دستور عمل در یک خط به صورت نوشته میشود.
نوشتن فایل Robots.txt
برای ساخت این فایل در ابتدا Note Pad یا یک ویرایشگر متن که فرمت خروجی آن txt است را باز کنید. همچنین فرمت encoding نیز باید UTF-۸ باشد.
۴ تا از مهمترین دستورای Robots.txt
- User-agent : جهت مشخص کردن موتور جستجورگر (Google و Bing و…)
- Disallow : بخشهای غیر مجاز
- Allow : بخشهای مجاز
- Sitemap : جهت مشخص کردن آدرس نقشه سایت
دستور Disallow در فایل Robots.txt چگونه کار میکند؟
رباتها صفحاتی که بعد از Disallow میآیند دسترسی ندارند یا آنها را در موتور جستجو ایندکس نمیکنند. اما این صفحات لزوما پنهان نیستند. فقط نمیخواهیم به صورت عمومی منتشر شوند. همچنین اگر جلوی Disallow چیزی قرار ندهید به این معنی است که ربات میتواند هر چیزی که در یک سایت وجود دارد را ایندکس کند.
مسدود کردن یک فایل یا یک صفحه خاص
برای مثال اگر بخواهیم صفحهای کرال و ایندکس نشود میتوانیم لینک آن صفحه را در دستور Disallow قرار دهیم. پس از آن دیگر ربات این صفحه یا فایل مورد نظر ما را در نتایج گوگل نشان نمیدهد.
پنهان کردن کل سایت از رباتها
قرار دادن “/” در جلوی Disallow به این معناست که هیچ محتوایی را از سایت مورد نظر در موتورهای جستجو نشان ندهد. بعنی با قرار دادن یک اسلش کل سایت از صفحات نتایج موتور جستجو حذف میشود.
تاخیر در کرال کردن سایت
با استفاده از دستور “Crawl-Delay” در فایل Robots.txt میتوانید تعیین کنید که محتوای منتشر شده در وبسایت شما بعد گذشت چه مدتی توسط رباتها کرال و بررسی شود. اما این دستور در موتور جستجو گوگل کار نمیکند و باید از طریق سرویس سرچ کنسول اقدام کنید.
استفاده از دستور Allow
این دستور به این معناست که فقط صفحات و فایلهایی که در این دستور قرار میگیرند، توسط باتها کرال شوند و دیگر محتوا ایندکس نشوند.
نکات قابل توجه
- برای پیدا شدن باید در بالاترین دایرکتوری سایت قرار داده شود.
- نام فایل نباید کوچکترین تغییری کند و دقیقا robots.txt می باشد.
- برخی بات ها ممکن است این فایل را در کل نادیده بگیرند.
- این فایل عمومی است کافیست در انتهای هر دامینی آن را با اسلش وارد کنید
- هر روت دامین و ساب دامین باید فایل مخصوص به خود را داشته باشند و نمی توان از یک فایل برای هر دو استفاده کرد.
جمعبندی
در این مقاله با فایل Robots.txt و کاربرد آن آشنا شدیم. همچنین نحوه کار با آن را یاد گرفتیم. استفاده درست و بهینه از این فایل میتواند به بهینهسازی و عملکرد بهتر سایت شما کمک کند. همچنین میتوانید ظرفیت کرال باجت سایت خود را مدیریت کنید تا نتیجه بهتری بگیرید. امیدوارم که اطلاعات مفید و کمک کنندهای را در این مقاله به شما ارائه کرده باشم.
مطالب پیشنهادی »
تفاوتهای لینک فالو و نوفالو چیست؟
آشنایی کامل با الگوریتمهای گوگل
