lockไฟล์จะไม่ถูกส่งไปยังเซิร์ฟเวอร์
สร้างไฟล์ robots.txt ฟรี กำหนด User-agent, Allow, Disallow และ Sitemap เพื่อคุมการเก็บข้อมูลของบอทค้นหาได้แม่นยำ
วิธีใช้งานสร้าง robots.txt?
- เลือก user agent (โรบอต)
- ตั้งค่ากฎเส้นทาง Allow และ Disallow
- เพิ่ม URL ของ Sitemap และคัดลอก robots.txt ที่สร้างขึ้น
คำถามที่พบบ่อยเกี่ยวกับสร้าง robots.txt
robots.txt คืออะไร?
robots.txt เป็นไฟล์ข้อความที่วางไว้ที่รากของเว็บไซต์เพื่อบอกโรบอตค้นหาว่าหน้าใดควรรวบรวมข้อมูลหรือข้ามไป
robots.txt สามารถซ่อนหน้าเว็บจากผลการค้นหาได้อย่างสมบูรณ์หรือไม่?
ไม่ robots.txt ควบคุมเฉพาะการรวบรวมข้อมูล หน้าเว็บอาจยังปรากฏในผลค้นหาหากมีลิงก์จากเว็บอื่น ใช้แท็ก meta noindex เพื่อลบออกอย่างสมบูรณ์
จะห้ามบ็อต AI นำเว็บของฉันไปใช้ฝึกโมเดลได้อย่างไร?
ในไฟล์ robots.txt ให้ระบุชื่อบ็อตที่แต่ละบริษัทประกาศไว้ เช่น GPTBot, ClaudeBot, PerplexityBot แล้วตั้ง Disallow ให้บ็อตเหล่านั้น แนวทางที่ใหม่กว่าคือ Content-Signal ซึ่งประกาศสิทธิ์ตามวัตถุประสงค์ได้ในบรรทัดเดียว เช่น search=yes, ai-train=no แต่พึงจำว่า robots.txt เป็นเพียงคำร้องขอที่บ็อตซึ่งยินยอมปฏิบัติตามเท่านั้นจะเคารพ ไม่ใช่การปิดกั้นเชิงเทคนิค สิ่งที่ห้ามถูกนำไปจริง ๆ จึงควรอยู่หลังระบบล็อกอิน
เขียน robots.txt ผิดจะทำให้ทั้งเว็บหายจากผลค้นหาได้ไหม?
ได้ เพียงบรรทัดเดียวที่เขียนว่า Disallow: / ก็ตัดทั้งเว็บออกจากการรวบรวมข้อมูล การนำไฟล์ robots.txt ของเซิร์ฟเวอร์ทดสอบขึ้นเว็บจริงโดยลืมลบบรรทัดนั้นเป็นอุบัติเหตุที่เกิดขึ้นบ่อยจริง ๆ ให้เปิด robots.txt ด้วยเบราว์เซอร์ทันทีหลังการปรับใช้ทุกครั้ง และนำหน้าสำคัญ ๆ ไปตรวจกับเครื่องมือทดสอบ robots.txt ใน Google Search Console เพราะการกู้กลับหลังหลุดจากดัชนีต้องใช้เวลาหลายวันถึงหลายสัปดาห์ แม้จะแก้ไฟล์แล้วก็ตาม
วิธีใช้สร้าง robots.txtให้เกิดประโยชน์สูงสุด?
- robots.txt กันได้แค่การรวบรวมข้อมูล ถ้าจะเอาออกจากผลค้นหาต้องใช้เมตาแท็ก noindex
- แยกกฎตาม User-agent ได้ เช่น ตั้งค่าให้ GPTBot ต่างจาก Googlebot
- ปิดท้ายไฟล์ด้วยบรรทัด Sitemap: https://... แบบ URL เต็มเพื่อให้เก็บข้อมูลเร็วขึ้น
Powered by Patrache Studio Tools