Poniżej przedstawiono kilka wskazówek dotyczących tworzenia pliku specjalnie dla agentów użytkownika Google;
1) Plik powinien być zgodny z normą dotyczącą wyłączenia robotów.
2) Może zawierać jedną lub więcej reguł zezwalających lub blokujących dostęp określonego robota indeksującego do określonej ścieżki witryny.
3) Webmaster powinien znać prawie wszystkie składnie pliku robots.txt, aby zrozumieć subtelne zachowanie każdej z nich.
4) Witryna nie może mieć więcej niż jeden plik robots.txt.
5) Plik obsługuje zarówno subdomeny (np. http://website.demo.com/robots.txt lub dowolny niestandardowy port, np. (http://demo:8181/robots.txt).
6) Jeśli nie wiesz, lub mając dostęp do folderu głównego witryny to najlepiej dotrzeć do dostawcy usług hostingowych, aby utrzymać plik robots.txt wewnątrz tego samego. W przypadku, gdy nie można uzyskać dostępu do głównej strony internetowej, a następnie użyć meta tagi jako alternatywną metodę blokowania.
7) W pliku robots.txt można umieścić więcej niż jedną dyrektywę grupową lub regułę (wymienioną po jednej w wierszu).
8) Obsługuje tylko znaki ASCII.
9) Grupa zawiera informacje o tym, dla kogo jest przeznaczona (agent użytkownika) i do jakich plików lub katalogów agent nie ma/może mieć dostępu. Dyrektywy są przetwarzane od góry do dołu. Bot internetowy kojarzy się tylko z jednym zestawem reguł, który może być określony oddzielnie lub pojawia się jako pierwszy.
10) Zgodnie z domyślnymi założeniami bot może indeksować dowolny katalog lub stronę za pomocą składni "Disallow:".
11) W dyrektywach użytych w pliku rozróżniana jest wielkość liter, np. Disallow: /one.xml nie ma zastosowania do ONE.xml.
12) Ma zastosowanie do wszystkich domena strony internetowej składająca się z protokół https lub http.
Zazwyczaj agenci użytkownika Bing i Google posługują się określoną grupą dyrektyw, ale domyślnie preferowane są pierwsze, pasujące reguły, ponieważ różne boty wyszukiwarek interpretują dyrektywy w różny sposób.
Sugeruje się również, aby webmasterzy w miarę możliwości unikali stosowania składni crawl-delay w pliku robots.txt, aby skrócić całkowity czas indeksowania przez boty wyszukiwarek.