pdf analizuje co najmniej jeden dokument PDF i zwraca tekst. Korzysta z natywnej obsługi dokumentów w modelach Anthropic i Google, a w przypadku wszystkich pozostałych dostawców używa awaryjnie wyodrębniania tekstu i obrazów.
Dostępność
Narzędzie jest rejestrowane tylko wtedy, gdy OpenClaw może określić dla agenta model obsługujący pliki PDF. Kolejność określania:agents.defaults.pdfModel(jawnie określony model podstawowy i modele zapasowe)agents.defaults.imageModel(jawnie określony model podstawowy i modele zapasowe)- Model określony dla sesji agenta lub model domyślny, jeśli jego dostawca obsługuje natywne dane wejściowe PDF (Anthropic, Google) albo ma już skonfigurowany model wizyjny
- Automatycznie wykryci dostawcy modeli obsługujących obrazy lub dane wizyjne, z dostępnym uwierzytelnianiem i pierwszeństwem dostawców natywnie obsługujących pliki PDF
provider/model jest uwzględniany tylko wtedy, gdy OpenClaw może uwierzytelnić agenta u tego dostawcy. Jeśli nie uda się określić żadnego dostępnego modelu, narzędzie pdf nie jest udostępniane.
Parametry wejściowe
string
Jedna ścieżka lub adres URL pliku PDF.
string[]
Wiele ścieżek lub adresów URL plików PDF, łącznie maksymalnie 10.
string
domyślnie:"Analyze this PDF document."
Prompt analizy.
string
Filtr stron, na przykład
1-5 lub 1,3,7-9. Nie jest obsługiwany w trybie natywnym dostawcy.string
Hasło do zaszyfrowanych plików PDF. Dotyczy każdego pliku PDF w żądaniu; jest używane tylko w awaryjnym trybie wyodrębniania.
string
Opcjonalne zastąpienie modelu w formacie
provider/model.number
Limit rozmiaru pojedynczego pliku PDF w MB. Domyślnie
agents.defaults.pdfMaxBytesMb albo 10, jeśli wartość nie jest ustawiona.- Wartości
pdfipdfssą scalane i deduplikowane przed wczytaniem; wymagane jest podanie co najmniej jednej z nich. - Wartość
pagesjest interpretowana jako numery stron liczone od 1, deduplikowana, sortowana i ograniczana doagents.defaults.pdfMaxPages(domyślnie20). Zakres, który nie obejmuje żadnych istniejących stron, powoduje błąd przed wywołaniem modelu.
Obsługiwane odwołania do plików PDF
- Ścieżka do pliku lokalnego (w tym z rozwinięciem
~) - Adres URL
file:// - Adres URL
http://lubhttps:// - Zarządzane przez OpenClaw odwołania do danych przychodzących, takie jak
media://inbound/<id>
ftp://) zwracają details.error = "unsupported_pdf_reference". Zdalne adresy URL http(s) są odrzucane, gdy narzędzie działa w piaskownicy. Po włączeniu zasad dostępu do plików ograniczonych do przestrzeni roboczej lokalne ścieżki poza dozwolonymi katalogami głównymi są odrzucane; zarządzane odwołania do danych przychodzących oraz odtwarzane ścieżki w magazynie przychodzących multimediów OpenClaw pozostają dozwolone.
Tryby wykonywania
Tryb natywny dostawcy
Używany w przypadku dostawcówanthropic i google (jedynych dostawców, którzy obecnie deklarują natywną obsługę dokumentów PDF). Surowe bajty każdego pliku PDF trafiają bezpośrednio do interfejsu API dostawcy jako natywny dokument lub osadzona część PDF.
Ograniczenia:
- Parametr
pagesnie jest obsługiwany; jeśli zostanie ustawiony, narzędzie zgłaszapages is not supported with native PDF providers. - Parametr
passwordnie jest obsługiwany; jeśli zostanie ustawiony, narzędzie zgłaszapassword is not supported with native PDF providers. Do zaszyfrowanych plików PDF użyj modelu bez natywnej obsługi.
Awaryjny tryb wyodrębniania
Używany w przypadku wszystkich pozostałych dostawców.- Wyodrębnij tekst z wybranych stron (maksymalnie do
agents.defaults.pdfMaxPages, domyślnie20) za pomocą dołączonego Pluginudocument-extract, który używa pakietuclawpdf(PDFium WebAssembly) do wyodrębniania tekstu i obrazów. - Jeśli wyodrębniony tekst ma mniej niż
200znaków, wyrenderuj te same strony jako obrazy PNG. Łączny budżet renderowania wynosi4,000,000pikseli i jest współdzielony przez wszystkie strony wymagające obrazów (przydzielany proporcjonalnie na każdą pozostałą stronę, a nie osobno dla każdej strony), dlatego strony tekstowe, które zawierają już wystarczającą ilość tekstu, w ogóle nie są renderowane. - Wyślij wyodrębniony tekst (oraz wszystkie wyrenderowane obrazy) wraz z promptem do wybranego modelu.
- Zaszyfrowane pliki PDF są otwierane za pomocą parametru najwyższego poziomu
password. - Jeśli model nie obsługuje obrazów wejściowych i nie można wyodrębnić tekstu, narzędzie zgłasza błąd.
- Jeśli renderowanie obrazów się nie powiedzie, OpenClaw pomija obrazy i kontynuuje z wyodrębnionym tekstem.
- Jeśli model docelowy obsługuje wyłącznie tekst, a podczas wyodrębniania powstały obrazy, OpenClaw pomija obrazy i wysyła tylko tekst.
Konfiguracja
Pełne informacje o polach zawiera Dokumentacja konfiguracji.
Szczegóły danych wyjściowych
Narzędzie zwraca tekst wcontent[0].text, a ustrukturyzowane metadane w details.
Typowe pola details:
model: określone odwołanie do modelu (provider/model)native:truedla trybu natywnego dostawcy,falsedla trybu awaryjnegoattempts: nieudane próby użycia modeli zapasowych poprzedzające powodzenie
- Pojedynczy plik PDF na wejściu:
details.pdf - Wiele plików PDF na wejściu:
details.pdfs[]z wpisamipdf - Metadane przepisywania ścieżek w piaskownicy (gdy ma zastosowanie):
rewrittenFrom
Obsługa błędów
Przykłady
Pojedynczy plik PDF:Powiązane materiały
- Przegląd narzędzi — wszystkie dostępne narzędzia agenta
- Dokumentacja konfiguracji — konfiguracja
pdfMaxBytesMbipdfMaxPages