
Das programmgesteuerte Lesen und Verarbeiten von PDF-Dateien in C# ist eine häufige Anforderung für .NET-Entwickler, die Systeme zur Dokumentenautomatisierung, Datenextraktion und Berichtserstellung entwickeln. Traditionelle PDF-Parsing-Bibliotheken erfordern komplexen Code, um Text zu extrahieren, Formatierungen beizubehalten und Tabellen zu parsen. Sie erzeugen häufig schlechte Ergebnisse bei unregelmäßigen Layouts, falsch ausgerichtetem Inhalt und nicht standardmäßigen Tabellenstrukturen.
Wenn Sie eine einfache, KI-gestützte Möglichkeit suchen, PDFs in C# zu lesen und PDF-Inhalte in andere Formate zu exportieren, ist Spire.Agent.Office eine starke Wahl. Dieses .NET-KI-Agent-SDK steuert PDF-Parsing- und Konvertierungsworkflows mithilfe von Anweisungen in natürlicher Sprache. Es funktioniert ohne Adobe Acrobat oder externe PDF-Software von Drittanbietern.
In diesem Tutorial stellen wir vor, wie Sie KI zum Lesen von PDFs in C# verwenden, mit vollständigen ausführbaren Codebeispielen für:
- Extrahieren von PDF-Inhalten nach TXT
- Konvertieren von PDF in bearbeitbares Word
- Lesen von PDF-Tabellen nach CSV/Excel
- Batchverarbeitung mehrerer PDFs
Warum Spire.Agent.Office gegenüber anderen KI-PDF-Readern wählen?
Das Internet ist voll von generischen KI-PDF-Readern, aber den meisten fehlt es an Entwicklerflexibilität, Unternehmenssicherheit und Genauigkeit beim strukturellen Parsing. Spire.Agent.Office ist ein KI-Dokumentenverarbeitungs-SDK, das für das .NET-Ökosystem entwickelt wurde. Es kombiniert KI-Parsing mit Office-Dokument-APIs. Sie können PDF-, Word-, Excel- und PowerPoint-Dateien lesen, analysieren und konvertieren, indem Sie einfache Prompts in natürlicher Sprache übergeben.
Wichtige Vorteile für das KI-gestützte Lesen von PDFs in C#:
- Developer-First SDK: Entwickelt für nahtlose API-Integration in benutzerdefinierte Apps, CRMs, Automatisierungspipelines und Backend-Systeme
- Genauigkeit strukturierter Daten: Überlegene Tabellen- und Layout-Erhaltung
- Unternehmenssicherheit: Lokale Verarbeitungsoptionen verhindern, dass sensible PDF-Daten an Cloud-Tools von Drittanbietern gelangen
- Multi-Format-Unterstützung: Liest PDFs sowie Office-Dokumente in einem einheitlichen Agenten
- Minimaler Code: Ersetzen Sie Hunderte Zeilen manueller Parsing-Logik durch einfache KI-Prompt-Aufrufe, um die Entwicklung zu beschleunigen.
Einrichtung: Projekt, Namespaces und Token
- 1. Installieren Sie das NuGet-Paket
Erstellen Sie Ihr .NET-Projekt und installieren Sie die Bibliothek; alle Abhängigkeiten werden automatisch installiert.
Install-Package Spire.Agent.Office
- 2. Fügen Sie die Namespaces hinzu
Drei using-Direktiven geben Ihnen alles, was für die KI-PDF-Verarbeitung benötigt wird:
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Pdf;
- 3. Konfigurieren von SpireToken
Spire.Agent.Office erfordert einen gültigen SpireToken-Schlüssel. Sie können hier einen temporären Schlüssel zur Evaluierung anfordern.
AIOptions options = new AIOptions();
options.SpireToken = "YOUR_SPIRE_TOKEN_KEY";
Beispiel 1: PDF-Text mit .NET-KI-Agent extrahieren
Das Extrahieren von reinem Textinhalt ist typischerweise die erste Stufe jeder Dokumentenverarbeitungspipeline. Mit Spire.Agent.Office können Sie PDF-Inhalte parsen und Ergebnisse mithilfe von Anweisungen in natürlicher Sprache direkt in eine TXT-Datei schreiben.
Häufige Anwendungsfälle: Erstellen von Suchindizes, Einspeisen von Dokumenten in nachgelagerte NLP-Pipelines, Audit-Protokollierung und Erkennung von Inhaltsänderungen.
C#-Code: PDF nach TXT
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Pdf;
string inputPath = @"input0.pdf";
string outputPath = @"output.txt";
string key = "YOUR_SPIRE_TOKEN_KEY";
if (!string.IsNullOrEmpty(inputPath) && File.Exists(inputPath))
{
AIOptions options = new AIOptions();
options.SpireToken = key;
using (PdfDocument pdf = new PdfDocument())
{
pdf.LoadFromFile(inputPath);
// Get the AI processor for PDF
AIDocumentProcessor processor = pdf.AI(options);
// Natural language instruction
string instruction = "Read all text content from the PDF file, retain paragraph layout, and save as a TXT file";
// Execute the AI instruction
AIResult result = processor.ExecuteInstruction(pdf, instruction, outputPath);
}
}
Die generierte TXT-Datei behält die Absatzstruktur des PDFs bei. Um reinen Text ohne Absatzformatierung zu extrahieren, ändern Sie die KI-Anweisung nach Bedarf.

Beispiel 2: PDF mit .NET-KI-Agent in bearbeitbares Word konvertieren
Standard-PDFs sind nicht bearbeitbar, was die Überarbeitung und Wiederverwendung von Inhalten erschwert. Spire.Agent.Office KI liest PDF-Layout, Schriftstile und Absatzstruktur und konvertiert statische PDFs in vollständig bearbeitbare DOCX-Dateien, während die Formatierung konsistent bleibt.
Praxisnaher Anwendungsfall: Beschaffungs- oder Rechtsteams erhalten Lieferantenvereinbarungen im PDF-Format und benötigen bearbeitbare DOCX-Dateien für die Überprüfung mit Änderungsverfolgung, das Einfügen von Kommentaren und den Versionsvergleich.
C#-Code: PDF nach Word
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Pdf;
string inputPath = @"supplier_agreement.pdf";
string outputPath = @"supplier_agreement_editable.docx";
string key = "YOUR_SPIRE_TOKEN_KEY";
if (!string.IsNullOrEmpty(inputPath) && File.Exists(inputPath))
{
AIOptions options = new AIOptions();
options.SpireToken = key;
using (PdfDocument pdf = new PdfDocument())
{
pdf.LoadFromFile(inputPath);
// Get the AI processor for PDF
AIDocumentProcessor processor = pdf.AI(options);
// Natural language instruction
string instruction = "Convert this supplier agreement PDF into an editable Word document. " +
"Retain hierarchical clause numbering (1, 1.1, 1.2…), use Word's multilevel list, no hardcoded numbers. " +
"keep section headings in bold, and convert tables to native Word tables at original positions. " +
"Do not flatten the layout into plain paragraphs. Keep signature block formatting intact.";
// Execute the AI instruction
AIResult result = processor.ExecuteInstruction(pdf, instruction, outputPath);
}
}
Wichtige Vorteile
- Beibehaltung der Klauselstruktur: Nummerierte rechtliche Klauseln bleiben für das Redlining ordnungsgemäß strukturiert
- Tabellenerhaltung: Preistabellen und Anhänge bleiben als echte Word-Tabellen erhalten
- Minimaler Code: Eine einzige Anweisung ersetzt das, was traditionell umfangreiche API-Aufrufe an mehrere Komponenten erfordern würde

Beispiel 3: PDF-Tabellen mit .NET-KI-Agent nach CSV/Excel lesen
Eine der leistungsstärksten Funktionen von Spire.Agent.Office ist die Fähigkeit, strukturierte Daten aus PDF-Tabellen zu verstehen und zu extrahieren. Geschäftsszenarien umfassen Kreditorenbuchhaltungs-Automatisierung, Kontoauszugsabstimmung und Verarbeitung von Finanzberichten.
C#-Code: Kontoauszug-PDF nach CSV
Wenn Sie jeden Monat einen PDF-Kontoauszug herunterladen und Transaktionen in Ihre Buchhaltungssoftware importieren müssen, ist dieses Beispiel für Sie.
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Pdf;
string inputPath = @"bank_statement_1.pdf";
string outputPath = @"bank_transactions.csv";
string key = "YOUR_SPIRE_TOKEN_KEY";
if (!string.IsNullOrEmpty(inputPath) && File.Exists(inputPath))
{
AIOptions options = new AIOptions();
options.SpireToken = key;
using (PdfDocument pdf = new PdfDocument())
{
pdf.LoadFromFile(inputPath);
// Get the AI processor for PDF
AIDocumentProcessor processor = pdf.AI(options);
// Natural language instruction
string instruction = "Extract all transactions from this bank statement into a CSV." +
" Include: Transaction Date, Description, Reference Number, Debit Amount, Credit Amount," +
" and Running Balance. Use empty cells (not zeros) when a debit or credit field doesn't apply to a row." +
" Exclude opening balance, closing balance, and any summary totals." +
" Preserve the original transaction order as they appear on the statement.";
// Execute the AI instruction
AIResult result = processor.ExecuteInstruction(pdf, instruction, outputPath);
}
}

C#-Code: Finanzieller PDF-Bericht nach Excel
Um PDF-Tabellen nach Excel zu exportieren, ändern Sie einfach das Ausgabeformat (.xlsx) und passen Sie die Anweisungen an. Wenn Sie beispielsweise einen vierteljährlichen PDF-Bericht mit mehreren Tabellen über Seiten hinweg haben, können Sie alles in eine einzelne Arbeitsmappe mit separaten Tabellenblättern extrahieren:
string inputPath = @"Q3_2024_financial_report.pdf";
string outputPath = @"Q3_2024_financials.xlsx";
string instruction = "This PDF contains multiple financial tables across several pages:" +
" Revenue by Region, Cost of Goods Sold, Operating Expenses, and Cash Flow Summary." +
" Extract each table into its own named worksheet in the output Excel file." +
" Use the table's section heading as the sheet name. Keep column headers on the" +
" first row of each sheet, ensure all currency values are numeric (strip out '{BODY_CONTENT}#39; and ',')," +
" and preserve the original row and column order.";
Beispiel 4: Viele PDFs, eine Anweisung (Batchverarbeitung)
Die meisten realen Automatisierungs-Workloads verarbeiten Stapel von Dokumenten (z. B. Dutzende Rechnungs-PDFs). Verwenden Sie den attachmentPaths-Parameter:
- Instanziieren Sie ein leeres
PdfDocument. - Übergeben Sie Ihre Sammlung von PDF-Dateipfaden über
attachmentPaths. - Schreiben Sie eine Anweisung, die beschreibt, wie Ausgaben kombiniert oder aggregiert werden sollen.
Dieses Muster ermöglicht Anwendungsfälle wie das Konsolidieren vieler Rechnungen in einer einzigen aggregierten Excel-Arbeitsmappe.
C#-Code: Batch-Verarbeitung von PDF-Rechnungen
using Spire.Agent.Office.AI;
using Spire.Agent.Office.Extensions;
using Spire.Pdf;
string[] invoicePaths = Directory.GetFiles(@"F:\Invoices", "*.pdf");
string outputPath = @"consolidated_invoices.xlsx";
string key = "YOUR_SPIRE_TOKEN_KEY";
AIOptions options = new AIOptions();
options.SpireToken = key;
using (PdfDocument pdf = new PdfDocument())
{
// Get the AI processor for PDF
AIDocumentProcessor processor = pdf.AI(options);
// Natural language instruction for batch processing
string instruction = "Read all attached invoice PDFs and consolidate them into one Excel workbook. " +
"Create one row per invoice with columns: Invoice Number, Vendor Name, Invoice Date, " +
"Due Date, Subtotal, Tax, Total Amount. Sort by Invoice Date ascending.";
// Execute with attachment paths
AIResult result = processor.ExecuteInstruction(pdf, instruction, outputPath, invoicePaths);
}
API-Überblick auf einen Blick
| API-Komponente | Zweck | Wichtige Methode/Eigenschaft |
|---|---|---|
AIOptions |
Konfigurationsobjekt |
SpireToken, WorkDir, TimeoutMs
|
AIDocumentProcessor |
Haupt-Einstiegspunkt für die KI-Verarbeitung | ExecuteInstruction() |
pdf.AI(options) |
Erweiterungsmethode für PdfDocument | Gibt AIDocumentProcessor zurück |
AIResult |
Vertrag für das Ausführungsergebnis |
Success, TokenUsage
|
attachmentPaths |
Parameter für unterstützende Dokumente | Wird an ExecuteInstruction() übergeben |
Best Practices für zuverlässige Extraktion
1. Schreiben Sie spezifische Ausgabeanforderungen in die Anweisungen
Vermeiden Sie vage Prompts wie „die Daten extrahieren“. Definieren Sie Zielformat, Spalten und Struktur (z. B. „nach Excel-Arbeitsmappe exportieren, eine Zeile pro Position“).
2. Platzieren Sie Geschäftslogik in den Anweisungen
Implementieren Sie Filterung, Sortierung und Normalisierung innerhalb von Prompts, anstatt Positionsoffsets oder Koordinaten fest zu codieren. Die Logik bleibt für Menschen lesbar und wartbar.
3. Validieren Sie AIResult.Success
Überprüfen Sie den Ausführungsstatus bei jedem Aufruf. Stille Fehler können unbeaufsichtigte Automatisierungspipelines unterbrechen.
if (result == null || !result.Success)
{
throw new InvalidOperationException(
{BODY_CONTENT}quot;AI instruction failed: {result?.ErrorMessage ?? "Unknown error"}");
}
4. Validieren Sie die Ausgabe.
Führen Sie bei Finanz- oder Compliance-Daten Ihre eigenen Prüfungen der erzeugten Datei durch – Zeilenanzahl, Spaltensummen, Schema-Konformität. Der Agent erzeugt das Artefakt; Ihre Pipeline bleibt für die Korrektheit verantwortlich.
Abschließende Gedanken
Die obigen Beispiele zeigen, wie das Spire.Agent.Office SDK KI nutzen kann, um PDF nach TXT zu lesen, PDFs als bearbeitbare Word-Dokumente neu zu erstellen, Kontoauszüge und Finanztabellen in CSV oder Excel zu extrahieren und Stapel von Rechnungen in einer einzigen Arbeitsmappe zu konsolidieren. In jedem Fall bleibt der Code klein, die Anweisungen bleiben lesbar und die Ausgabe bleibt strukturiert genug für die nachgelagerte Automatisierung.
Wenn Ihr Team Zeit mit dem Schreiben fragiler Parsing-Logik oder dem manuellen Nacherfassen von PDF-Daten verbringt, bietet Spire.Agent.Office einen praktischen Weg nach vorn. Installieren Sie das NuGet-Paket, fügen Sie Ihren Token hinzu und beginnen Sie mit einem Workflow. Von dort aus können Sie auf Batchverarbeitung erweitern und Dokumentenautomatisierungspipelines aufbauen, die schneller zu entwickeln, einfacher zu warten und widerstandsfähiger gegenüber realen PDFs sind.
Häufig gestellte Fragen (FAQs)
F: Wie genau ist die Tabellenextraktion?
Spire.Agent.Office verwendet KI-gestütztes Parsing, das Tabellenstrukturen versteht, einschließlich unregelmäßiger Tabellen und verbundener Zellen. Für beste Ergebnisse geben Sie klare Anweisungen zum erwarteten Ausgabeformat.
F: Kann ich passwortgeschützte PDFs verarbeiten?
Ja. Sie können passwortgeschützte PDFs laden, indem Sie beim Aufruf von pdf.LoadFromFile(inputPath, password) das Passwort angeben.
F: Wie gehe ich mit großen Stapeln von PDFs um?
Verwenden Sie den attachmentPaths-Parameter, um mehrere Dateien in einer einzigen Anweisung zu übergeben. Der KI-Agent verarbeitet sie gemeinsam und erzeugt eine konsolidierte Ausgabe.
F: Wie lege ich ein Timeout für die KI-Verarbeitung fest?
Sie können das Timeout mithilfe der TimeoutMs-Eigenschaft in AIOptions konfigurieren:
AIOptions options = new AIOptions();
options.SpireToken = key;
options.TimeoutMs = 120000; // 2 minutes
Weitere Beispiele
- KI-gestütztes Excel-Audit in C#: Fehler und Datenanomalien erkennen
- KI-Dokumentgenerierung: Von Daten zu gebrauchsfertigen Dokumenten
- KI-gestützte Dokumentenschwärzung in C#: Formatierung beibehalten
- KI-Dokumentenübersetzer: Word-, Excel- und PowerPoint-Dateien in C# übersetzen
- Berechnungen in Excel mit einem .NET-KI-Agent automatisieren