skills/standard/office-pdf/SKILL.md
PDF 全文/表格提取、合并拆分、旋转、OCR、水印、简单生成;工作区 run + pypdf/pdfplumber/qpdf/pdftotext
npx skillsauth add sunflowermm/XRK-AGT office-pdfInstall this skill globally with one command. Works with Claude Code, Cursor, and Windsurf.
3 of 9 scanners reported clean
Some scanners were skipped, did not run, or reported a non-clean status. Review each row below.
.pdf:读内容、并/拆、转 txt、扫面 OCR、加水印、元数据、简单生成。
| 任务 | 方式 |
|------|------|
| 读正文 | pdftotext -layout in.pdf out.txt(poppler) |
| 读表格 | Python pdfplumber |
| 合并/拆分/旋转 | qpdf 或 pypdf |
| 扫描 OCR | pdf2image + pytesseract |
| 简单生成 | reportlab |
文件均在 Agent 工作区;用 write 写脚本、run 执行、list_files 验收。
# 合并
from pypdf import PdfReader, PdfWriter
w = PdfWriter()
for f in ["a.pdf", "b.pdf"]:
for p in PdfReader(f).pages: w.add_page(p)
with open("merged.pdf", "wb") as o: w.write(o)
# 表格 → 列表
import pdfplumber
with pdfplumber.open("in.pdf") as pdf:
for page in pdf.pages:
for table in page.extract_tables() or []:
print(table)
pdftotext -layout input.pdf output.txt
qpdf --empty --pages a.pdf b.pdf -- merged.pdf
qpdf input.pdf --pages . 1-3 -- p1-3.pdf
from pdf2image import convert_from_path
import pytesseract
text = []
for i, img in enumerate(convert_from_path("scan.pdf")):
text.append(f"--- Page {i+1} ---\n" + pytesseract.image_to_string(img, lang="chi_sim+eng"))
open("ocr.txt", "w", encoding="utf-8").write("\n".join(text))
需系统 Tesseract 中文包;缺失时先告知用户再装依赖。
office-xlsxoffice-meeting无 run / 无 pypdf / 无 OCR → office-env-setup(用户粘贴、pdftotext、或说明无法处理扫描件)
development
统一回复版式:短、结构化、可复制;减少空话
tools
MCP 工具地图:默认工作流、web_search、何时启用 desktop/browser/memory
development
检索栈:web_search(13 提供商 + parallel-free 免费通道)、web_fetch、与 office-research 分工
data-ai
工作区 Markdown 记忆 + memory 工作流向量记忆的使用边界