skills/datarobot-data-preparation/SKILL.md
Tools and guidance for data upload, dataset management, data validation, and preparing data for DataRobot projects. Use when uploading datasets, managing data, or validating data for DataRobot.
npx skillsauth add kilo-org/kilo-marketplace datarobot-data-preparationInstall this skill globally with one command. Works with Claude Code, Cursor, and Windsurf.
3 of 9 scanners reported clean
Some scanners were skipped, did not run, or reported a non-clean status. Review each row below.
This skill provides guidance for preparing and managing data in DataRobot, including uploading datasets, validating data quality, and managing dataset versions.
Most common use case: Upload and validate a dataset
upload_dataset(file_path, dataset_name) to upload datavalidate_dataset(dataset_id) to check data qualityget_dataset_schema(dataset_id) to review structureExample: "Upload sales_data.csv and check if it's ready for training"
Use this skill when you need to:
User request: "Upload my sales_data.csv file and check if it's ready for training."
Agent workflow:
User request: "Prepare a prediction dataset based on the training data structure from project abc123."
Agent workflow:
This skill guides you to use the DataRobot Python SDK directly. Install the SDK if needed:
pip install datarobot
Use these DataRobot SDK methods for data management:
Dataset Operations:
dr.Dataset.create_from_file(file_path, name) - Upload datasetdr.Dataset.get(dataset_id) - Get dataset detailsdr.Dataset.list() - List all datasetsdataset.row_count - Get row countdataset.column_count - Get column countDataset Information:
dataset.name - Dataset namedataset.id - Dataset IDdataset.created_at - Creation timestampSee the Common Patterns section below for complete examples.
This skill includes executable helper scripts that the agent can run directly:
scripts/upload_dataset.py - Upload a dataset file to DataRobotUsage example:
# Upload dataset
python scripts/upload_dataset.py sales_data.csv "Sales Data Q4 2024"
The agent can run this script directly or use it as reference when writing code.
import datarobot as dr
import os
# Initialize client
client = dr.Client(
token=os.getenv("DATAROBOT_API_TOKEN"),
endpoint=os.getenv("DATAROBOT_ENDPOINT")
)
# Upload dataset
dataset = dr.Dataset.create_from_file(
file_path="sales_data.csv",
name="Sales Data Q4 2024"
)
print(f"Dataset ID: {dataset.id}")
print(f"Rows: {dataset.row_count}, Columns: {dataset.column_count}")
# Get dataset details
dataset_info = dr.Dataset.get(dataset.id)
print(f"Dataset name: {dataset_info.name}")
print(f"Created: {dataset_info.created_at}")
import datarobot as dr
# List all datasets
datasets = dr.Dataset.list()
print(f"Found {len(datasets)} datasets")
# Search for specific dataset
for dataset in datasets:
if "sales" in dataset.name.lower():
print(f"Found: {dataset.name} (ID: {dataset.id})")
# Get specific dataset
dataset = dr.Dataset.get("abc123")
print(f"Dataset: {dataset.name}")
print(f"Size: {dataset.row_count} rows x {dataset.column_count} columns")
Common checks to perform:
Common errors and solutions:
pip install datarobot
import datarobot as dr
import os
client = dr.Client(
token=os.getenv("DATAROBOT_API_TOKEN"),
endpoint=os.getenv("DATAROBOT_ENDPOINT", "https://app.datarobot.com")
)
development
Oracle Database guidance for SQL, PL/SQL, SQLcl, ORDS, administration, app development, performance, security, migrations, and agent-safe database workflows. Use when the user asks to write, edit, rewrite, review, format, debug, tune, or explain SQL; create or refactor PL/SQL; use SQLcl, Liquibase, ORDS, JDBC, node-oracledb, Python, Java, .NET, or database frameworks; troubleshoot queries, sessions, locks, waits, indexes, optimizer plans, AWR, ASH, migrations, schemas, users, roles, privileges, backup, recovery, Data Guard, RAC, multitenant, containers, monitoring, auditing, encryption, VPD, or safe agent database operations.
documentation
Patterns for reading and writing oleander Iceberg catalog tables in Spark jobs, including naming conventions, write modes, and catalog hierarchy.
data-ai
Integrate Okta for enterprise identity workflows including OIDC login, group claims, and policy-based access controls. Use when implementing workforce or B2B identity scenarios.
documentation
Use when arranging Apache NiFi processors, process groups, ports, comments, numbering, crossing connections, dense fan-in/fan-out, or reusable readable canvas layouts.