Skip to main content

Universal Document Processing (UDP)

Universal Document Processing (UDP)

Overview

The Universal Document Processing (UDP) is an intelligent automation solution designed to handle document processing from start to finish.  It's built as a bundle of connected automation processes that work together to read documents, determine what type of documents they are, extract the important information from them, and deliver that data to the business systems. When ML cannot process a document with sufficient confidence, the system routes it to human experts (Subject Matter Experts - SMEs) for review. UDP is capable to handle virtually any document type due to its built-in intelligence that learns and improves over time. automatically reads, understands, and extracts information from your documents. 

Automation Processes Bundle

UDP operates as a coordinated bundle of seven specialized automation processes, each with distinct responsibilities and configuration parameters:

1. [UDP] 1. Data Intake 

  • Purpose: Document ingestion and initialization

  • Configuration: Local execution enabled 

  • Responsibilities:

    • Document validation and sanitization

    • Transaction record creation

    • Document locking and conflict prevention

    • Initial metadata extraction

  • Key Metric: Zero orphaned transactions (as per system updates)

2. [UDP] 2. Classification 

  • Purpose: Document type identification via ML

  • Configuration:

    • Local execution enabled

    • Batch processing: splitSize=5, splitCapacity=30, maxSplitSize=20

  • Process Flow:

    1. HOCR conversion via Auto-OCR

    2. ML classification with confidence scoring

    3. Threshold evaluation (configurable confidence levels)

    4. Routing decision: ML_SUCCESS → IE, ML_LOW_CONFIDENCE → Human Classification

  • Error Codes: UDP_008 (no categories), UDP_009 (invalid config)

3. [UDP] 3. Human Classification 

  • Purpose: Human intervention for classification failures

  • Configuration:

    • Enhanced human task management: taskTimeout=60 (minutes)

    • Batch optimization: splitSize=5, splitCapacity=30, maxSplitSize=20

  • User Experience:

    • Document preview with ML suggestions

    • Category selection from UDP_CATEGORIES

    • Exceptional flow initiation (UDP_1000-UDP_1005)

  • Outcomes:

    • Correct classification → Proceed to IE

    • Exceptional flow → Error Handling

    • Score=1 after correction → Automatic progression

4. [UDP] 4. IE 

  • Purpose: Machine Learning-based data extraction

  • Configuration: Optimized batch processing parameters

  • Capabilities:

    • Category-specific extraction models

    • JSON data structure generation

    • Automatic data validation

  • Routing Logic:

    • Valid data → Data Submission

    • Invalid data → Human IE

    • Validation failures → Document type validation checks

5. [UDP] 5. Human IE 

  • Purpose: Human correction of extraction failures

  • Workflow:

    • Display extracted data with visual document alignment

    • Manual correction interface

    • Exceptional flow initiation capability

  • Integration: Direct feedback loop to ML training systems

6. [UDP] 6. Data Submission 

  • Purpose: Final data delivery and process completion

  • Execution: Local mode enabled

  • Functions:

    • JSON data validation and transformation

    • Downstream system integration

    • Transaction completion and cleanup

    • Audit trail generation

  • Final StatesCOMPLETED, ABORTED (with error context)

7. [UDP] 7. Exception Processing

  • Purpose: Centralized exception management

  • Configuration: Local execution with state persistence

  • Advanced Features (per system updates):

    • Automatic Routing: UDP_1001, UDP_1002, UDP_1004 → ABORTED

    • Status Validation: New transaction status verification

    • Category IntegrationCLASSIFICATION_COMPLETED → category verification

    • Message Handling: Custom explanations (UDP_1005) vs. defaults (UDP_1000)

  • SME Interface:

    • Document review with full context

    • Error code assignment

    • Category correction with training feedback (cl_result)

    • Status transition management