Technical Architecture Overview

How Prefiler processes financial data: deterministic parsing, hybrid intelligence, and structured risk scoring.

Prefiler — Product Summary

  • Category: AI accounting intelligence platform
  • Primary users: Accountants, CPAs, chartered accountants, tax professionals
  • Core function: Analyse financial data before tax filing
  • Key capabilities: Transaction classification, risk detection, clarification questions, financial summaries
  • Risk scoring: Deterministic, rule-based, materiality-weighted, version-controlled
  • AI model: Used for narrative generation only — architecturally separated from scoring
  • Data handling: Ephemeral processing, no permanent raw document storage
  • Bank support: Profile-driven parsing for HDFC, SBI, ICICI, Axis, Kotak, PNB, Yes Bank, and more

System Architecture

  • Hybrid intelligence model: deterministic rule engine + heuristic pattern detection + LLM reasoning layer
  • Strict output enforcement: all AI responses conform to JSON schema and pass validation before rendering
  • Deterministic risk scoring: materiality-weighted, version-controlled framework producing reproducible results
  • Architectural separation: AI-generated narratives are structurally separated from deterministic scoring outputs
  • Output validation pipeline: schema validation → confidence scoring → risk factor extraction → rendering

Document Extraction Pipeline

  • Profile-driven deterministic parsing for digitally generated PDFs across major Indian banks
  • Structured bank layout profiles: column patterns, date formats, polarity conventions, footer filtering
  • Universal header matching: three-tier strategy (exact → starts-with → keyword) for column detection
  • Vision AI fallback for scanned documents lacking text-layer content
  • Integer cents arithmetic for reconciliation: eliminates floating-point precision errors
  • Reconciliation verification: computed closing balance checked against statement closing balance

Transaction Classification

  • Heuristic pattern detection: narration text analysis for transaction type identification (UPI, NEFT, IMPS, cheque)
  • Category mapping: income, expenses, transfers, loan transactions, investment activity, regulatory payments
  • Confidence scoring: each classification includes a confidence percentage
  • Ambiguity handling: structured clarification questions surfaced when classification confidence is low

Risk Scoring Engine

  • Deterministic, rule-based framework with materiality weighting
  • Scoring dimensions: transaction concentration, regulatory thresholds, cross-category patterns, data consistency
  • Non-linear materiality scaling with effective turnover
  • Multi-signal escalation logic for compound risk indicators
  • Version-controlled methodology: every analysis records the framework version used
  • Explainability: every risk score is traceable to specific triggered rules and thresholds

Data Governance

  • Ephemeral document processing: raw bank statements are not permanently stored
  • Derived metadata only: transaction classifications, risk scores, and summaries are retained
  • Sensitive field masking in logs
  • Row-level security (RLS) enforcement at the database level
  • Firm-scoped data isolation for multi-tenant deployments
  • Role-based access control: Partner, Senior CA, Junior with corresponding permissions

Audit & Quality Infrastructure

  • Audit trail: operation logging with timestamps and user attribution
  • Reasoning trace logging for explainability review
  • Benchmark testing: classification accuracy measurement against human-reviewed samples
  • Extraction telemetry: parse confidence, reconciliation status, processing timings
  • LLM model and prompt version tracking per analysis

Related Resources

Technical Questions?

Contact us for a technical walkthrough or architecture discussion.

Contact Technical Team