If this is violating any copyright or something, just email me at
niraj @<this website>rather than sending a DMCA.By the way, these are mostly links and metadata. So DMCA shouldn't apply in the first place.
Sourced from: Proceedings of the VLDB Endowment
I LOVE VLDB.
There may or may not be
an actively maintained archive
of it on some nfs server
in case we lose access to the papers for some reason...
PVLDB Papers
Titles and PDF links for Proceedings of the VLDB Endowment, volumes 20 down to 1.
Volume 20
https://www.vldb.org/pvldb/volumes/20/
No papers listed for this volume.
Volume 19
https://www.vldb.org/pvldb/volumes/19/
- Front Matter
- FlatStor: An Efficient Embedded-Index Based Columnar Data Layout for Multimodal Data Workloads
- TIMEST: Temporal Information Motif Estimator Using Sampling Trees
- ConANN: Conformal Approximate Nearest Neighbor Search
- RayDB: Building Databases with Ray Tracing Cores
- NeutronCloud: Resource-Aware Distributed GNN Training in Fluctuating Cloud Environments
- CLaP - State Detection from Time Series
- Front Matter
- ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
- MS-Index: Fast Top-k Subsequence Search for Multivariate Time Series under Euclidean Distance
- Doppio: Communication-Efficient and Secure Multi-Party Shuffle Differential Privacy
- Effective Durable Community Search in Large Temporal Graph
- Terabyte-Scale Analytics in the Blink of an Eye
- APEROL: Adaptive Parallel Edge-to-Cloud Runtime Optimization for Layered Workflow Execution
- MH-GIN: Multi-scale Heterogeneous Graph-based Imputation Network for AIS Data
- An Experimental Evaluation of Hybrid Querying on Vectors
- Unveiling Challenges for LLMs in Enterprise Data Engineering
- Incremental Stream Query Deployment under Continuous Infrastructure Changes in the Cloud-Edge Continuum
- Garnet: A Next-Generation Cache-Store for Accelerating Applications and Services
- AGIS: Fast Approximate Graph Pattern Mining with Structure-Informed Sampling
- Efficient Query Repair for Aggregate Constraints
- FairDAG: Consensus Fairness over Multi-Proposer Causal Design
- Blaze: Compiling JSON Schema for 10x Faster Validation
- Front Matter
- SQL-Factory: A Multi-Agent Framework for High-Quality and Large-Scale SQL Generation
- Meerkat: Scalable, Network-Aware Failure Recovery for the Internet of Things
- GPU Acceleration of SQL Analytics on Compressed Data
- Tux: Efficient Drop-in Networking for Database Systems
- Hybrid Mixed Integer Linear Programming for Large-Scale Join Order Optimisation
- FlowLog: Efficient and Extensible Datalog via Incrementality
- Resilience-Aware Elastic Scaling for Cloud-Native Online DL Training on Multi-Tenant GPU Clusters
- QStore: Quantization-Aware Compressed Model Storage
- RED-ANNS: A RDMA-Enabled Distributed Framework for Graph-Based Approximate Nearest Neighbor Search
- TATA: An Efficient Framework for Task Transfer in Query Plan Representation
- LEAD: Iterative Data Selection for Efficient LLM Instruction Tuning
- Morphing-based Compression for Data-centric ML Pipelines
- Optimal Approximate Matrix Multiplication over Sliding Windows
- Aquila: A High-Concurrency System for Incremental Graph Query
- Vodka: Rethink Benchmarking Philosophy in HTAP Systems
- A Topology-Aware Localized Update Strategy for Graph-Based ANN Index
- Streaming Validation of JSON Documents Against Schemas
- Global Hash Tables Strike Back! An Analysis of Parallel GROUP BY Aggregation
- Front Matter
- PILOT-C: Physics-Informed Low-Distortion Optimal Trajectory Compression
- Demystifying and Improving Lazy Promotion in Cache Eviction
- Fast Verification of Strong Database Isolation
- Scalable Approximate Biclique Counting over Large Bipartite Graphs
- DOT: Dynamic Knob Selection and Online Sampling for Automated Database Tuning
- Chipmink: Efficient Delta Identification for Massive Object Graphs
- Elastic Index Selection for Label-Hybrid AKNN Search
- Eureka: Enabling Fine-Grained Access and Range Queries on Compressed Scientific Data via Data-Index Co-Compression
- TRIM: An Efficient Framework for Exact Eccentricity Computation on Large-Scale Graphs
- Schuyler: Self-Supervised Clustering of Tables in Relational Databases
- Fault Lines: Benchmarking the Impact of Label Data Quality on ML Robustness and Fairness
- Shard: A Scalable and Resize-optimized Hash Index on Disaggregated Memory
- Efficient Partition-based Approaches for Diversified Top-k Subgraph Matching
- SafeLoad: Efficient Admission Control Framework for Identifying Memory-Overloading Queries in Cloud Data Warehouses
- Efficient Temporal Edge-Core Maintenance in Streaming Graphs
- A Workload-Aware Encrypted Index for Efficient Privacy-Preserving Range Queries
- Augmenting Social Influence of Uncertain Seeds via Probabilistic Link Insertion
- Index Intersection for High-Dimensional Range Queries
- CounterSnake: A lossless and generalized compression framework for diverse sketches
- Front Matter
- LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning
- Highly-Efficient Large-Scale k-means with Individual Fairness
- Terark-DS: A High-Performance and Storage-Efficient Key-Value Separation Storage Engine on Disaggregated Storage
- LiBox: A Learned Index as an Array to Minimize Last-Mile Search
- DeXOR: Enabling XOR in Decimal Space for Streaming Lossless Compression of Floating-point Data
- Understanding Evolving Graph Structures for Large Discrete-Time Dynamic Graph Representation
- Scalable Grid-based Computation of Kendall's Tau Correlation
- Towards Efficient Random-Order Enumeration for Join Queries
- Ken: An Execution Engine for Unstructured Database Systems
- Learned Static Function Data Structures
- Pervasive Annotation Errors Break Text-to-SQL Benchmarks and Leaderboards
- Libra: One-Shot Parameter Sensitivity Estimation for Transfer Learning in Database Performance Prediction
- ArceKV: Towards Workload-driven LSM-compactions for Key-Value Store Under Dynamic Workloads
- Revisiting Task-Oriented Dataset Search in the Era of Large Language Models: Challenges, Benchmark, and Solution
- SHARP: Shared State Reduction for Efficient Matching of Sequential Patterns
- NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions
- RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference
- On Fair Epsilon Net and Geometric Hitting Set
- ORBITFLOW: SLO-Aware Long-Context LLM Serving with Fine-Grained KV Cache Reconfiguration
- Abacus: A Cost-Based Optimizer for Semantic Operator Systems
- SVFusion: A CPU-GPU Co-Processing Architecture for Large-Scale Real-Time Vector Search
- Front Matter
- LIO: A lightweight and interpretable query optimizer based on an evolutionary forest
- Automated Tensor-Relational Decomposition for Large-Scale Sparse Tensor Computation
- Sample-based Distinct Cardinality Estimation for Multiple Attributes in Multi-Dataset Queries
- SACK: Shielding Dynamic Attribute-based Access Control in Persistent Key-Value Stores
- Breaking the Isolation-Freshness Trade-off: Joint Adaptive Storage Optimization for HTAP Systems
- Bifrost: A Much Simpler Secure Two-Party Data Join Protocol for Secure Data Analytics
- Efficient Temporal Subgraph Management: A New Interval Index
- Efficient GNN Training on Giant Graphs with Collective Batching and Scheduling
- Dinkel: State-Aware and Granular Framework for Validating Graph Databases
- Repairing Property Graphs under PG-Constraints
- A Semantics-aware Approach for Graph Edit Distance Estimation over Knowledge Graphs
- Quantization Meets Projection: A Happy Marriage for Approximate k-Nearest Neighbor Search
- TurboLynx: Schemaless Graph Engine Strikes Back for General-Purpose Analytics
- BRIEF: Bi-level Coreset Selection for Efficient Instruction Tuning in LLMs
- Robust Predicate Transfer with Dynamic Execution
- SQL-Exchange: Transforming SQL Queries Across Domains
- TPCx-AI under the Microscope: A Benchmarking Debt Analysis
- DBAIOps: A Reasoning LLM-Enhanced Database Operation and Maintenance System using Knowledge Graphs
- SeDA: Bridging the Gap between Efficient Syntactic and Precise Semantic Search of Similar Passages in Large Text Corpora
- Anchored Maximum Communities over Large Directed Graphs
- Why Database Manuals Are Not Enough: Efficient and Reliable Configuration Tuning for DBMSs via Code-Driven LLM Agents
- Active Data Lakes: Regaining Physical Data Independence Without Losing Interoperability
- TACO: A Benchmark for Open-Domain Text-to-SQL with Ambiguous and Cross-Database Queries
- Structural Normalization of Property Graphs
- Pisco: An Isolation Bug Case Reduction and Deduplication Framework
- Front Matter
- CAPS: Cost-Aware ML Pipeline Selection
- Scalable GPU Acceleration of Scalar Functions in Analytical Databases: Compilation, Benchmarking, and Optimization
- Secure Multi-Party Sampling over Joins
- How to Write to SSDs
- I/O Optimizations in Graph-Based Disk-Resident Approximate Nearest Neighbor Search: A Design Space Exploration
- SIDLE: Tree-structure Aware Indexes for CXL-based Heterogeneous Memory
- Scarf: Self-Adaptive Tuning via Multi-Objective Reinforcement Learning for Apache Flink
- JHQ: Johnson-Lindenstrauss Enhanced Hierarchical Quantization for High-Dimensional Approximate Nearest Neighbor Search
- Love-at-First-Sight: First Answers Without the Awkward Silence in Big Knowledge Graphs
- Understanding Disclosure Risk in Differential Privacy with Applications to Noise Calibration and Auditing
- CEMR: An Effective Subgraph Matching Algorithm with Redundant Extension Elimination
- AQD: Online Adaptive Query Dispatcher for HTAP Databases
- Near-Duplicate Text Alignment under Weighted Jaccard Similarity
- FlareDTDG: Harnessing Temporal Recency for Scalable Discrete-Time Dynamic Graph Training
- OpenSQL: Data-Efficient Text-to-SQL for Open-Source LLMs via Synthesized Intermediate Supervision
- Database Views as Explanations for Relational Deep Learning
- Characterizing Parallel Subgraph Matching Performance: A Systematic Study of Interactions, Scalability, and Enumeration
- OBELISK: Efficient Offline Query Planning with Bayesian Optimization-Informed Language Model Reasoning
- Front Matter
- Theoretically and Practically Efficient Resistance Distance Computation on Large Graphs
- CIDER: Boosting Memory-Disaggregated Key-Value Stores with Pessimistic Synchronization
- Balancing the Blend: An Experimental Analysis of Trade-offs in Hybrid Search:
- Scalable GNN Explanations with Distributed Shapley Values
- gMatch: Fine-Grained and Hardware-Efficient Subgraph Matching on GPUs
- SemBench: A Benchmark for Semantic Query Processing Engines
- LakeHelm: Zero-Shot Lakehouse Advisor for Joint Engine-Format Selection and Configuration
- ALER: An Active Learning Hybrid System for Efficient Entity Resolution
- FB*: A Compact Index for Efficient and Exact Density-based Clustering
- Operation-aware Hybrid Locking for Modern In-Memory Indexes
- Toward Drift-Aware Database Benchmarking
- Enabling Index-free Adjacency in Oblivious Graph Processing with Delayed Duplications
- Relational Deep Dive: Error-Aware Queries Over Unstructured Data
- Front Matter
- Secure Join Operations in Multi-Identifier Databases: Performance and Practicality
- A Resource-centric Analysis and Optimization of NoSQL Workloads using Distressed Resource Volume Metric
- Efficient Banzhaf-Based Data Valuation for k-Nearest Neighbors Classification
- Mil: Cost-guided Minimum Makespan Scheduling for Applications of Multiple LLMs
- Dynamic read & write optimization with TurtleKV
- Compass: SLO-aware Query Planner for Compound AI Serving at Scale
- KDSelector: A Framework of Knowledge-Enhanced and Data-Efficient Selector Learning for Anomaly Detection Model Selection in Time Series
- Multimodal Knowledge Graph Completion via Relation-Aware Negative Sampling with Diffusion-based Interpolation
- RT-RkNN: Reverse k Nearest Neighbor Queries as a Graphics Ray Casting Problem
- Swan: Hybrid MVCC Management for Efficient Transaction Processing in LSM-Tree-Based Key-Value Stores
- Kirin: Efficient In-Storage Learned Compaction for LSM-Trees via System-Algorithm Co-Design
- LLMs as Stratification Signals for KG Accuracy Evaluation
- A Comparative Evaluation of Schema Subsetting for LLM-based NL-to-SQL over Large-Schema Databases
- IncreQueryFusion: On-demand Data Fusion Framework in Dynamic Data Lakes
- One Join Order Does Not Fit All: Reducing Intermediate Results with Per-Split Query Plans
- Harmonizing Efficiency and Accuracy in Filtered Vector Search
- Counting HyperGraphlets via Color Coding: a Quadratic Barrier and How to Break It
- Discovering Approximate Denial Constraints in Large Databases
- Human-Centered Exploration of Table Unionability
- Redbench: Workload Synthesis From Cloud Traces
- HarborMaster: Rollback Detection for Trusted Distributed Computing
- Auditing for Demographic Bias in Opaque Rankings
- Efficient Cooperation-Aware Key and Value Management for LLM Inference
- Succinct and Fast Tiny Pointer Hash Tables
- Aggregating maximal cliques in real-world graphs
- PRISM: A Training System to Unlock the Potential of Temporal Graph Learning Through Staleness Avoidance
- SafeQL: Search-based Refinement for Safe and Efficient LLM-based Text-to-SQL
- QA-GraphRAG: Query-Adaptive Plug-and-Play Retrieval Integration for Graph-based Retrieval-Augmented Generation
- Testing Graph Databases via Transformations Between Fixed-Length and Variable-Length Queries
- Efficient, Scalable, and Fair Locking on Disaggregated Memory with Decentralized Coordination
- MGI: A Communication Framework for Data Processing in Massive GPU Infrastructures
- MDS-FSM: Coverage-Based Frequent Subgraph Mining in Single Graphs
- Continuous Query for Top-K Maximal Sum Intervals over Streaming Data
- Subgraph Enumeration: Beyond Tree Decomposition
- High-Performance DBMSs with io_uring: When and How to Use It
- CREST: Approximate k-Clique Counting in Real-World Networks via Refinement of Star-Based Sample Space
- FutureLight: An Efficient Future Traffic Data-Driven Reinforcement Learning Framework for Traffic Signal Controls
- BookRAG: A Hierarchical Structure-aware Index-based Approach for Retrieval-Augmented Generation on Complex Documents
- Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA
- Storage-Centric Relation Design via High-Quality Approximate Functional Dependencies
- Unstructured Data Analysis using LLMs: A Comprehensive Benchmark
- Measuring Database Unfairness via Dependency Quantification Under Differential Privacy
- STEM2: A Fast and Space-efficient Data Structure for Exact Multi-Set Membership Query
- Revisiting the Maximum Defective Clique Problem: Faster Branching and a Tighter Upper Bound
- NeurIDA: Dynamic Modeling for Effective In-Database Analytics
- Finding Non-Redundant Simpson's Paradox in Multidimensional Data
- MGRAG: Semantic Subgraph Matching and Graph-Aware Caching for Multimodal Retrieval-Augmented Generation
- PystachIO: Efficient Distributed GPU Query Processing with PyTorch over Fast Networks & Fast Storage
- BaCon: Efficient Batch Processing of Counting Queries
- Document-to-Database: Extraction Meets Relational Semantics
- Front Matter
- TVA: A Version-aware Temporal Graph Storage System for Real-time Analytics
- Efficient Hyper-truss Decomposition over Hypergraphs
- dpKernels: Harvesting DPU Compute Resources for Data-path Efficiency in Cloud Data Processing
- Efficient Locally h-Clique Densest Subgraph Discovery via Divide-and-Conquer
- GPU-Accelerated 𝜂-threshold Decomposition for Uncertain Graphs
- V3DB: Audit-on-Demand Zero-Knowledge Proofs for Verifiable Vector Search over Committed Snapshots
- Unbiased Binning for Fairness-aware Attribute Representation
- A Practical Sublinear Approximation for Group Steiner Tree
- X-Wim: Massive Parallelization of Weighted Matching in Bipartite Graphs
- CRAFT: Corpus Relatedness Analysis Using Fourier Transforms
- FedAugment: Table Augmentation Search over Decentralized Data Repositories
- A Unified Query Planning Framework for Conjunctive Regular Path Queries
- ThunderGNN: Unlocking Tensor Cores for Graph Neural Networks
- PrivSTD: Differentially Private Spatio-temporal Trajectory Density Data Publication
- Aker: Density-Aware Approximate Caching for Vector Search
- Data-efficient Online Training for Direct Alignment in LLMs
- Decisionhouse: Prescriptive Analytics in the Data Stack
- Revisiting Filtered ANN Benchmarks: A Hardness-Controlled Benchmark Generator for Realistic Evaluation
- CaSh: Shapley Value Computation with Cache Optimization
- Composition for Pufferfish Privacy
- FeLoG: Scalable and Efficient Distributed Graph Embedding with Feedback Loop Mechanism
- Sparse Neighborhood Graph-Based Approximate Nearest Neighbor Search Revisited: Theoretical Analysis and Optimization
- Toward Temporal Attribution Analytics in Dataflows [Vision Paper]
- RNSG: A Range-Aware Graph Index for Efficient Range-Filtered Approximate Nearest Neighbor Search
- Bridging the Indexing Gap in Fused GPU Query Engines
- PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?
- ReSequel: Robust LLM-assisted Query Rewriting and Optimization using Templatization and Sampling
- BtrLog: Low-Latency Logging for Cloud Database Systems
- Sankofa: Online Query-adaptive Dynamic Graph Summaries
- HEXA: A Disjoint-Subgraph-Based Indexing Framework for Approximate Nearest Neighbor Search at Billion Scale
- Front Matter
- EcoTable: Cost-effective Table Integration in Data Lakes for Natural Language Queries
- Unified Static–Dynamic Pruning for Efficient LLM Inference
- Craw: A Unified and Efficient Querying Framework for Large-Scale Video Datasets
- CrocSort: Resource-Efficient, Skew-Resilient Parallel External Merge Sort
- Bolt-on, Verifiable Provenance for LLM-Powered Data Processing
- The Data World Is Not Flat: Efficient Factorized Execution for Relational Systems
- I-Rex: An Interactive Debugger for SQL
- Rethinking Learned Index and LSM-tree Integration
- Featurized-Decomposition Join: Low-Cost Semantic Joins with Guarantees
- Multi-Objective Agentic Rewrites for Unstructured Data Processing
- Remora: Scale-out Deterministic Execution for Smart Contracts
- QBAT: Model-based Query Budget Autotuner for Clustering-based Approximate Nearest Neighbor Search
- Error-bounded Point Cloud Compression Using Truncated Octahedron Quantization
- Noisy Interactive Graph Search: An Uncertainty-Based Approach with Online Modeling of Latent Expertise and Difficulty
- GAS: A Lightweight Framework for Filtered Search over Wide-table Vectors
- Fast and Private Max-Sum Diversification
- Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models
- Worst-Case Optimal BGPs on Temporal Graphs
- PipeLens: Identifying Interventions for Resolving Malfunctioning Data Science Pipelines
- How Much Can RocksDB Chew? Achieving Near-Zero Write Stalls with Sustainable RocksDB
- Interoperable ACID Transactions for Open Table Formats
- SEMA: A High-performance System for LLM-based Semantic Query Processing
- PAIL: Efficient kNN Search on Set-Valued Attributes
- Maximum Defective Biclique Search in Large Bipartite Graphs
- UniTG: A Unified System for Efficient and Seamless Textual Graph Learning
- Fugue: Online Elasticity for Distributed Stateful Stream Processing
- Fides: Secure and Scalable Asynchronous DAG Consensus via Trusted Components
- Efficient and Secure Range Counting over Distributed Geographic Data with Query Range Protection
- Local Shapley: Model-Induced Locality and Optimal Reuse in Data Valuation
- Nav-Index: A High-Performance, Adaptive Index for Shortest Path Queries in RDBMS
- CONDA: A Connectivity-Aware Dynamic Index for Approximate Nearest Neighbor Search over Evolving Data
- DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation
- KAFY: An Extensible and Scalable Transformers-Based System for Trajectory Data Analysis
- SciTables : A Dataset and Evaluation Framework for Complex Table-to-Text Generation
- GPU-Accelerated ANNS: Quantized for Speed, Built for Change
- Efficient GPU-Accelerated Adaptive Minimum Cost Seed Selection
- Detecting Data-Type-Related Logic Bugs in Relational DBMSs via Compatible Database Construction
- GPU-Native Approximate Nearest Neighbor Search with IVF-RaBitQ: Fast Index Build and Search
- BBC: Improving Large-𝑘 Approximate Nearest Neighbor Search with a Bucket-based Result Collector
- Resource-Efficient FirmCore Decomposition on Billion-scale Multilayer Graphs
- Breaking Structural Isolation: Scalable Graph Clustering via Community-Aware Sampling and Structural Entropy
- ConRAD: Conformal Risk-Aware Neural Databases
- Window Function Optimization: Co-Evaluation and Other Techniques
- Can we trust LLM Self-Explanations for Entity Resolution?
- Computing Why-Provenance for Property Graph Queries
- Orca: Flexible Quorums Meet Dynamic Quorums
- One Pass to Parse Them All: Fused Parallel CSV Processing
- Efficient GPU-Accelerated Local Subgraph Counting
- QDBO: A Real-time Quantum-augmented Database System Optimizer
- Storing and Indexing Multiple Tables by Interesting Orderings: For Efficient Joins, Groupings, and Updates in Relational Databases
- Accelerating String-Heavy Queries with LLM Token Tables
- MFTune: An Efficient Multi-fidelity Framework for Spark SQL Configuration Tuning
- CGIF: Combining Proximity Graphs and Inverted Files for Efficient Filtered Vector Search over Arbitrary Predicates
- Rhyme Native: Efficient Code Generation for Structured and Semi-Structured Workloads
- RAGPerf: An End-to-End Benchmarking Framework for Retrieval-Augmented Generation Systems
- Matryoshka: Uncovering Relevant Features in Data Lakes to Enhance Machine Learning Applications
- Dial: A Knowledge-Grounded Dialect-Specific NL2SQL System
- Developing and Benchmarking Verification Algorithms to Improve Text-to-SQL Generation
- MosaicJoin: Compact Semantic Sketches for Value-Level Join Discovery
- Bespoke OLAP: Synthesizing Workload-Specific One-size-fits-one Database Engines
- Benchmarking the Full Pipeline of Materialized-View-Based Query Rewriting
- Tidehunter: Large-Value Storage With Minimal Data Relocation
- stratum: A System Infrastructure for Massive Agent-Centric ML Workloads
- Lower-Bound Distance Queries under Partial Information
- ANNiE: A Learned Query Cost Estimator for Graph-Based Approximate Nearest Neighbor Search
- Front Matter
- Overlay Bitmap Encoding for Efficient Consumption of Apache Parquet Files
- Enhancing Database Write Performance with the Write Operation Pushdown Framework
- K2+: A Multi-Region OLTP Database with Disaggregated Storage for High Availability and Strong Consistency
- Clock2Q+: A Simple and Efficient Replacement Algorithm for Metadata Cache in VMware vSAN
- ZipFlow: a Compiler-based Framework to Unleash Compressed Data Movement for Modern GPUs
- RayBooster: A Ray Tracing Engine to Accelerate SedonaDB
- Highly Scalable SQL Azure MVCC Version Cleaner
- DBAgent: An RL-Based Agent for Autonomous Database Operations and Maintenance
- Incremental Query Optimizer Statistics in Amazon Redshift
- TEngineDB-V: An OLAP-Native Vector Search System for Large-𝑘 Workloads at Tencent
- Hermes at Scale: Powering Distributed Queries with a Unified Memory Fabric
- Tuning the Lookahead Distance for PostgreSQL Asynchronous IO
- FastCompose: Eliminating Compilation Cold Starts in Query Execution with Composition
- Reaching the Pinnacle of TPC-DS: Co-design of Architecture, Executor, and Storage in TDSQL
- AutoLiquid: Autonomic Data Layout Optimization for the Databricks Lakehouse
- No Silver Bullet: Boosting GaussDB Performance on the 30TB TPC-H Workload
- Evaluating the Practical Effectiveness of LLM-Driven Index Tuning on Microsoft SQL Server
- ScaleSense: Cost-Intelligent Scaling Framework via Learned Resource Estimation in Alibaba AnalyticDB
- CoeusBI: A Comprehensive Interactive Business Intelligence System Powered by LLMs at Baidu
- OceanBase Bacchus: a High-Performance and Scalable Cloud-Native Shared Storage Architecture for Multi-Cloud
- Virtualizing Recursion: Just-In-Time Graph Analytics in a Hyperscale Relational Warehouse
- TQP++: Bridging ML Compilers and Analytical Query Processing on GPUs
- The Live Database: Firestore’s Scalable and Consistent Realtime Queries
- Benchmarking Native In-Database TPCx-AI at 100 Terabytes in Ocient Hyperscale Data Warehouse
- A Decade of Apache Spark Structured Streaming: How We Evolved The Architecture To Meet Real-World Needs
- Real-time SQL Plan Management in Oracle
- SQL-Native Vector Search at Billion Scale in Presto
- SERON: Smart Query Router for Multi-Primary Cloud-Native Databases with Shared Storage
- A Unified Bandwidth Orchestration Framework for Hierarchical Data Storage Systems
- IMLane: Composable Framework for Efficient AI Function Execution in Database Engine
- SOS: A High-Performance Distributed Key-Value Store for Large-Scale Online Services
- A Tree-Structured Two-Phase Commit Framework for OceanBase: Optimizing Scalability and Consistency
- Private Data Collections: Enabling Data Privacy in Permissioned Blockchains
- OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration
- The Evolution of Storage in Apache AsterixDB
- Towards Industrial-Scale Parametric Query Optimization
- BiLink: Bidirectional Meta-paths for Link Discovery in Billion-Scale Heterogeneous Graphs
- Bridging NL2SQL for CAN Signal Analytics at NIO: From Externalized Schemas to CTE Pipelines
- VikingMem: A Memory Base Management System for Stateful LLM-based Applications
- Ultron: History-Based Query Optimization at Databricks
- One Ring to Shuffle Them All: Scalable Intra-Process Data Redistribution with Ring-Buffer Shuffle in Redpanda Oxla
- Lakebase: Serverless Postgres over Open Lake Storage
- From Presto to Prestissimo: A Velox-Powered Modernization Journey
- Why We Created Yet Another Memory Framework: Understanding MGA’s Role in Next-Gen Database Systems
- SalesforceDB: A Cloud-native Multi-tenant OLTP Database
- IORM: Hierarchical I/O Governance for Thousands of Consolidated Databases on Oracle Exadata
- Nova: A Multi-Purpose Vector Engine for Low-Latency, Multi-Tenant, and Cross-Table Hybrid Retrieval
- Narwhal: Breaking the Local Boundary via Disaggregated Memory Scheduling for Alibaba AnalyticDB
- PolarKV: Tier Locally, Serve Globally—A KV Cache over Cloud Memory and Storage
- QueryBrew: System-Agnostic SQL-to-SQL Query Optimization
- FedBridge: A Federated Query Engine over Embedding-Heterogeneous Vector Databases
- HaDA: Empower Database Experts with Data Dependencies
- OMBench: Taming Data Management Requirements in Cloud-Native Applications
- How Out-of-Bounds Are Your Cardinality Estimates?
- AtomSQL: Interactive Disambiguation of NL-to-SQL via User-Guided Atom-Level Alignment
- Credo: Declarative Control of LLM Pipelines via Beliefs and Policies
- SpatialSQL: A Multi-Agent System for Interactive and Observable Spatial Text-to-SQL
- DataMagic: Transforming Tabular Data into Data Insight Video
- QuWARTS: Query Workload Aware Relational Table Synthesis from Unstructured Text
- Hamilton – Interactive Ontology Learning
- SemPiper: Interactive Code Synthesis for Semantic Operators in Machine Learning Pipelines
- GRAIL: AI translation for scientists application workflow on satellite data
- GraphAlg Playground: An Online Platform for Learning and Experimenting with the GraphAlg Language
- GraphContainer: A Unified Platform for Comparing and Debugging Graph RAG Methods
- A Demo of Interactive Thematic Data Collection on the Live Web
- CypherLens: An Interactive Demo for Evaluating and Diagnosing NL-to-Cypher Systems
- Guixu: Valuation-Driven Data Discovery for Autonomous AI Agents with On-Chain Attestation
- Qr-Hint: Formally Verified and AI-Explained SQL Tutoring
- DataMosaic: An Interactive Demonstration of Constraint-Driven Document-to-Database Construction
- Data Lake for AI-enhanced Quantum Error Correction
- LayoutPilot: A Lakehouse Physical Design Advisor
- Text-to-SQL Evaluation Toolkit
- Dominance-Based Data Reduction for Package Queries
- PGShield: Maintaining Path Constraints in Property Graphs
- Verified LLM-Based Query Rewriting for Microsoft SQL Server
- A Demonstration of KAFY: An Extensible and Scalable Transformers-Based System for Trajectory Data Analysis
- Demonstrating GenDB: Instance-Optimized and Customized Query Processing Code Generation via LLM Agents
- MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents
- Demonstrating EarthLake: A Model Lake System for Earth Observation Foundation Model Management
- DeQL Studio: Declarative Decision-Making over Relational Data
- Minimal Data Cleaning for Model Training by MinPrep
- A Demonstration of Continuous Lifelong Conflict-Aware AGV Routing with Kinematic Constraints
- FilterPilot: An Interactive Assistant for Adapting Filtering Predicate to Table Content
- GraphAgent: An Effective Knowledge-Guided GNN Model Selection System
- CADENZA in Action: Breaking the Monolith with Intent-Dependent Plan Spaces for Semantic Queries
- MCAD: Multivariate Correlation Anomaly Data Generator
- Carnot: Interpretable, Interactive, and Optimized Execution of Deep Research Queries
- NiceT: Named Entity Cleaning and Enhancement with Human-in-the-loop
- A Portable Middleware for Plan-Based Adaptive Query Processing
- Policy-Aware Federated Query Orchestration Across Energy Data Spaces and Edge AI Services
- Into the CUDA Multiverse of Runtime Compilation: Exploring Kernel Fusion Strategies for GPU Database Systems
- CoBLOC - Continuous Block Level Fairness on Data Streams
- Demonstrating Samsara: A Super Optimizer for Multimodal Stream Processing
- GDPView: An Interactive Interface that Unifies Variants of Deletion Propagation (DP)
- Exploring the Benefits of Just-in-time Model Replacement
- SuperDRI: Graph-Guided Autonomous Troubleshooting for Cloud Databases
- MAPPipe: A System for Bridging Efficiency and Quality in Data Preprocessing via Knowledge-Augmented Structural Pruning
- LabelScope: Context-Aware Discovery of Label Outliers in Radio Astronomy Signals
- SubCure: A System for Stress-Testing Causal Conclusions Using Cardinality Repairs
- Demonstrating Indexing for Near-Sorted Data
- cuRPQ+: A System for Interactive Path-Aware Querying Beyond Plain CRPQs
- ReStore-in-Action: Adaptive Multi-Tier Storage Management via Intelligent Data Migration Policy
- PROXAI: Interactive Provenance-Aware Debugging of Machine Learning Pipelines
- Painless and Efficient Scaling of Pandas Programs: Demo
- Persona-Conditioned Query Generation for Selectivity-Controlled Workloads
- Demonstration of BobFlow: Human-Agent Collaboration Using Dataflows on Data Science Tasks
- Demonstrating TACT: Tunable Accuracy-Cost Trade-offs for Semantic Image Filtering
- RSR-core: A High-Performance Engine for Low-Bit Matrix-Vector Multiplication
- TexBench: A Unified Benchmarking Suite for Shifting Workloads
- ARGO: An Interactive Data Governance System for Machine Learning via Hierarchical Reinforcement Learning
- Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale
- ImputePilot: A Graphical Model Selection Toolkit for Time Series Imputation
- LLM-CER: An Interactive System for In-context Clustering-based Entity Resolution with Large Language Models
- ECO-Hadoop: Energy Consumption Optimization System for Apache Hadoop
- QueryCraft: A Natural Language-Driven NoSQL Database Querying System Powered by Large Language Models
- ChatQPT: Towards Conversing with Relational Query Engines
- LIMA: Denial Constraint Discovery in Large Dynamic Databases
- DA-Studio: An Agentic System for End-to-End Data Analysis
- Provlepsis4j: Querying Future Graphs in Neo4j
- GALACTICA: An Interactive System for Local and Global Counterfactual Explanations for Time-series Clustering
- The Case for Multi-Version Experimental Evaluation (MVEE)
- iPDB: SQL with ML and LLM Predicates (Towards a Database Engine for AI)
- Tursio for Credit Unions: Structured Data Search with Automated Context Graphs
- Cedar: A Columnar LSM-Engine for Temporal Property Graphs
- MoDora: A Multimodal Document AI Assistant Harness
- ARCADE: A Real-Time Data System for Hybrid and Continuous Query Processing across Diverse Data Modalities
- Q-ACER: Query Aggregate Constraint Efficient Repair System
- privJedAI: A Unified Open-Source Pipeline for Privacy-Preserving Record Linkage
- Demonstration of Doc*: Access Control for Information-Theoretically Secure Data
- Hypothesis Exploration with LLM-driven Intelligent Orchestration System
- Enzyme Demo: Incremental View Maintenance for Data Engineering
- LORY-J: Location-aware Join Discovery from Data Lakes
- QFusion: A Demonstration of Boundary-Aware Fusion Planning and Execution for Large-Scale QUBO Optimization
- TurboLynx in Action: A Schemaless Graph Engine for General-Purpose Analytics
- SAGA: Synthetic Agentic Graph Architecture for Temporal Benchmark Generation
- ATLAS: Adaptive Text-to-SQL with Lifecycle-Aware Self-Maintaining Context
- DBCooker: A Database Kernel-Specialized Coding Agent Harness
- ParSEval: Interactive Counterexample-driven Evaluation for Text-to-SQL
- DialectEvo: Bridging SQL Dialects with Execution-Guided Knowledge Refinement
- TrustBCI: A Trustworthy Platform for Collaborative Brain-Computer Interface Data Exchange
- Hard to Read, Hard to Maintain? Refactoring Complex SQL into Wvlet Pipelines
- Hardware Acceleration for Spatial Databases: Building Next-Generation Query Engines Using Ray Tracing Cores
- Bridging LLMs and Database Systems: A Deep Dive into Enhanced Relational Operators
- Are We There Yet? A Grand Tour of ETA Queries
- From Human-Graph to Agent-Graph Interaction: State of the Art and Future Directions
- Instance-Optimal Acyclic Joins: From Theory to Systems
- Data Management for Agentic Memory: Foundations, Systems, and Challenges
- Advances of Query Processing in Vector Databases
- Graph-Based Retrieval-Augmented Generation: Applications, Challenges, Solutions, and Opportunities
- How Can Quantum Computing and Databases Meet “in Practice”? From Algorithms to Systems
- Interoperability in Healthcare: A Primer and New Frontiers
- Graph Foundation Models: State of the Art and Future Directions
- CRDTs and Databases: A Hands-On Tutorial
- Private LLM Inference with Homomorphic Encryption
- An Extended Tutorial and Vocabulary for Relational Language Design in an Era of AI-Assisted Query Generation
- From Big Time Series Forecasting to Foundation Models for Structured Data
- Publish or Ship? The Research-to-Production Gap in Data Systems
- Data Agents: Rethinking Data Systems in the AI Agent Era
- HW-SW Co-Design for Databases in the Age of AI-for-Systems
- The Dataflow Model Revisited
- Future-Proof Data Systems
- Semantic Data Systems: From Data Management to Data Understanding
- The Three Golden Ages of Database Engineering: From SIGMOD’85 to the Agentic Era
- Efficient and Reliable Systems for Building Foundation Models at Scale
- Return to the Boston Area After 50+ Years: What can we learn from VLDB 1975?
Volume 18
https://www.vldb.org/pvldb/volumes/18/
- Front Matter
- The Key to Effective UDF Optimization: Before Inlining, First Perform Outlining
- CUTTANA: Scalable Graph Partitioning for Faster Distributed Graph Databases and Analytics
- Cardinality Estimation for Having-Clauses
- Chameleon: a Heterogeneous and Disaggregated Accelerator System for Retrieval-Augmented Language Models
- LLM-R2: A Large Language Model Enhanced Rule-based Rewrite System for Boosting Query Efficiency
- Nitro: Boosting Distributed Reinforcement Learning with Serverless Computing
- Front Matter
- RED: Effective Trajectory Representation Learning with Comprehensive Information
- Accurate and Fast Approximate Graph Pattern Mining at Scale
- QueryArtisan: Generating Data Manipulation Codes for Ad-hoc Analysis in Data Lakes
- Efficient and Effective Algorithms for A Family of Influence Maximization Problems with A Matroid Constraint
- COLOR: A Framework for Applying Graph Coloring to Subgraph Cardinality Estimation
- Fully Automated Correlated Time Series Forecasting in Minutes
- From Logs to Causal Inference: Diagnosing Large Systems
- NeutronTP: Load-Balanced Distributed Full-Graph GNN Training with Tensor Parallelism
- Unleash the Power of Ellipsis: Accuracy-enhanced Sparse Vector Technique with Exponential Noise and Optimal Threshold Correction
- Maximum Defective Clique Computation: Improved Time Complexities and Practical Performance
- Substructure-aware Log Anomaly Detection
- Less is More: Efficient Time Series Dataset Condensation via Two-fold Modal Matching
- A Memory Guided Transformer for Time Series Forecasting
- LEAP: LLM-powered End-to-end Automatic Library for Processing Social Science Queries on Unstructured Data
- TEAM: Topological Evolution-aware Framework for Traffic Forecasting
- Chimera: A system design of dual storage and traversal-join unified query processing for SQL/PGQ
- Can Graph Reordering Speed Up Graph Neural Network Training? An Experimental Study
- HyperBlocker: Accelerating Rule-based Blocking in Entity Resolution using GPUs
- Calibrating Noise for Group Privacy in Subsampled Mechanisms
- Outback: Fast and Communication-efficient Index for Key-Value Store on Disaggregated Memory
- Making CRDTs Not So Eventual
- Maximum k-Plex Search: An Alternated Reduction-and-Bound Method
- Discovering Leitmotifs in Multidimensional Time Series
- SIMformer: Single-Layer Vanilla Transformer Can Learn Free-Space Trajectory Similarity
- CUBIT: Concurrent Updatable Bitmap Indexing
- Privacy-Enhanced Database Synthesis for Benchmark Publishing
- Themis: A GPU-accelerated Relational Query Execution Engine
- Finding Convincing Views to Endorse a Claim
- Quantifying Point Contributions: A Lightweight Framework for Efficient and Effective Query-Driven Trajectory Simplification
- MILLION: A General Multi-Objective Framework with Controllable Risk for Portfolio Management
- The Cost of Representation by Subset Repairs
- cedar: Optimized and Unified Machine Learning Input Data Pipelines
- Goku: A Schemaless Time Series Database for Large Scale Monitoring at Pinterest
- Front Matter
- Agent-OM: Leveraging LLM Agents for Ontology Matching
- GraphAr: An Efficient Storage Scheme for Graph Data in Data Lakes
- Cardinality Estimation for Similarity Search on High-Dimensional Data Objects: The Impact of Reference Objects
- Efficient Top-k Frequent Subgraph Mining Using Tight Upper and Lower Bounds
- MSGNN: Masked Schema based Graph Neural Networks
- How Reliable Are Streams? End-to-End Processing-Guarantee Validation and Performance Benchmarking of Stream Processing Systems
- Towards Sufficient GPU-accelerated Dynamic Graph Management: Survey and Experiment
- RDPro: Distributed Processing of Big Raster Data
- Approximate Anchored Densest Subgraph Search on Large Static and Dynamic Graphs
- PRICE: A Pretrained Model for Cross-Database Cardinality Estimation
- Datalog with First-Class Facts
- T-Assess: An Efficient Data Quality Assessment System Tailored for Trajectory Data
- LEAP: A Low-cost Spark SQL Query Optimizer using Pairwise Comparison
- Towards Practical Oblivious Map
- PolyBase: Adapting to Data Affinity Changes in Geo-Replicated Database via Row-Level Consensus-Group Affiliation Re-Assignment
- Explaining GNN-based Recommendations in Logic
- Efficient Computation of Hyper-triangles on Hypergraphs
- Laser: Buffer-Aware Learned Query Scheduling in Master-Standby Databases
- A Single Machine System for Querying Big Graphs with PRAM
- A CPU-GPU Hybrid Labelling Algorithm for Massive Shortest Distance Queries on Road Networks
- SDEcho: Efficient Explanation of Aggregated Sequence Difference
- MLP-Mixer based Masked Autoencoders Are Effective, Explainable and Robust for Time Series Anomaly Detection
- Efficient Data-aware Distance Comparison Operations for High-Dimensional Approximate Nearest Neighbor Search
- Seer: Accelerating Blockchain Transaction Execution by Fine-Grained Branch Prediction
- The ParClusterers Benchmark Suite (PCBS): A Fine-Grained Analysis of Scalable Graph Clustering
- Semantic Conformance Testing of Relational DBMS
- RankPQO: Learning-to-Rank for Parametric Query Optimization
- Datamap-Driven Tabular Coreset Selection for Classifier Training
- Towards Scalable and Practical Batch-Dynamic Connectivity
- IcedTea: Efficient and Responsive Time-Travel Debugging in Dataflow Systems
- Representative Time Series Discovery for Data Exploration
- Front Matter
- Efficient Graph Embedding Generation and Update for Large-Scale Temporal Graph
- FaDE: More Than a Million What-ifs Per Second
- Towards Ideal Temporal Graph Neural Networks: Evaluations and Conclusions after 10,000 GPU Hours
- Kishu: Time-Traveling for Computational Notebooks
- GTI: Graph-based Tree Index with Logarithm Updates for Nearest Neighbor Search in High-Dimensional Spaces
- Incremental Detection of Denial Constraint Violations
- Revisiting CNNs for Trajectory Similarity Learning
- Most Similar Biclique Search at Scale
- SPECIAL: Synopsis Assisted Secure Collaborative Analytics
- IncrCP: Decomposing and Orchestrating Incremental Checkpoints for Effective Recommendation Model Training
- WeShap: Weak Supervision Source Evaluation with Shapley Values
- Are Joins over LSM-trees Ready: Take RocksDB as an Example
- Interactive Graph Search for Multiple Targets on DAGs
- AdaNDV: Adaptive Number of Distinct Value Estimation via Learning to Select and Fuse Estimators
- UNIFY: Unified Index for Range Filtered Approximate Nearest Neighbors Search
- In-depth Analysis of Densest Subgraph Discovery in a Unified Framework
- Sphinteract: Resolving Ambiguities in NL2SQL Through User Interaction
- Noise Matters: Cross Contrastive Learning for Flink Anomaly Detection
- RCRank: Multimodal Ranking of Root Causes of Slow Queries in Cloud Database Systems
- Ranking Indicator Discovery from Very Large Knowledge Graphs
- Graph Neural Network Training Systems: A Performance Comparison of Full-Graph and Mini-Batch.
- Discovering Approximate Inclusion Dependencies
- DumpKV: Learning based lifetime aware garbage collection for key value separation in LSM-tree
- RGS-Sketch: An Accurate, Invertible, and Mergeable Sketch for Online Super Spreader Detection in High-speed Data Streams
- Vortex: Overcoming Memory Capacity Limitations in GPU-Accelerated Large-Scale Data Analytics
- Front Matter
- Dandelion: Smaller Clusters, Bigger Speeds—Distributed Transactions Redefined
- Esc: An Early-Stopping Checker for Budget-aware Index Tuning
- Jodes: Efficient Oblivious Join in the Distributed Setting
- OpenFGL: A Comprehensive Benchmark for Federated Graph Learning
- Evaluating Continuous Queries with Inconsistency Annotations
- On More Efficiently and Versatilely Querying Historical k-Cores
- GeoBloom: Revisiting Lightweight Models for Geographic Information Retrieval
- VerIso: Verifiable Isolation Guarantees for Database Transactions
- A Hybrid Approach to Integrating Deterministic and Non-deterministic Concurrency Control in Database Systems
- From Genesis to Maturity: Managing Knowledge Graph Ecosystems Through Life Cycles
- Avoiding Materialisation for Guarded Aggregate Queries
- Synergetic Community Search over Large Multilayer Graphs
- Searching and Detecting Structurally Similar Communities in Large Heterogeneous Information Networks
- Cabinet: Dynamically Weighted Consensus Made Fast
- Mining the Minoria: Unknown, Under-represented, and Under-performing Minority Groups
- Efficient Concurrent Updates to Persistent Randomized Binary Search Trees
- Explaining Black-Box Clustering Pipelines With Cluster-Explorer
- BACH: Bridging Adjacency List and CSR Format using LSM-Trees for HGTAP Workloads
- FLEET: High-Performance Durable Replicated State Machines using Scattered and Coordinated Log Entries
- BigVectorBench: Heterogeneous Data Embedding and Compound Queries are Essential in Evaluating Vector Databases
- Front Matter
- A Systematic Study on Early Stopping Metrics in HPO and the Implications of Uncertainty
- TELESAFE - Detecting Private/Work Boundary Crossings in Energy Consumption Trails in Telework
- FB+-tree: A Memory-Optimized B+-tree with Latch-Free Update
- VStream: A Distributed Streaming Vector Search System
- Efficient Historical Butterfly Counting in Large Temporal Bipartite Networks via Graph Structure-aware Index
- PlanRGCN: Predicting SPARQL Query Performance
- Holistic query Approximation via RL Modeling
- Unleashing Graph Partitioning for Large-Scale Nearest Neighbor Search
- BiST: A Lightweight and Efficient Bi-directional Model for Spatiotemporal Prediction
- QOVIS: Understanding and Diagnosing Query Optimizer via a Visualization-assisted Approach (Revision)
- Unsupervised Anomaly Detection in Multivariate Time Series across Heterogeneous Domains
- NeutronTask: Scalable and Efficient Multi-GPU GNN Training with Task Parallelism
- Quantum Data Management in the NISQ Era
- G-View: View Management for Graph Databases
- Privacy for Free: Leveraging Local Differential Privacy Perturbed Data from Multiple Services
- K2: On Optimizing Distributed Transactions in a Multi-region Data Store with True-time Clocks
- Maximum Inner Product is Query-Scaled Nearest Neighbor
- Migration-Free Elastic Storage of Time Series in Apache IoTDB
- GQL and SQL/PGQ: Theoretical Models and Expressive Power
- A Practical Theory of Generalization in Selectivity Learning
- Revisiting the Index Construction of Proximity Graph-Based Approximate Nearest Neighbor Search
- Mining Platoon Patterns from Traffic Videos
- Agamotto: Scheduling of Deadline-Oriented Incremental Query Execution under Uncertain Resource Price
- SCompression: Enhancing Database Knob Tuning Efficiency Through Slice-Based OLTP Workload Compression
- Fucci: Database Transaction Fuzzing via Random Conflict Construction and Multilevel Constraint Solving
- Streaming Time Series Subsequence Anomaly Detection: A Glance and Focus Approach
- Infinite Stream Estimation under Personalized w-Event Privacy
- GPEmu: A GPU Emulator for Faster and Cheaper Prototyping and Evaluation of Deep Learning System Research
- Causal DAG Summarization
- mLoRA: Fine-Tuning LoRA Adapters via Highly-Efficient Pipeline Parallelism in Multiple GPUs
- Anarchy in the Database: A Survey and Evaluation of Database Management System Extensibility
- A Flexible Framework for Query-oriented Interactive Community Search
- Tabular: Efficiently Building Efficient Indexes
- Front Matter
- Efficient Maintenance of 2-Hop Labeling Index on Dynamic Small-World Graphs
- Vive la Différence: Practical Diff Testing of Stateful Applications
- GREAT: Generalized Reservoir Sampling based Triangle Counting Estimation over Streaming Graphs
- Efficient Discovery of Relaxed Functional Dependencies
- SimRN: Trajectory Similarity Learning in Road Networks based on Distributed Deep Reinforcement Learning
- BIRDIE: Natural Language-Driven Table Discovery Using Differentiable Search Index
- SkyStore: Cost-Optimized Object Storage Across Regions and Clouds
- The Power of Constraints in Natural Language to SQL Translation
- ACE: A Cardinality Estimator for Set-Valued Queries
- Accio: Bolt-on Query Federation
- Falcon: Advancing Asynchronous BFT Consensus for Lower Latency and Enhanced Throughput
- Scalable Pre-Training of Compact Urban Spatio-Temporal Predictive Models on Large-Scale Multi-Domain Data
- HADES: Range-Filtered Private Aggregation on Public Data
- Optimized Batch Prompting for Cost-effective LLMs
- Truss Decomposition in Hypergraphs
- Optimal Sharding for Scalable Blockchains with Deconstructed SMR
- Auto-Prep: Holistic Prediction of Data Preparation Steps for Self-Service Business Intelligence
- Time Series Motif Discovery: A Comprehensive Evaluation
- EinDecomp: Decomposition of Declaratively-Specified Machine Learning and Numerical Computations for Parallel Execution
- Continuous Lifelong Conflict-Aware AGV Routing with Kinematic Constraints
- Wolverine: Highly Efficient Monotonic Search Path Repair for Graph-based ANN Index Updates
- Detecting Schema-Related Logic Bugs in Relational DBMSs via Equivalent Database Construction
- GraphSparseNet: a Novel Method for Large Scale Traffic Flow Prediction
- Front Matter
- TMLKD: Few-shot Trajectory Metric Learning via Knowledge Distillation
- Oze: Decentralized Graph-based Concurrency Control for Long-running Update Transactions
- Hermes: Off-the-Shelf Real-Time Transactional Analytics
- Approximation-First Timeseries Query At Scale
- LogCloud: Fast Search of Compressed Logs on Object Storage
- Weak-to-Strong Prompts with Lightweight-to-Powerful LLMs for High-Accuracy, Low-Cost, and Explainable Data Transformation
- ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning
- Federated Data Shift Distance Estimation
- Instance-Optimal Acyclic Join Processing Without Regret: Engineering the Yannakakis Algorithm in Column Stores
- Asymmetric Linearizable Local Reads
- QPET: A Versatile and Portable Quantity-of-Interest-preservation Framework for Error-Bounded Lossy Compression
- OpenMEL: Unsupervised Multimodal Entity Linking Using Noise-Free Expanded Queries and Global Coherence
- Unraveling the Impact of Window Semantics: Optimizing Join Order for Efficient Stream Processing
- Deduplicated Sampling On-Demand
- The Limits of Graph Samplers for Training Inductive Recommender Systems
- HoliPaxos: Towards More Predictable Performance in State Machine Replication
- Data-Agnostic Cardinality Learning from Imperfect Workloads
- BLAEQ: A Multigrid Index for Spatial Query on Geometry Data
- Simple Testing Can Expose Most Critical Transaction Bugs: Understanding and Detecting Write-Specific Serializability Violations in Database Systems
- Efficient and Adaptive Estimation of Local Triadic Coefficients
- VecCity: A Taxonomy-guided Library for Map Entity Representation Learning [Experiment, Analysis & Benchmark]
- Evaluating Methods for Efficient Entity Count Estimation
- Fair Transaction Processing For Multi-Tenant Databases
- LobRA: Multi-tenant Fine-tuning over Heterogeneous Data
- Robust Plan Evaluation based on Approximate Probabilistic Machine Learning
- CatDB: Data-catalog-guided, LLM-based Generation of Data-centric ML Pipelines
- Conformal Prediction for Verifiable Learned Query Optimization
- Is Integer Linear Programming All You Need for Deletion Propagation? A Unified and Practical Approach for Generalized Deletion Propagation
- Magneto: Combining Small and Large Language Models for Schema Matching
- Efficient and Accurate Subgraph Counting: A Bottom-up Flow-learning based Approach
- AQETuner: Reliable Query-level Configuration Tuning for Analytical Query Engines
- PipeTGL: (Near) Zero Bubble Memory-based Temporal Graph Neural Network Training via Pipeline Optimization
- Is Long Context All You Need? Leveraging LLM's Extended Context for NL2SQL
- Saving Private Hash Join
- Front Matter
- Concurrency Control as a Service
- TAB: Unified Benchmarking of Time Series Anomaly Detection Methods
- Heta: Distributed Training of Heterogeneous Graph Neural Networks
- The UDFBench Benchmark for General-purpose UDF Queries
- eXpath: Explaining Knowledge Graph Link Prediction with Ontological Closed Path Rules
- The LAW theorem: Local Reads and Linearizable Asynchronous Replication
- Using Read Promotion and Mixed Isolation Levels for Performant Yet Serializable Execution of Transaction Programs
- Locality-Aware Cache Replacement Policy for Graph Traversals
- Keigo: Co-designing Log-Structured Merge Key-Value Stores with a Non-Volatile, Concurrency-aware Storage Hierarchy
- Why Are Learned Indexes So Effective but Sometimes Ineffective?
- Still More Shades of Null: An Evaluation Suite for Responsible Missing Value Imputation [Experiment, Analysis and Benchmark]
- OpenForge: Probabilistic Metadata Integration
- Maximum k-Plex Finding: Choices of Pruning Techniques Matter!
- A Comprehensive Survey and Experimental Study of Learning-based Community Search
- Decentralized Actor Scheduling and Reference-based Storage in Xorbits: a Native Scalable Data Science Engine
- STsCache: An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage
- Cache Coherence Over Disaggregated Memory
- Triparts: Scalable Streaming Graph Partitioning to Enhance Community Structure
- The LDBC Financial Benchmark: Transaction Workload
- Alchemy: A Query Optimization Framework for Oblivious SQL
- DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing
- HAKES: Scalable Vector Database for Embedding Search Service
- Path-centric Cardinality Estimation for Subgraph Matching
- A Comprehensive Study of Shapley Value in Data Analytics
- Effective and Efficient Distributed Temporal Graph Learning through Hotspot Memory Sharing
- Stochastic SketchRefine: Scaling In-Database Decision-Making under Uncertainty to Millions of Tuples
- CXL Memory Performance for In-Memory Data Processing
- LLMLog: Advanced Log Template Generation via LLM-driven Multi-Round Annotation
- Cuckoo Heavy Keeper and the balancing act of maintaining heavy hitters in stream processing
- Rebirth-Retire: A Concurrency Control Protocol Adaptable to Different Levels of Contention
- UFGTime: Mining Intertwined Dependencies in Multivariate Time Series via an Efficient Pure Graph Approach (Flavor: Foundations and Algorithms Papers)
- ArrayMorph: Optimizing Hyperslab Queries on the Cloud for Machine Learning Pipelines
- Inference-friendly Graph Compression for Graph Neural Networks
- GpJSON: High-performance JSON Data Processing on GPUs
- Beyond Shortest Paths: Node Fairness in Route Recommendation
- Front Matter
- Access Control for Information-Theoretically Secure Data
- Dynamic Range-Filtering Approximate Nearest Neighbor Search
- LEGO-GraphRAG: Modularizing Graph-based Retrieval-Augmented Generation for Design Space Exploration
- Déjà Vu: Efficient Video-Language Query Engine with Learning-based Inter-Frame Computation Reuse
- Parachute: Single-Pass Bi-Directional Information Passing
- Twisted Twin: A Collaborative and Competitive Memory Management Approach in HTAP Systems
- Customization Meets 2-Hop Labeling: Efficient Routing in Road Networks
- X-Blossom: Massive Parallelization of Graph Maximum Matching
- Data Imputation with Limited Data Redundancy Using Data Lakes
- Chimera: Mitigating Ownership Transfers in Multi-Primary Shared-Storage Cloud-Native Databases
- Sectric: Towards Accurate, Privacy-preserving and Efficient Triangle Counting
- When Speed meets Accuracy: an Efficient and Effective Graph Model for Temporal Link Prediction
- Improving Time Series Data Compression in Apache IoTDB
- On LLM-Enhanced Mixed-Type Data Imputation with High-Order Message Passing
- Meaningful Data Erasure in the Presence of Dependencies
- Sonata: Multi-Database Transactions Made Fast and Serializable
- MOMENTI: Scalable Motif Mining in Multidimensional Time Series
- How and Why False Denial Constraints are Discovered
- Efficient 𝑘-Clique Densest Subgraph Discovery: Towards Bridging Practice and Theory
- AutoPrep: Natural Language Question-Aware Data Preparation with a Multi-Agent Framework
- Accelerating Approximate Nearest Neighbor Search in Hierarchical Graphs: Efficient Level Navigation with Shortcuts
- Federated Incomplete Tabular Data Prediction with Missing Complementarity
- LakeVisage: Towards Scalable, Flexible and Interactive Visualization Recommendation for Data Discovery over Data Lakes
- PS-MI: Accurate, Efficient, and Private Data Valuation in Vertical Federated Learning
- Towards Pattern-aware Data Augmentation for Temporal Knowledge Graph Completion
- RapidStore: An Efficient Dynamic Graph Storage System for Concurrent Queries
- GORAM: Graph-oriented ORAM for Efficient Ego-centric Queries on Federated Graphs
- Authenticated Aggregate Queries with Boolean Range Predicates on Blockchains
- FSMDTW: A Fast Index-free Subsequence Matching Algorithm for Dynamic Time Warping
- Fused Gromov-Wasserstein Alignment for Graph Edit Distance Computation and Beyond
- EVOSCHEMA: TOWARDS TEXT-TO-SQL ROBUSTNESS AGAINST SCHEMA EVOLUTION
- Effective and Efficient Community Search for Complex Network Semantics Capture: From Coarse-Grain to Fine-Grain
- HAWK: A Workload-driven Hierarchical Deadlock Detection Approach in Distributed Database System
- Front Matter
- Doctopus: Budget-aware Structural Table Extraction from Unstructured Documents
- S^3AND: Efficient Subgraph Similarity Search Under Aggregated Neighbor Difference Semantics
- Lighter-X: An Efficient and Plug-and-play Strategy for Graph-based Recommendation through Decoupled Propagation
- Not Small Enough? SegPQ: A Learned Approach to Compress Product Quantization Codebooks
- The Accuracy of Cardinality Estimators: Unraveling the Evaluation Result Conundrum
- LogLite: Lightweight Plug-and-Play Streaming Log Compression
- Enabling Efficient Attack Investigation via Human-in-the-Loop Security Analysis
- Shifting Transaction Isolation on Graphs: From Systems to Data
- Fast Graph Vector Search via Hardware Acceleration and Delayed-Synchronization Traversal
- Fremer: Lightweight and Effective Frequency Transformer for Workload Forecasting in Cloud Services
- TabulaX: Leveraging Large Language Models for Multi-Class Table Transformations
- Bonspiel: Low Tail Latency Transactions in Geo-Distributed Databases
- Efficient Graph Data Access for Out-of-Memory GPU Streaming Graph Processing
- Extensible and Robust Evaluation of Similarity Queries
- PBench: Workload Synthesizer with Real Statistics for Cloud Analytics Benchmarking
- Accelerating Subgraph Matching through Fine-grained and Powerful Equivalences
- How to Optimize SQL Queries? A Comparison Between Split, Holistic, and Hybrid Approaches
- Diva: Dynamic Range Filter for Var-Length Keys and Queries
- Approximate 2-hop neighborhoods on incremental graphs: An efficient lazy approach
- Cracking Vector Search Indexes
- DobLIX: A Dual-Objective Learned Index for Log-Structured Merge Trees
- CoLA: Model Collaboration for Log-based Anomaly Detection
- Towards Designing Future-Proof Data Processing Systems
- Advancing Fact Attribution for Query Answering: Aggregate Queries and Novel Algorithms
- What If: Causal Analysis with Graph Databases
- AnyBlox: A Framework for Self-Decoding Datasets
- Federated and Balanced Clustering for High-dimensional Data
- Relational Data Models for Genetic VCF data
- BURST: Rendering Clustering Techniques Suitable for Evolving Streams
- Environmental Footprints of Query Processing: A Vision for Sustainable Database Architectures
- Semantic Integrity Constraints: Declarative Guardrails for AI-Augmented Data Processing Systems
- RICH: Real-time Identification of negative Cycles for High-efficiency Arbitrage
- Balancing Privacy and Utility in Correlated Data: A Study of Bayesian Differential Privacy
- Enhancing Transaction Processing through Indirection Skipping
- UniClean: A Scalable Data Cleaning Solution for Mixed Errors based on Unified Cleaners and Optimized Cleaning Workflow
- ShaRP: Explaining Rankings and Preferences with Shapley Values
- SQLStorm: Taking Database Benchmarking into the LLM Era
- Suna: Scalable Causal Confounder Discovery over Relational Data
- Semantic Operators and Their Optimization: Towards AI-Based Data Analytics with Accuracy Guarantees
- Improving DBMS Scheduling Decisions with Accurate Performance Prediction on Concurrent Queries
- Practical and Accurate Local Edge Differentially Private Graph Algorithms
- Continuous Publication of Weighted Graphs with Local Differential Privacy
- TxnSails: Achieving Serializable Transaction Scheduling with Self-Adaptive Isolation Level Selection
- No Cap, This Memory Slaps: Breaking Through the Memory Wall of Transactional Database Systems with Processing-in-Memory
- GraphCSR: A Degree-Equalized CSR Format for Large-scale Graph Processing
- Effective and Efficient Attributed Hypergraph Embedding on Nodes and Hyperedges
- Subgraph Matching: A New Decomposition Based Approach
- SSD-iq: Uncovering the Hidden Side of SSD Performance
- Faster Convergence in Mini-batch Graph Neural Networks Training with Pseudo Full Neighborhood Compensation
- TreeCat: Standalone Catalog Engine for Large Data Systems
- Select Edges Wisely: Monotonic Path Aware Graph Layout Optimization for Disk-based ANN Search
- Powerful GPUs or Fast Interconnects: Analyzing Relational Workloads on Modern GPUs
- TSB-AutoAD: Towards Automated Solutions for Time-Series Anomaly Detection [E, A & B]
- Time-Series Clustering: A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods
- Beyond Compression: A Comprehensive Evaluation of Lossless Floating-Point Compression
- ThriftLLM: On Cost-Effective Selection of Large Language Models for Classification Queries
- Sphinx: A Succinct Perfect Hash Index for x86
- NaviX: A Native Vector Index Design for Graph DBMSs With Robust Predicate-Agnostic Search Performance
- DIM-SUM: Dynamic IMputation for Smart Utility Management
- Robust Recursive Query Parallelism in Graph Database Management Systems
- OasisDB: An Oblivious and Scalable System for Relational Data
- CEDAR: A System for Cost-Efficient Data-Driven Claim Verification
- Benchmarking Adaptive Multidimensional Indices
- Scaling GPU-Accelerated Databases beyond GPU Memory Size
- PAR2QO: Parametric Penalty-Aware Robust Query Optimization
- LIMAO: A Framework for Lifelong Modular Learned Query Optimization
- QUEST: Query Optimization in Unstructured Document Analysis
- CENTS: A Flexible and Cost-Effective Framework for LLM-Based Table Understanding
- OmniMatch: Joinability Discovery in Data Products
- Pistis: A Decentralized Knowledge Graph Platform Enabling Ownership-Preserving SPARQL Querying
- Selective Late Materialization in Modern Analytical Databases
- The FastLanes File Format
- POLARIS: An Interactive and Scalable Data Infrastructure for Polar Science
- Efficiently Joining Large Relations on Multi-GPU Systems
- Stress-Testing ML Pipelines with Adversarial Data Corruption
- PrivAGM: Secure Construction of Differentially Private Directed Attributed Graph Models on Decentralized Social Graphs
- OmniSQL: Synthesizing High-quality Text-to-SQL Data at Scale
- Turbocharging Vector Databases using Modern SSDs
- SIEVE: Effective Filtered Vector Search with Collection of Indexes
- Enhancing Graph Edit Distance Computation: Stronger and Orientation-based ILP Formulations
- ParSEval: Plan-aware Test Database Generation for SQL Equivalence Evaluation
- Front Matter
- LEADRE: Multi-Faceted Knowledge Enhanced LLM Empowered Display Advertisement Recommender System
- TuskFlow: An Efficient Graph Database for Long-Running Transactions
- MD-MVCC: Multi-version Concurrency Control for Schema Changes in Azure SQL Database
- Towards Principled, Practical Document Database Design
- Scribe: How Meta transports zettabytes per day in real time
- The HANA Native Query Engine for Lakehouse Systems
- Disaggregated State Management in Apache Flink 2.0
- SiriusBI: A Comprehensive LLM-powered Solution for Data Analytics in Business Intelligence
- SagaLLM: Context Management, Validation, and Transaction Guarantees for Multi-Agent LLM Planning
- Unlocking the Power of CI/CD for Data Pipelines in Distributed Data Warehouses
- veDB-HTAP: a Highly Integrated, Efficient and Adaptive HTAP System
- From FASTER to F2: Evolving Concurrent Key-Value Store Designs for Large Skewed Workloads
- Automatic Indexing in Oracle
- Cloudy With a Chance of JSON
- GaussDB-Vector: A Large-Scale Persistent Real-Time Vector Database for LLM Applications
- Magnus: A Holistic Approach to Data Management for Large-Scale Machine Learning Workloads
- DECK: Experiences on Delta Checkpointing for Industrial Recommendation Systems
- GRewriter: Practical Query Rewriting with Automatic Rule Set Expansion in GaussDB
- FDBKeeper: Enabling Scalable Coordination Services for Metadata Management using Distributed Key-Value Databases
- VSAG: An Optimized Search Framework for Graph-based Approximate Nearest Neighbor Search
- R-Bot: An LLM-based Query Rewrite System
- Design and Modular Verification of Distributed Transactions in MongoDB
- From Scale-Up to Scale-Out: PolarDB’s Journey to Achieving 2 Billion tpmC
- ScaleCache: Scalable and Production-grade Buffer Management for Disk-based Database Systems
- Towards Automated Cross-domain Exploratory Data Analysis through Large Language Models
- GalaxyWeaver: Autonomous Table-to-Graph Conversion and Schema Optimization with Large Language Models
- Freely Moving Between the OLTP and OLAP Worlds: Hermes – an High-Performance OLAP Accelerator for MySQL
- Workload Insights From the Snowflake Data Cloud: What Do Production Analytic Queries Really Look Like?
- AnalyticDB-PG: A Cloud-native High-performance Data Warehouse in Alibaba Cloud
- Streaming View: An Efficient Data Processing Engine for Modern Real-time Data Warehouse of Alibaba Cloud
- Cost-Effective, Low Latency Vector Search with Azure Cosmos DB
- Ursa: A Lakehouse-Native Data Streaming Engine for Kafka
- Delta Sharing: An Open Protocol for Cross-Platform Data Sharing
- SQL:Trek Automated Index Design at Airbnb
- TCO2: Analyzing the Carbon Footprint of Database Server Replacements
- FDepHunter: Harnessing Negative Examples to Expose Fakes and Reveal Ghosts
- VIDEX: A Disaggregated and Extensible Virtual Index for Cloud-Native and AI-Driven Databases
- DVote: Constraining Committee Voting with Database Dependencies
- Graph Compression for Interpretable Graph Neural Network Inference At Scale
- Query running too slow? Rewrite it with Quorion!
- Demonstration of ModelarDB: Model-Based Management of High-Frequency Time Series Across Edge, Cloud, and Client
- Democratize MATCH_RECOGNIZE!
- Opening The Black-Box: Explaining Learned Cost Models For Databases
- Horizon: Robust Checks for SQL Migration Using LLMs
- A Demonstration of QueryArtisan: Real-Time Data Lake Analysis via Dynamically Generated Data Manipulation Code
- RecForUS: A Recommender System for Uncertain Scores
- PrivEval: a tool for interactive evaluation of privacy metrics in synthetic data generation
- Styx in Action: Transactional Cloud Applications Made Easy
- Can Surrogate Keys Negatively Impact Data Quality?
- JUSTINE (JUST-INsert Engine): Demonstrating Self-organizing Data Schemas
- Unify: A System For Unstructured Data Analytics
- UmbraPerf - Profiling Results Tailored for DBMS Developers
- Smart SPARQL Advisor: Guiding Users in Query Formulation with Performance Prediction
- Analytics Are Heavy. The DBMS Is Busy. When Will My Mission-Critical Transaction Start Running?
- Accelerating Tabular Inference: Training Data Generation with TENET
- Accordion: Balancing Performance and Cost in Cloud-Native Data Analysis with Intra-Query Runtime Elasticity
- Demonstration of Reflex: How SMPC Query Execution can be sped up through Efficient and Flexible Intermediate Result Size Trimming
- Enter the Warp: Fast and Adaptive Data Transfer with XDBC
- RadlER: Deduplicated Sampling On-Demand
- MLN-geeWhiz: A Dashboard for Supporting Complete Life-Cycle of Complex Data Analysis using Multilayer Networks
- Hint-QPT: Hints for Robust Query Performance Tuning
- ClaimIt: Finding Convincing Views to Endorse a Claim
- DortDB: Bridging Query Languages for Multi-Model Data Ponds
- DemandClean: A Multi-Objective Learning Framework for Balancing Model Tolerance to Data Authenticity and Diversity
- TARImpute: Task-Aware Auto-Recommender System for Missing Value Imputation Algorithms with Clustering Case Studies
- A Demonstration of POLARIS: An Interactive and Scalable Data Infrastructure for Polar Science
- GooseDB: A Database Engine that Optimally Refines Top-k Queries to Satisfy Representation Constraints
- NeuroFlinkCEP: Neurosymbolic Complex Event Recognition Optimized across IoT Platforms
- mlidea: Interactively Improving ML Data Preparation Code via "Shadow Pipelines"
- Mining Meaningful Keys and Foreign Keys with High Precision and Recall
- SDG-KG: A Framework to Compute SDG Indicator using Open Data
- FedVSE: A Privacy-Preserving and Efficient Vector Search Engine for Federated Databases
- APEX-DAG: Library and Language independent Pipeline EXtraction
- Demonstrating Matelda for Multi-Table Error Detection
- DBPecker: A Graph-Based Compound Anomaly Diagnosis System for Distributed RDBMSs
- DocDB: A Database for Unstructured Document Analysis
- ContextCache: Context-Aware Semantic Cache for Multi-Turn Queries in Large Language Models
- Simulating a Transactional Server for Multi-Model Systems
- TableCopilot: A Table Assistant Empowered by Natural Language Conditional Table Discovery
- LETIndex: A Secure Learned Index with TEE
- Play2Win: A Windowing Playground for Continuous Queries
- Vadacode: A Logician-friendly IDE for Datalog+/-
- Beyond Quacking: Deep Integration of Language Models and RAG into DuckDB
- SAIL: A Voyage to Symbolic Approximation Solutions for Time-Series Analysis
- Buckaroo: A Direct Manipulation Visual Data Wrangler
- Sort it Like You Mean It: Discovering Semantically Interesting Attribute Augmentations to Sort Tables
- EasyAD: A Demonstration of Automated Solutions for Time-Series Anomaly Detection
- LASEK: LLM-Assisted Style Exploration Kit for Geospatial Data
- A Demonstration of Q2O: Quantum-augmented Query Optimizer
- When Entity/Relationship Models Meet Graph Databases
- Synthetic Tabular Data: methods, attacks and defenses
- Large Language Models for Spatial Analysis Queries
- Data Disovery in Data Lakes: Operations, Indexes, Systems
- Systems for Scalable Graph Analytics and Machine Learning: Trends and Methods
- Natural Language to SQL: State of the Art and Open Problems
- New Trends in Data Forgetting for Sustainable Data Management
- Property Graph Standards: State of the Art & Open Challenges
- Learned Cost Models for Query Optimization: From Batch to Streaming Systems
- Filtered Vector Search: State-of-the-art and Research Challenges
- ML-Asset Management: Curation, Discovery, and Utilization
- Machine Learning for Graph Data Management and Query Processing
- Database Perspective on LLM Inference Systems
- Beyond Incrementalism: How to Change the World Through Data Systems Research (VLDB 2025 Panel)
- Where Does Academic Database Research Go From Here?
- Open Science: A New Paradigm for the Research Lifecycle
- Panel on Neural Relational Data: Tabular Foundation Models, LLMs... or both?
- Versatile Property Graph Transformations
- Disaggregation: A New Architecture for Cloud Databases
- Still Asking: How Good Are Query Optimizers, Really?
- Alphabets, Grammars, Calculators, and the End of Hand-Crafted Systems
- Bridging Disciplines in Data Management Research to Solve Complex Data Problems
- Bringing the Operational and Analytical Worlds Together with Lakebase
- Front Matter
- E2ETune: End-to-End Knob Tuning via Fine-tuned Generative Language Model
- SunStorm: Geographically distributed transactions over Aurora-style systems
- Sampling-based Predictive Database Buffer Management
- AXE: A Task Decomposition Approach to Learned LSM Tuning
- Mayura: Exploiting Similarities in Motifs for Temporal Co-Mining
- Mix & Match: Subgraph Matching for Absolute Coverage
- In-depth Analysis of Graph-based RAG in a Unified Framework
- CloudGlide: Deconstructing the Landscape of Cloud-Based Analytics
- Algorithmic Data Minimization for Machine Learning over Internet-of-Things Data Streams
- LiquidCache: Efficient Pushdown Caching for Cloud-Native Data Analytics
- Cleaning both Data Errors and Inaccurate Constraints on Numerical Sequential Data
- Analyzing Near-Network Hardware Acceleration with Co-Processing on DPUs
- An Evaluation of N-Gram Selection Strategies for Regular Expression Indexing in Contemporary Text Analysis Tasks
- Graph Transformers for Query Plan Representation: Potentials and Challenges
- Exploring Exploratory Querying
- Finding Time-Proximity Communities in Temporal Heterogeneous Information Networks
- Errata for "CGgraph: An Ultra-Fast Graph Processing System on Modern Commodity CPU-GPU Co-processor"
Volume 17
https://www.vldb.org/pvldb/volumes/17/
- Front Matter
- DecLog: Decentralized Logging in Non-Volatile Memory for Time Series Database Systems
- Efficient Dynamic Weighted Set Sampling and Its Extension
- ZIP: Lazy Imputation during Query Processing
- FedGTA: Topology-aware Averaging for Federated Graph Learning
- Host Profit Maximization: Leveraging Performance Incentives and User Flexibility
- DP-PQD: Privately Detecting Per-Query Gaps In Synthetic Data Generated By Black-Box Mechanisms
- Front Matter
- Cryptographically Secure Private Record Linkage Using Locality-Sensitive Hashing
- Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes
- Query Refinement for Diversity Constraint Satisfaction
- ElasticNotebook: Enabling Live Migration for Computational Notebooks
- Breathing New Life into An Old Tree: Resolving Logging Dilemma of $B^{+}$-tree on Modern Computational Storage Drives
- An Empirical Evaluation of Columnar Storage Formats
- Everest: GPU-Accelerated System For Mining Temporal Motifs
- Billion-Scale Bipartite Graph Embedding: A Global-Local Induced Approach
- Utility-aware Payment Channel Network Rebalance
- ALECE: An Attention-based Learned Cardinality Estimator for SPJ Queries on Dynamic Workloads
- Flash-LLM: Enabling Low-Cost and Highly-Efficient Large Generative Model Inference With Unstructured Sparsity
- Confidential Consortium Framework: Secure Multiparty Applications with Confidentiality, Integrity, and High Availability
- VeLP: Vehicle Loading Plan Learning from Human Behavior in Nationwide Logistics System
- Relational Query Synthesis ⋈ Decision Tree Learning
- Front Matter
- RAGraph: A Region-Aware Framework for Geo-Distributed Graph Processing
- SmartLite: A DBMS-based Serving System for DNN Inference in Resource-constrained Environments
- Blocker and Matcher Can Mutually Benefit: A Co-Learning Framework for Low-Resource Entity Resolution
- TSGBench: Time Series Generation Benchmark
- OmniSketch: Efficient Multi-Dimensional High-Velocity Stream Analytics with Arbitrary Predicates
- Maximum Balanced (k, ε)-Bitruss Detection in Signed Bipartite Graph
- Missing Value Imputation for Multi-attribute Sensor Data Streams via Message Propagation
- ImDiffusion: Imputed Diffusion Models for Multivariate Time Series Anomaly Detection
- Confidence Intervals for Private Query Processing
- A Shapelet-based Framework for Unsupervised Multivariate Time Series Representation Learning
- Fast and Space-Efficient Parallel Algorithms for Influence Maximization
- TERI: An Effective Framework for Trajectory Recovery with Irregular Time Intervals
- Demystifying Graph Sparsification Algorithms in Graph Properties Preservation
- GPU Database Systems Characterization and Optimization
- NeutronStream: A Dynamic GNN Training Framework with Sliding Window for Graph Streams
- Caerus: Low-Latency Distributed Transactions for Geo-Replicated Systems
- An Experimental Evaluation of Anomaly Detection in Time Series
- FormaT5: Abstention and Examples for Conditional Table Formatting with Natural Language
- Quantum-Inspired Digital Annealing for Join Ordering
- KAMEL: A Scalable BERT-based System for Trajectory Imputation
- An Efficient Transfer Learning Based Configuration Adviser for Database Tuning
- ADF & TransApp: A Transformer-Based Framework for Appliance Detection Using Smart Meter Consumption Series
- RALF: Accuracy-Aware Scheduling for Feature Store Maintenance
- The Art of Latency Hiding in Modern Database Engines
- MOSER: Scalable Network Motif Discovery using Serial Test
- Co-movement Pattern Mining from Videos
- Front Matter
- Efficient and Accurate SimRank-based Similarity Joins: Experiments, Analysis, and Improvement
- Expanding Reverse Nearest Neighbors
- Errata for "SpaceSaving±: An Optimal Algorithm for Frequency Estimation and Frequent Items in the Bounded-Deletion Model"
- Cache-Efficient Top-k Aggregation over High Cardinality Large Datasets
- Efficient Temporal Butterfly Counting and Enumeration on Temporal Bipartite Graphs
- TVM: A Tile-based Video Management Framework
- ScienceBenchmark: A Complex Real-World Benchmark for Evaluating Natural Language to SQL Systems
- Densest Multipartite Subgraph Search in Heterogeneous Information Networks
- Saturn: An Optimized Data System for Multi-Large-Model Deep Learning Workloads
- BonsaiKV: Towards Fast, Scalable, and Persistent Key-Value Stores with Tiered, Heterogeneous Memory System
- Sample-Efficient Cardinality Estimation Using Geometric Deep Learning
- Multiple Time Series Forecasting with Dynamic Graph Modeling
- Weakly Guided Adaptation for Robust Time Series Forecasting
- Algorithmic Complexity Attacks on Dynamic Learned Indexes
- METER: A Dynamic Concept Adaptation Framework for Online Anomaly Detection
- Experimental Analysis of Large-scale Learnable Vector Storage Compression
- A Comparative Study and Component Analysis of Query Plan Representation Techniques in ML4DB Studies
- Testing Graph Database Systems via Graph-Aware Metamorphic Relations
- Observatory: Characterizing Embeddings of Relational Tables
- FusionFlow: Accelerating Data Preprocessing for Machine Learning with CPU-GPU Cooperation
- BOSS - An Architecture for Database Kernel Composition
- CoroGraph: Bridging Cache Efficiency and Work Efficiency for Graph Algorithm Execution
- Mammoths Are Slow: The Overlooked Transactions of Graph Data
- VeriDKG: A Verifiable SPARQL Query Engine for Decentralized Knowledge Graphs
- Front Matter
- Eraser: Eliminating Performance Regression on Learned Query Optimizer
- HyBench: A New Benchmark for HTAP Databases
- Falcon: Fair Active Learning using Multi-armed Bandits
- A Blockchain System for Clustered Federated Learning with Peer-to-Peer Knowledge Transfer
- PilotScope: Steering Databases with Machine Learning Drivers
- Timestamp as a Service, not an Oracle
- Data-Driven Insight Synthesis for Multi-Dimensional Data
- Database Native Model Selection: Harnessing Deep Neural Networks in Database Systems
- Querying Structural Diversity in Streaming Graphs
- LM-SRPQ: Efficiently Answering Regular Path Query in Streaming Graphs
- ETC: Efficient Training of Temporal Graph Neural Networks over Large-scale Dynamic Graphs
- Towards Full Stack Adaptivity in Permissioned Blockchains
- BigST: Linear Complexity Spatio-Temporal Graph Neural Network for Traffic Forecasting on Large-Scale Road Networks
- SepHash: A Write-Optimized Hash Index On Disaggregated Memory via Separate Segment Structure
- XGNN: Boosting Multi-GPU GNN Training via Global GNN Memory Store
- Communication Efficient and Provable Federated Unlearning
- Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation
- Scaling Package Queries to a Billion Tuples via Hierarchical Partitioning and Customized Optimization
- Front Matter
- MisDetect: Iterative Mislabel Detection using Early Loss
- Capturing More Associations by Referencing External Graphs
- QTCS: Efficient Query-Centered Temporal Community Search
- DPSUR: Accelerating Differentially Private Stochastic Gradient Descent Using Selective Update and Release
- How Can We Train Deep Learning Models Across Clouds and Continents? An Experimental Study
- Accelerating Sampling and Aggregation Operations in GNN Frameworks with GPU Initiated Direct Storage Accesses
- Comprehensive Evaluation of GNN Training Systems: A Data Management Perspective
- LION: Fast and High-Resolution Network Kernel Density Visualization
- Performance-Based Pricing of Federated Learning via Auction
- OEBench: Investigating Open Environment Challenges in Real-World Relational Data Streams
- Influence Maximization via Vertex Countering
- Optimizing Data Acquisition to Enhance Machine Learning Performance
- Minimum Strongly Connected Subgraph Collection in Dynamic Graphs
- FusionQuery: On-demand Fusion Queries over Multi-source Heterogeneous Data
- POLAR: Adaptive and Non-invasive Join Order Selection via Plans of Least Resistance
- DAHA: Accelerating GNN Training with Data and Hardware Aware Execution Planning
- FluidKV: Seamlessly Bridging the Gap between Indexing Performance and Memory-Footprint on Ultra-Fast Storage
- How do Categorical Duplicates Affect ML? A New Benchmark and Empirical Analyses
- CGgraph: An Ultra-fast Graph Processing System on Modern Commodity CPU-GPU Co-processor
- FCBench: Cross-Domain Benchmarking of Lossless Compression for Floating-point Data
- PairwiseHist: Fast, Accurate, and Space-Efficient Approximate Query Processing with Data Compression
- MetaStore: Analyzing Deep Learning Meta-Data at Scale
- RTScan: Efficient Scan with Ray Tracing Cores
- FreshGNN: Reducing Memory Access via Stable Historical Embeddings for Graph Neural Network Training
- Sorting on Byte-Addressable Storage: The Resurgence of Tree Structure
- Efficient Placement of Decomposable Aggregation Functions for Stream Processing over Large Geo-Distributed Topologies
- AeonG: An Efficient Built-in Temporal Support in Graph Databases
- Front Matter
- Refactoring Index Tuning Process with Benefit Estimation
- LightDiC: A Simple yet Effective Approach for Large-scale Digraph Representation Learning
- Efficient Differential Dependency Discovery
- Is Your Learned Query Optimizer Behaving As You Expect? A Machine Learning Perspective
- Mixed Covers of Keys and Functional Dependencies for Maintaining the Integrity of Data under Updates
- Outlier Summarization via Human Interpretable Rules
- Nuhuo: An Effective Estimation Model for Traffic Speed Histogram Imputation on A Road Network
- Intelligent Pooling: Proactive Resource Provisioning in Large-scale Cloud Service
- Efficient Exact Subgraph Matching via GNN-based Path Dominance Embedding
- Leveraging Dynamic and Heterogeneous Workload Knowledge to Boost the Performance of Index Advisors
- UltraLogLog: A Practical and More Space-Efficient Alternative to HyperLogLog for Approximate Distinct Counting
- Real-time Insertion Operator for Shared Mobility on Time-Dependent Road Networks
- X-TED: Massive Parallelization of Tree Edit Distance
- Cardinality Estimation of Subgraph Matching: A Filtering-Sampling Approach
- Efficient Regular Simple Path Queries under Transitive Restricted Expressions
- A Multi-Scale Decomposition MLP-Mixer for Time Series Analysis
- P-Shapley: Shapley Values on Probabilistic Classifiers
- Optimizing Video Selection LIMIT Queries With Commonsense Knowledge
- ZeroEA: A Zero-Training Entity Alignment Framework via Pre-Trained Language Model
- Extending Graph Rules with Oracles
- Front Matter
- FlowWalker: A Memory-efficient and High-performance GPU-based Dynamic Graph Random Walk Framework
- Accelerating String-key Learned Index Structures via Memoization-based Incremental Training
- Truss-based Community Search over Streaming Directed Graphs
- InferDB: In-Database Machine Learning Inference Using Indexes
- AAA: an Adaptive Mechanism for Locally Differential Private Mean Estimation
- Accelerating Merkle Patricia Trie with GPU
- Privacy Amplification via Shuffling: Unified, Simplified, and Tightened
- Detecting Metadata-Related Logic Bugs in Database Systems via Raw Database Construction
- From Zero to Hero: Detecting Leaked Data through Synthetic Data Injection and Model Querying
- Oasis: An Optimal Disjoint Segmented Learned Range Filter
- LakeBench: A Benchmark for Discovering Joinable and Unionable Tables in Data Lakes
- GPTuner: A Manual-Reading Database Tuning System via GPT-Guided Bayesian Optimization
- Raising the ClaSS of Streaming Time Series Segmentation
- Fast Local Subgraph Counting
- ReAcTable: Enhancing ReAct for Table Question Answering
- NeutronOrch: Rethinking Sample-based GNN Training under CPU-GPU Heterogeneous Environments
- Rapidash: Efficient Detection of Constraint Violations
- Differentially Private Data Generation with Missing Data
- Everything You Always Wanted to Know About Storage Compressibility of Pre-Trained ML Models but Were Afraid to Ask
- Fight Fire with Fire: Towards Robust Graph Neural Networks on Dynamic Graphs via Actively Defense
- SeLeP: Learning Based Semantic Prefetching for Exploratory Database Workloads
- Contributions Estimation in Federated Learning: A Comprehensive Experimental Evaluation
- Visualization-aware Time Series Min-Max Caching with Error Bound Guarantees
- CHORUS: Foundation Models for Unified Data Discovery and Exploration
- Cloud-Native Database Systems and Unikernels: Reimagining OS Abstractions for Modern Hardware
- Front Matter
- CIVET: Exploring Compact Index for Variable-Length Subsequence Matching on Time Series
- Spatialyze: A Geospatial Video Analytics System with Spatial-Aware Optimizations
- Optimal Matrix Sketching over Sliding Windows
- Window Function Expression: Let the Self-join Enter
- SplitDF: Splitting Dataframes for Memory-Efficient Data Analysis
- Sampling Methods for Inner Product Sketching
- DIDS: Double Indices and Double Summarizations for Fast Similarity Search
- Improving Graph Compression for Efficient Resource-Constrained Graph Analytics
- Efficient Unsupervised Community Search with Pre-trained Graph Transformer
- DET-LSH: A Locality-Sensitive Hashing Scheme with Dynamic Encoding Tree for Approximate Nearest Neighbor Search
- BIRD: Efficient Approximation of Bidirectional Hidden Personalized PageRank
- GENTI: GPU-powered Walk-based Subgraph Extraction for Scalable Representation Learning on Dynamic Graphs
- ArcheType: A Novel Framework for Open-Source Column Type Annotation using Large Language Models
- Trajectory Similarity Measurement: An Efficiency Perspective
- BYO: A Unified Framework for Benchmarking Large-Scale Graph Containers
- Secure and Verifiable Data Collaboration with Low-Cost Zero-Knowledge Proofs
- Rashnu: Data-Dependent Order-Fairness
- Sparcle: Boosting the Accuracy of Data Cleaning Systems through Spatial Awareness
- TFB: Towards Comprehensive and Fair Benchmarking of Time Series Forecasting Methods
- FSM: A Fine-grained Splitting and Merging Framework for Dual-balanced Graph Partition
- Efficient and Reliable Estimation of Knowledge Graph Accuracy
- Front Matter
- Breaking It Down: An In-depth Study of Index Advisors
- Accelerating Maximal Clique Enumeration via Graph Reduction
- POLIGRAS: Policy-based Graph Summarization
- SWAT: A System-Wide Approach to Tunable Leakage Mitigation in Encrypted Data Stores
- TIGER: Training Inductive Graph Neural Network for Large-scale Knowledge Graph Reasoning
- Incremental Sliding Window Connectivity over Streaming Graphs
- CohortNet: Empowering Cohort Discovery for Interpretable Healthcare Analytics
- Efficient Influence Minimization via Node Blocking
- D-Bot: Database Diagnosis System using Large Language Models
- Blitzcrank: Fast Semantic Compression for In-memory Online Transaction Processing
- Spectrum: Speedy and Strictly-Deterministic Smart Contract Transactions for Blockchain Ledgers
- Fast Commitment for Geo-Distributed Transactions via Decentralized Co-coordinators
- CXL and the Return of Scale-Up Database Engines
- Inductive Attributed Community Search: to Learn Communities across Graphs
- I/O Efficient Label-Constrained Reachability Queries in Large Graphs
- DEX: Scalable Range Indexing on Disaggregated Memory
- Automatic Data Repair: Are We Ready to Deploy?
- Biathlon: Harnessing Model Resilience for Accelerating ML Inference Pipelines
- Distributed Shortest Distance Labeling on Large-Scale Graphs
- Efficient Parallel D-core Decomposition at Scale
- Efficient Discovery of Significant Patterns with Few-Shot Resampling
- Front Matter
- Robust Best Point Selection under Unreliable User Feedback
- Towards Optimal Transaction Scheduling
- QCore: Data-Efficient, On-Device Continual Calibration for Quantized Models
- Efficient Algorithms for Pseudoarboricity Computation in Large Static and Dynamic Graphs
- RoarGraph: A Projected Bipartite Graph for Efficient Cross-Modal Approximate Nearest Neighbor Search
- Combining Small Language Models and Large Language Models for Zero-Shot NL2SQL
- D3-GNN: Dynamic Distributed Dataflow for Streaming Graph Neural Networks
- Distance-based Outlier Query Optimization in Apache IoTDB
- TC-Match: Fast Time-constrained Continuous Subgraph Matching
- Automating the Enterprise with Foundation Models
- Efficient Index for Temporal Core Queries over Bipartite Graphs
- Uldp-FL: Federated Learning with Across Silo User-Level Differential Privacy
- Evolution Forest Index: Towards Optimal Temporal $k$-Core Component Search via Time-Topology Isomorphic Computation
- Eliminating Data Processing Bottlenecks in GNN Training over Large Graphs via Two-level Feature Compression
- Towards Systematic Index Dynamization
- Ensemble Clustering based on Meta-Learning and Hyperparameter Optimization
- Efficient Stochastic Routing in Path-Centric Uncertain Road Networks
- Transforming Property Graphs
- Are Large Language Models a Good Replacement of Taxonomies?
- Efficient Algorithms for Density Decomposition on Large Static and Dynamic Graphs
- Efficient Maximal Motif-Clique Enumeration over Large Heterogeneous Information Networks
- OUTRE: An OUT-of-core De-REdundancy GNN Training Framework for Massive Graphs within A Single Machine
- On Reducing Space Amplification with Multi-Column Compaction in Apache IoTDB
- AutoTSAD: Unsupervised Holistic Anomaly Detection for Time Series Data
- Enabling Window-Based Monotonic Graph Analytics with Reusable Transitional Results for Pattern-Consistent Queries
- When Amnesia Strikes: Understanding and Reproducing Data Loss Bugs with Fault Injection
- PriPL-Tree: Accurate Range Query for Arbitrary Distribution under Local Differential Privacy
- Win-Win: On Simultaneous Clustering and Imputing over Incomplete Data
- HRNet: Differentially Private Hierarchical and Multi-Resolution Network for Human Mobility Data Synthesization
- Efficiently Mitigating the Impact of Data Drift on Machine Learning Pipelines
- PCSP: Efficiently Answering Label-Constrained Shortest Path Queries in Road Networks
- Efficient Enumeration of Recursive Plans in Transformation-based Query Optimizers
- Enriching Relations with Additional Attributes for ER
- Enhancing Accuracy for Super Spreader Identification in High-Speed Data Streams
- Privately Answering Queries on Skewed Data via Per-Record Differential Privacy
- Agile-Ant: Self-managing Distributed Cache Management for Cost Optimization of Big Data Applications
- Complex Event Recognition with Symbolic Register Transducers
- HAIChart: Human and AI Paired Visualization System
- A Sampling-based Framework for Hypothesis Testing on Large Attributed Graphs
- LLM-PBE: Assessing Data Privacy in Large Language Models
- Robust Join Processing with Diamond Hardened Joins
- DARKER: Efficient Transformer with Data-driven Attention Mechanism for Time Series
- Efficient Maximal Frequent Group Enumeration in Temporal Bipartite Graphs
- Optimizing Video Queries with Declarative Clues
- Fainder: A Fast and Accurate Index for Distribution-Aware Dataset Search
- nsDB: Architecting the Next Generation Database by Integrating Neural and Symbolic Systems (Vision)
- Two Birds With One Stone: Designing a Hybrid Cloud Storage Engine for HTAP
- DDS: DPU-optimized Disaggregated Storage
- The Dawn of Natural Language to SQL: Are We Fully Ready? [Experiment, Analysis & Benchmark ]
- Counterfactual Explanation of the Shapley Value in Data Coalitions
- Searching Data Lakes for Nested and Joined Data
- Efficient Betweenness Centrality Computation over Large Heterogeneous Information Networks
- The Holon Approach for Simultaneously Tuning Multiple Components in a Self-Driving Database Management System with Machine Learning via Synthesized Proto-Actions
- DynaHB: A Communication-Avoiding Asynchronous Distributed Framework with Hybrid Batches for Dynamic GNN Training
- Efficient kNN Search in Public Transportation Networks
- LITS: An Optimized Learned Index for Strings
- OLAP on Modern Chiplet-Based Processors
- Bf-Tree: A Modern Read-Write-Optimized Concurrent Larger-Than-Memory Range Index
- Partition, Don't Sort! Compression Boosters for Cloud Data Ingestion Pipelines
- Chameleon: Foundation Models for Fairness-aware Multi-modal Data Augmentation to Enhance Coverage of Minorities
- DAFDiscover: Robust Mining Algorithm for Dynamic Approximate Functional Dependencies on Dirty Data
- Hardware-Efficient Data Imputation through DBMS Extensibility
- Generating Succinct Descriptions of Database Schemata for Cost-Efficient Prompting of Large Language Models
- Saving Money for Analytical Workloads in the Cloud
- ReCG: Bottom-Up JSON Schema Discovery Using a Repetitive Cluster-and-Generalize Framework
- Optimizing Collections of Bloom Filters within a Space Budget
- A Spark Optimizer for Adaptive, Fine-Grained Parameter Tuning
- Texera: A System for Collaborative and Interactive Data Analytics Using Workflows
- Efficient Validation of SHACL Shapes with Reasoning
- QED: A Powerful Query Equivalence Decider for SQL
- Index Advisors on Quantum Platforms
- Blueprinting the Cloud: Unifying and Automatically Optimizing Cloud Data Infrastructures with BRAD
- Aleph Filter: To Infinity in Constant Time
- RUSH: Real-time Burst Subgraph Discovery in Dynamic Graphs
- A Benchmark Study of Deep-RL Methods for Maximum Coverage Problems over Graphs
- Hit the Gym: Accelerating Query Execution to Efficiently Bootstrap Behavior Models for Self-Driving Database Management Systems
- Why TPC Is Not Enough: An Analysis of the Amazon Redshift Fleet
- Efficient k-Clique Count Estimation with Accuracy Guarantee
- Front Matter
- Cloud Actor-Oriented Database Transactions in Orleans
- ClickHouse - Lightning Fast Analytics for Everyone
- PALF: Replicated Write-ahead Logging for Distributed Databases
- Towards Resource Efficiency: Practical Insights into Large-Scale Spark Workloads at ByteDance
- SingleStore-V: An Integrated Vector Database System in SingleStore
- GaussDB: A Cloud-Native Multi-Primary Database with Compute-Memory-Storage Disaggregation
- LavaStore: ByteDance’s Purpose-built, High-performance, Cost-effective Local Storage Engine for Cloud Services
- Membrane - Safe and Performant Data Access Controls in Apache Spark in the Presence of Imperative Code
- An Examination of CXL Memory Use Cases for In-Memory Database Management Systems using SAP HANA
- KGFabric: A Scalable Knowledge Graph Warehouse for Enterprise Data Interconnection
- Db2une: Tuning Under Pressure via Deep Learning
- TDSQL: Tencent Distributed Database System
- A Flexible Forecasting Stack
- Galaxybase: A High Performance Native Distributed Graph Database for HTAP
- SecuDB: An In-enclave Privacy-preserving and Tamper-resistant Relational Database
- AutoTQA: Towards Autonomous Tabular Question Answering through Multi-Agent Large Language Models
- ResLake: Towards Minimum Job Latency and Balanced Resource Utilization in Geo-distributed Job Scheduling
- Adaptive and Robust Query Execution for Lakehouses At Scale
- Transparent Migration from Datastore to Firestore
- Complex-Path: Effective and Efficient Node Ranking with Paths in Billion-Scale Heterogeneous Graphs
- SecretFlow-SCQL: A Secure Collaborative Query pLatform
- Towards Millions of Database Transmission Services in the Cloud
- Large-Scale Metric Computation in Online Controlled Experiment Platform
- X-Stor: A Cloud-native NoSQL Database Service with Multi-model Support
- Resource Management in Aurora Serverless
- SQL has problems. We can fix them: Pipe syntax in SQL
- Apache TsFile: An IoT-native Time Series File Format
- Presto’s History-based Query Optimizer
- OptScaler: A Collaborative Framework for Robust Autoscaling in the Cloud
- Dealing with Acronyms, Abbreviations, and Typos in Real-World Entity Matching
- Lindorm-UWC: An Ultra-Wide-Column Database for Internet of Vehicles
- DLRover-RM: Resource Optimization for Deep Recommendation Models Training in the cloud
- Differentially Private Stream Processing at Scale
- Petabyte-Scale Row-Level Operations in Data Lakehouses
- SPADE: Synthesizing Data Quality Assertions for Large Language Model Pipelines
- Simple (yet Efficient) Function Authoring for Vectorized Engines
- Grouping, Subsumption, and Duplicator Optimizations in Oracle
- LLM for Data Management
- Native Distributed Databases: Problems, Challenges and Opportunities
- A Reproducible Tutorial on Reproducibility in Database Systems Research
- Fairness in Preference Queries: Social Choice Theories Meet Data Management
- Time-Series Anomaly Detection: Overview and New Trends
- Consensus in Data Management With Use Cases in Edge-Cloud and Blockchain Systems
- Efficient Training of Graph Neural Networks on Large Graphs
- Workload Placement on Heterogeneous CPU-GPU Systems
- Spatial Query Optimization With Learning
- Composable Data Management: An Execution Overview
- Spade: A Real-Time Fraud Detection Framework
- A Data-driven Spatiotemporal Simulator for Reinforcement Learning Methods
- BFTGym: An Interactive Playground for BFT Protocols
- DTGraph: Declarative Transformations of Property Graphs
- MLOS in Action: Bridging the Gap Between Experimentation and Auto-Tuning in the Cloud
- Snapcase - Regain Control over Your Predictions with Low-Latency Machine Unlearning
- DiversiNews: Enriching News Consumption with Relevant yet Diverse News Articles Retrieval
- SpannerLib: Embedding Declarative Information Extraction in an Imperative Workflow
- Demonstrating TabEE: Tabular Embedding Explanations
- Navigating Data Repositories: Utilizing Line Charts to Discover Relevant Datasets
- Graph Association Analyses for Early Drug Discovery
- Demonstration of MaskSearch: Efficiently Querying Image Masks for Machine Learning Workflows
- Looking Deeply into the Magic Mirror: An Interactive Analysis of Database Index Selection Approaches
- UTOPIA: Automatic Pivot Table Assistant
- TSGAssist: An Interactive Assistant Harnessing LLMs and RAG for Time Series Generation Recommendations and Benchmarking
- DoppelGanger++ in Action: A Database Replay System with Fast Dependency Graph Generation
- LucidScript: Bottom-up Standardization for Data Preparation
- OSSInsight: Scalable GitHub Analysis
- IsoVista: Black-box Checking Database Isolation Guarantees
- ImputeVIS: An Interactive Evaluator to Benchmark Imputation Techniques for Time Series Data
- An Interactive Multi-modal Query Answering System with Retrieval-Augmented Large Language Models
- DBG-PT: A Large Language Model Assisted Query Performance Regression Debugger
- Rodeo: Making Refinements for Diverse Top-k Queries
- QPJVis Demo: Quality-boost Progressive Join Query Processing System
- Counterfactual Explanation Analytics: Empowering Lay Users to Take Action Against Consequential Automated Decisions
- UniView: A Unified Autonomous Materialized View Management System for Various Databases
- A Demonstration of TENDS: Time Series Management System based on Model Selection
- SEER: An End-to-End Toolkit for Benchmarking Time Series Database Systems in Monitoring Applications
- Demonstration of DB-GPT: Next Generation Data Interaction System Empowered by Large Language Models
- DeepSketch: A Query Sketching Interface for Deep Time Series Similarity Search
- Rock: Cleaning Data with both ML and Logic Rules
- Clean4TSDB: A Data Cleaning Tool for Time Series Databases
- LakeCompass: An End-to-End System for Table Maintenance, Search and Analysis in Data Lakes
- DOP-SQL: A General-purpose, High-utility, and Extensible Private SQL System
- Catcher: A Cache Analysis System for Top-k Pub/Sub Service
- Optimizing Distributed Tiered Data Storage Systems with DITIS
- VQFT: A Visual Query Approach Based on Full-Text Search for Knowledge Graphs
- CORAL: Collaborative Automatic Labeling System based on Large Language Models
- CMixing: An Efficient Coin Mixing Platform to Enhance Anonymity in Cryptocurrency Transactions
- CyNetDiff: A Python Library for Accelerated Implementation of Network Diffusion Models
- EncChain: Enhancing Large Language Model Applications with Advanced Privacy Preservation Techniques
- FairEM360: A Suite for Responsible Entity Matching
- RetClean: Retrieval-Based Tabular Data Cleaning Using LLMs and Data Lakes
- Mach: Firefighting Time-Critical Issues in Complex Systems Using High-Frequency Telemetry
- SketchQL Demonstration: Zero-shot Video Moment Querying with Sketches
- DataPrice: An Interactive System for Pricing Datasets in Data Marketplaces
- Demonstration of the VeriEQL Equivalence Checker for Complex SQL Queries
- FedSQ: A Secure System for Federated Vector Similarity Queries
- FedSM: A Practical Federated Shared Mobility System
- DataLoom: Simplifying Data Loading with LLMs
- Demonstration of VCR: A Tabular Data Slicing Approach to Understanding Object Detection Model Performance
- ModsNet: Performance-aware Top-k Model Search using Exemplar Datasets
- OFL-W3: A One-shot Federated Learning System on Web 3.0
- Swift: A Data-Driven Flight Planning System at Scale
- Pyneapple-G: Scalable Spatial Grouping Queries
- PD-Explain: A Unified Python-native Framework for Query Explanations Over DataFrames
- HocoPG: A Database System with Homomorphic Compression for Text Processing
- Chat2Data: An Interactive Data Analysis System with RAG, Vector Databases and LLMs
- PrismX: A Single-Machine System for Querying Big Graphs
- TimeCSL: Unsupervised Contrastive Learning of General Shapelets for Explorable Time Series Analysis
- HSAP: A Human-in-the-loop Social Media-based Situation Awareness Platform
- DB-MAGS: Multi-Anomaly Data Generation System for Transactional Databases
- QuoteInspector: Gaining Insight about Social Media Discussions
- Vector Databases: What’s Really New and What’s Next?
- High-Performance Spatial Data Analytics: Systematic R&D for Scale-Out and Scale-Up Solutions from the Past to Now
- Intelligent Agents for Data Exploration
- Reimagining Deep Learning Systems Through the Lens of Data Systems
- LeanStore: A High-Performance Storage Engine for NVMe SSDs
- Databases Unbound: Querying All of the World’s Bytes with AI
- Sharing Information with Differential Privacy: A Database Perspective
- Harmonizing ML and Databases: A Symphony of Data
- Front Matter
- The Case for DBMS Live Patching
- TenGraph: A Tensor-Based Graph Query Engine
- LARGE: A Length-Aggregation-based Grid Structure for Line Density Visualization
- CausalMesh: A Causal Cache for Stateful Serverless Computing
- The Vadalog Parallel System: Distributed Reasoning with Datalog+/-
- PARQO: Penalty-Aware Robust Plan Selection in Query Optimization
- InBox: Recommendation with Knowledge Graph using Interest Box Embedding
- A Branch-&-Bound Algorithm for Fractional Hypertree Decomposition
- Steiner-Hardness: A Query Hardness Measure for Graph-Based ANN Indexes
- Simpler is More: Efficient Top-K Nearest Neighbors Search on Large Road Networks
- SQL Engines Excel at the Execution of Imperative Programs
- Scaling your Hybrid CPU-GPU DBMS to Multiple GPUs
- Scalable Model-Based Management of Massive High Frequency Wind Turbine Data with ModelarDB
- Eventual Durability
- TUCKET: A Tensor Time Series Data Structure for Efficient and Accurate Factor Analysis over Time Ranges
- Topology-preserving Graph Coarsening: An Elementary Collapse-based Approach
- Efficient Cost Modeling of Space-filling Curves
- Generalizable Data Cleaning of Tabular Data in Latent Space
- Dynamic Graph Databases with Out-of-order Updates
- Powering In-Database Dynamic Model Slicing for Structured Data Analytics
- GastCoCo: Graph Storage and Coroutine-Based Prefetch Co-Design for Dynamic Graph Processing
- MTSClean: Efficient Constraint-based Cleaning for Multi-Dimensional Time Series Data
- Neighborhood-Preserving Graph Sparsification
- ELEET: Efficient Learned Query Execution over Text and Tables
Volume 16
https://www.vldb.org/pvldb/volumes/16/
- Front Matter
- C5: Cloned Concurrency Control That Always Keeps Up
- The Case for Distributed Shared-Memory Databases with RDMA-Enabled Memory Disaggregation
- FlexChain: An Elastic Disaggregated Blockchain
- MiCS: Near-linear Scaling for Training Gigantic Model on Public Cloud
- Privacy-preserving Cooperative Online Matching over Spatial Crowdsourcing Platforms
- Coresets over Multiple Tables for Feature-rich and Data-efficient Machine Learning
- STARRY: Multi-master Transaction Processing on Semi-leader Architecture
- SIFTER: Space-Efficient Value Iteration for Finite-Horizon MDPs
- TreeLine: An Update-In-Place Key-Value Store for Modern Storage
- DPXPlain: Privately Explaining Aggregate Query Answers
- Front Matter
- Efficient Maximum k-Plex Computation over Large Sparse Graphs
- Online Schema Evolution is (almost) Free for Snapshot Databases
- LIDER: An Efficient High-dimensional Learned Index for Large-scale Dense Passage Retrieval
- Models and Mechanisms for Spatial Data Fairness
- Influence Maximization in Real-World Closed Social Networks
- Time2Feat: Learning Interpretable Representations for Multivariate Time Series Clustering
- OpBoost: A Vertical Federated Tree Boosting Framework Based on Order-Preserving Desensitization
- HMAB: Self-Driving Hierarchy of Bandits for Integrated Physical Database Design Tuning
- Erebus: Explaining the Outputs of Data Streaming Queries
- PLIN: A Persistent Learned Index for Non-Volatile Memory with High Performance and Instant Recovery
- Fries: Fast and Consistent Runtime Reconfiguration in Dataflow Systems with Transactional Guarantees
- Fast Approximate Denial Constraint Discovery
- Frequency Domain Data Encoding in Apache IoTDB
- Happiness Maximizing Sets under Group Fairness Constraints
- SHiFT: An Efficient, Flexible Search Engine for Transfer Learning
- Satisfying Complex Top-k Fairness Constraints by Preference Substitutions
- SyncSignature: A Simple, Efficient, Parallelizable Framework for Tree Similarity Joins
- Approximating Probabilistic Group Steiner Trees in Graphs
- Space-Efficient Random Walks on Streaming Graphs
- PromptEM: Prompt-tuning for Low-resource Generalized Entity Matching
- Cornus: Atomic Commit for a Cloud DBMS with Storage Disaggregation
- Front Matter
- Route Travel Time Estimation on A Road Network Revisited: Heterogeneity, Proximity, Periodicity and Dynamicity
- Serving and Optimizing Machine Learning Workflows on Heterogeneous Infrastructures
- Computing Rule-Based Explanations by Leveraging Counterfactuals
- Self-supervised and Interpretable Data Cleaning with Sequence Generative Adversarial Networks
- Optimizing Video Analytics with Declarative Model Relationships
- Spade: A Real-Time Fraud Detection Framework on Evolving Graphs
- Galvatron: Efficient Transformer Training over Multiple GPUs Using Automatic Parallelism
- iEDeaL: A Deep Learning Framework for Detecting Highly Imbalanced Interictal Epileptiform Discharges
- Dalton: Learned Partitioning for Distributed Data Streams
- FirmTruss Community Search in Multilayer Networks
- Efficient Triangle-Connected Truss Community Search In Dynamic Graphs
- Can Learned Models Replace Hash Functions?
- TOD: GPU-accelerated Outlier Detection via Tensor Operations
- FILM: a Fully Learned Index for Larger-than-Memory Databases
- Front Matter
- Cache Me If You Can: Accuracy-Aware Inference Engine for Differentially Private Data Exploration
- Range Search over Encrypted Multi-Attribute Data
- HEDA: Multi-Attribute Unbounded Aggregation over Homomorphically Encrypted Database
- Density Personalized Group Query
- Nezha: Deployable and High-Performance Consensus Using Synchronized Clocks
- Pantheon: Private Retrieval from Public Key-Value Store
- Bayesian Sketches for Volume Estimation in Data Streams
- Waffle: A Workload-Aware and Query-Sensitive Framework for Disk-Based Spatial Indexing
- Fast Algorithms for Denial Constraint Discovery
- Toward Quantity-of-Interest Preserving Lossy Compression for Scientific Data
- Scalable Graph Convolutional Network Training on Distributed-Memory Systems
- Motiflets - Simple and Accurate Detection of Motifs in Time Series
- Can Foundation Models Wrangle Your Data?
- M2Bench: A Database Benchmark for Multi-Model Analytic Workloads
- Parallelism-Optimizing Data Placement for Faster Data-Parallel Computations
- SubStrat: A Subset-Based Optimization Strategy for Faster AutoML
- MultiBiSage: A Web-Scale Recommendation System Using Multiple Bipartite Graphs at Pinterest
- TokenJoin: Efficient Filtering for Set Similarity Join with Maximum Weighted Bipartite Matching
- Quasi-stable Coloring for Graph Compression: Approximating Max-Flow, Linear Programs, and Centrality
- Multi-Analyst Differential Privacy for Online Query Answering
- Excalibur: A Virtual Machine for Adaptive Fine-grained JIT-Compiled Query Execution based on VOILA
- Differentially Oblivious Relational Database Operators
- Keep CALM and CRDT On
- MQH: Locality Sensitive Hashing on Multi-level Quantization Errors for Point-to-Hyperplane Distances
- The LDBC Social Network Benchmark: Business Intelligence Workload
- Making Cache Monotonic and Consistent
- SkinnerMT: Parallelizing for Efficiency and Robustness in Adaptive Query Processing on Multicore Platforms
- On Efficient Approximate Queries over Machine Learning Models
- Integrating Data Lake Tables
- PIM-tree: A Skew-resistant Index for Processing-in-Memory
- Web Record Extraction with Invariants
- A Deep Generative Model for Trajectory Modeling and Utilization
- L2chain: Towards High-performance, Confidential and Secure Layer-2 Blockchain Solution for Decentralized Applications
- Front Matter
- Auto-Tuning with Reinforcement Learning for Permissioned Blockchain Systems
- PetPS: Supporting Huge Embedding Models with Persistent Memory
- Extraction of Validating Shapes from very large Knowledge Graphs
- Async-fork: Mitigating Query Latency Spikes Incurred by the Fork-based Snapshot Mechanism from the OS Level
- Change Propagation Without Joins
- FederatedScope: A Flexible Federated Learning Platform for Heterogeneity
- ACTA: Autonomy and Coordination Task Assignment in Spatial Crowdsourcing Platforms
- FastFlow: Accelerating Deep Learning Model Training with Smart Offloading of Input Data Pipeline
- FARGO: Fast Maximum Inner Product Search via Global Multi-Probing
- Optimistic Data Parallelism for FPGA-Accelerated Sketching
- On the Risks of Collecting Multidimensional Data Under Local Differential Privacy
- Odyssey: A Journey in the Land of Distributed Data Series Similarity Search
- Anonymous Edge Representation for Inductive Anomaly Detection in Dynamic Bipartite Graphs
- Scalable Time-Range k-Core Query on Temporal Graphs
- High-Performance Row Pattern Recognition Using Joins
- A Hierarchical Grouping Algorithm for the Multi-Vehicle Dial-a-Ride Problem
- Front Matter
- Leveraging Application Data Constraints to Optimize Database-Backed Web Applications
- Bringing Compiling Databases to RISC Architectures
- Blink-hash: An Adaptive Hybrid Index for In-Memory Time-Series Databases
- A Design Space Exploration and Evaluation for Main-Memory Hash Joins in Storage Class Memory
- Efficient Black-box Checking of Snapshot Isolation in Databases
- Differentially Private Vertical Federated Clustering
- Panakos: Chasing the Tails for Multidimensional Data Streams
- VersaMatch: Ontology Matching with Weak Supervision
- RECA: Related Tables Enhanced Column Semantic Type Annotation Framework
- Zebra: When Temporal Graph Neural Networks Meet Temporal Personalized PageRank
- Efficient Approximation of Certain and Possible Answers for Ranking and Window Queries over Uncertain Data
- GlassDB: An Efficient Verifiable Ledger Database System Through Transparency
- Efficient Distributed Transaction Processing in Heterogeneous Networks
- Auxo: A Scalable and Efficient Graph Stream Summarization Structure
- OneShotSTL: One-Shot Seasonal-Trend Decomposition For Online Time Series Anomaly Detection And Forecasting
- Cloud Analytics Benchmark
- Scalable and Robust Snapshot Isolation for High-Performance Storage Engines
- FLARE: A Fast, Secure, and Memory-Efficient Distributed Analytics Framework (Flavor: Systems)
- NV-SQL: Boosting OLTP Performance with Non-Volatile DIMMs
- Lero: A Learning-to-Rank Query Optimizer
- Deploying Computational Storage for HTAP DBMSs Takes More Than Just Computation Offloading
- Transactional Panorama: A Conceptual Framework for User Perception in Analytical Visual Interfaces
- Sparkly: A Simple yet Surprisingly Strong TF/IDF Blocker for Entity Matching
- Robust Query Driven Cardinality Estimation under Changing Workloads
- CatSQL: Towards Real World Natural Language to SQL Applications
- Elpis: Graph-Based Similarity Search for Scalable Data Science
- Dotori: A Key-Value SSD Based KV Store
- PreFair: Privately Generating Justifiably Fair Synthetic Data
- Explaining Dataset Changes for Semantic Data Versioning with Explain-Da-V
- Front Matter
- DBSP: Automatic Incremental View Maintenance for Rich Query Languages
- SPG: Structure-Private Graph Database via SqueezePIR
- InfiniStore: Elastic Serverless Cloud Storage
- Distributed Graph Embedding with Information-Oriented Random Walks
- Secure Shapley Value for Cross-Silo Federated Learning
- SODA: A Set of Fast Oblivious Algorithms in Distributed Secure Data Analytics
- GriDB: Scaling Blockchain Database via Sharding and Off-Chain Cross-Shard Mechanism
- SUFF: Accelerating Subgraph Matching with Historical Data
- When Database Meets New Storage Devices: Understanding and Exposing Performance Mismatches via Configurations
- Semantics-aware Dataset Discovery from Data Lakes with Contextualized Column-based Representation Learning
- Marigold: Efficient k-means Clustering in High Dimensions
- The Case for Learned In-Memory Joins
- Elf: Erasing-based Lossless Floating-Point Compression
- LOGER: A Learned Optimizer towards Generating Efficient and Robust Query Execution Plans
- Representing Paths in Graph Database Pattern Matching
- Front Matter
- ZKSQL: Verifiable and Efficient Query Evaluation with Zero-Knowledge Proofs
- Computing Graph Edit Distance via Neural Graph Matching
- Benchmarking the Utility of 𝑤-event Differential Privacy Mechanisms - When Baselines Become Mighty Competitors
- Collective Grounding: Applying Database Techniques to Grounding Templated Models
- An Experimental Evaluation of Process Concept Drift Detection
- Pollock: A Data Loading Benchmark
- Answering Private Linear Queries Adaptively using the Common Mechanism
- LDPTrace: Locally Differentially Private Trajectory Synthesis
- Sim-Piece: Highly Accurate Piecewise Linear Approximation through Similar Segment Merging
- Towards Migration-Free Just-In-Case Data Archival for Future Cloud Data Lakes
- Fine-Grained Re-Execution for Efficient Batched Commit of Distributed Transactions
- Learning and Deducing Temporal Orders
- BASE: Bridging the Gap between Cost and Latency for Query Optimization
- Efficient framework for operating on data sketches
- Towards Efficient Index Construction and Approximate Nearest Neighbor Search in High-Dimensional Spaces
- Learned Index: A Comprehensive Experimental Evaluation
- Longshot: Indexing Growing Databases using MPC and Differential Privacy
- Accelerating Similarity Search for Elastic Measures: A Study and New Generalization of Lower Bounding Distances
- AdaChain: A Learned Adaptive Blockchain
- Influential Community Search over Large Heterogeneous Information Networks
- Front Matter
- Neighborhood-based Hypergraph Core Decomposition
- Temporal SIR-GN: Efficient and Effective Structural Representation Learning for Temporal Graphs
- What Modern NVMe Storage Can Do, And How To Exploit It: High-Performance I/O for High-Performance Storage Engines
- WiscSort: External Sorting For Byte-Addressable Storage
- Text Indexing for Long Patterns: Anchors are All you Need
- The FastLanes Compression Layout: Decoding >100 Billion Integers per Second with Scalar Code
- VeriBench: Analyzing the Performance of Database Systems with Verifiability
- Towards Designing and Learning Piecewise Space-Filling Curves
- MiniGraph: Querying Big Graphs with a Single Machine
- BICE: Exploring Compact Search Space by Using Bipartite Matching and Cell-Wide Verification
- Maximal D-truss Search in Dynamic Directed Graphs
- DILI: A Distribution-Driven Learned Index
- Pre-trained Embeddings for Entity Resolution: An Experimental Analysis
- Decoupled Graph Neural Networks for Large Dynamic Graphs
- Adaptive Indexing of Objects with Spatial Extent
- LEON: A New Framework for ML-Aided Query Optimization
- TiQuE: Improving the Transactional Performance of Analytical Systems for True Hybrid Workloads
- SEIDEN: Revisiting Query Processing in Video Database Systems
- Extract-Transform-Load for Video Streams
- Pando: Enhanced Data Skipping with Logical Data Partitioning
- Cracking-Like Join for Trusted Execution Environments
- Opportunities for Quantum Acceleration of Databases: Optimization of Queries and Transaction Schedules
- SDPipe: A Semi-Decentralized Framework for Heterogeneity-aware Pipeline-parallel Training
- LRU-C: Parallelizing Database I/Os for Flash SSDs
- Why Not Yet: Fixing a Top-k Ranking that Is Not Fair to Individuals
- Front Matter
- Information-Theoretically Secure and Highly Efficient Search and Row Retrieval
- Olive: Oblivious Federated Learning on Trusted Execution Environment Against the Risk of Sparsification
- TASK: An Efficient Framework for Instant Error-tolerant Spatial Keyword Queries on Road Networks
- Autonomously Computable Information Extraction
- NVM: Is it Not Very Meaningful for Databases?
- DeepJoin: Joinable Table Discovery with Pre-trained Language Models
- Falcon: A Privacy-Preserving and Interpretable Vertical Federated Learning System
- Enabling Secure and Efficient Data Analytics Pipeline Evolution with Trusted Execution Environment
- A Case for Graphics-driven Query Processing
- Effective and Efficient Route Planning Using Historical Trajectories on Road Networks
- Adaptive Indexing in High-Dimensional Metric Spaces
- Parallel Colorful h-star Core Maintenance in Dynamic Graphs
- MITra: A Framework for Multi-Instance Graph Traversal
- CommunityAF: An Example-based Community Search Method via Autoregressive Flow
- Auto-BI: Automatically Build BI-Models Leveraging Local Join Prediction and Global Schema Graph
- Trajectory Data Collection with Local Differential Privacy
- LMSFC: A Novel Multidimensional Index based on Learned Monotonic Space Filling Curves
- Scaling a Declarative Cluster Manager Architecture with Query Optimization Techniques
- CORNET: Learning Table Formatting Rules By Example
- ARKGraph: All-Range Approximate K-Nearest-Neighbor Graph
- Causal Data Integration
- Mining Frequent Infix Patterns from Concurrency-Aware Process Execution Variants
- The Composable Data Management System Manifesto
- Front Matter
- A Two-Level Signature Scheme for Stable Set Similarity Joins
- Scalable Reasoning on Document Stores via Instance-Aware Query Rewriting
- EQUI-VOCAL: Synthesizing Queries for Compositional Video Events from Limited User Interactions
- Lotan: Bridging the Gap between GNNs and Scalable Graph Analytics Engines
- Epoxy: ACID Transactions Across Diverse Data Stores
- Analyzing Vectorized Hash Tables Across CPU Architectures
- Exploiting Cloud Object Storage for High-Performance Analytics
- A Randomized Blocking Structure for Streaming Record Linkage
- REmatch: a novel regex engine for finding all matches
- ADOPT: Adaptively Optimizing Attribute Orders for Worst-Case Optimal Join Algorithms via Reinforcement Learning
- Triangular Stability Maximization by Influence Spread over Social Networks
- CORE-Sketch: On Exact Computation of Median Absolute Deviation with Limited Space
- Fast Search-By-Classification for Large-Scale Databases Using Index-Aware Decision Trees and Random Forests
- Semi-Oblivious Chase Termination for Linear Existential Rules: An Experimental Study
- Analyzing the Impact of Cardinality Estimation on Execution Plans in Microsoft SQL Server
- WALTZ: Leveraging Zone Append to Tighten the Tail Latency of LSM Tree on ZNS SSD
- Accelerating Aggregation Queries on Unstructured Streams of Data
- QueryBooster: Improving SQL Performance Using Middleware Services for Human-Centered Query Rewriting
- Consistent Range Approximation for Fair Predictive Modeling
- SUREL+: Moving from Walks to Sets for Scalable Subgraph-based Graph Representation Learning
- Estimating Single-Node PageRank in O(min{d_t, sqrt(m)}) Time
- Simple Adaptive Query Processing vs. Learned Query Optimizers: Observations and Analysis
- BP-tree: Overcoming the Point-Range Operation Tradeoff for In-Memory B-trees
- HENCE-X: Toward Heterogeneity-agnostic Multi-level Explainability for Deep Graph Networks
- Automatic Road Extraction with Multi-Source Data Revisited: Completeness, Smoothness and Discrimination
- Asymptotically Better Query Optimization Using Indexed Algebra
- Normalizing Property Graphs
- A Deep Dive into Common Open Formats for Analytical DBMSs
- Saibot: A Differentially Private Data Search Platform
- JoinBoost: Grow Trees Over Normalized Data Using Only SQL
- R^3: Record-Replay-Retroaction for Database-Backed Applications
- Self-Training for Label-Efficient Information Extraction from Semi-Structured Web-Pages
- Efficient Non-Learning Similar Subtrajectory Search
- Frequency-revealing attacks against Frequency-hiding Order-preserving Encryption
- Efficient Fault Tolerance for Recommendation Model Training via Erasure Coding
- SlabCity: Whole-Query Optimization using Program Synthesis
- Scaling Up Structural Clustering to Large Probabilistic Graphs Using Lyapunov Central Limit Theorem
- Epistemic Parity: Reproducibility as an Evaluation Metric for Differential Privacy
- POEM: Pattern-Oriented Explanations of Convolutional Neural Networks
- gCore: Exploring Cross-layer Cohesiveness in Multi-layer Graphs
- Sieve: A Learned Data-Skipping Index for Data Analytics
- Out-of-Order Sliding-Window Aggregation with Efficient Bulk Evictions and Insertions
- k-Best Egalitarian Stable Marriages for Task Assignment
- Federated Calibration and Evaluation of Binary Classifiers
- FlashAlloc: Dedicating Flash Blocks By Objects
- Through the Fairness Lens: Experimental Analysis and Evaluation of Entity Matching
- Check Out the Big Brain on BRAD: Simplifying Cloud Data Processing with Learned Automated Data Meshes
- How Large Language Models Will Disrupt Data Management
- FASTgres: Making Learned Query Optimizer Hinting Effective
- Write-Aware Timestamp Tracking: Effective and Efficient Page Replacement for Modern Hardware
- Tigger: A Database Proxy That Bounces With User-Bypass
- Equitable Data Valuation Meets the Right to Be Forgotten in Model Markets
- TSM-Bench: Benchmarking Time Series Database Systems for Monitoring Applications
- Cross Modal Data Discovery over Structured and Unstructured Data Lakes
- Auto-Tables: Synthesizing Multi-Step Transformations to Relationalize Tables without Using Examples
- Effective Entity Augmentation By Querying External Data Sources
- Choose Wisely: An Extensive Evaluation of Model Selection for Anomaly Detection in Time Series
- Similarity search in the blink of an eye with compressed indices
- On Data-Aware Global Explainability of Graph Neural Networks
- Declarative Sub-Operators for Universal Data Processing
- Front Matter
- Progressive Partitioning for Parallelized Query Execution in Google's Napa
- Taurus MM: bringing multi-master to the cloud
- StreamOps: Cloud-Native Runtime Management for Streaming Services in ByteDance
- AutoSteer: Learned Query Optimization for Any SQL Database
- Krypton: Real-time Serving and Analytical SQL Engine at ByteDance
- EmbedX: A Versatile, Efficient and Scalable Platform to Embed Both Graphs and High-Dimensional Sparse Data
- The Story of AWS Glue
- Towards General and Efficient Online Tuning for Spark
- CDSBen: Benchmarking the Performance of Storage Services in Cloud-native Database System at ByteDance
- FEBench: A Benchmark for Real-Time Relational Data Feature Extraction
- MINT: Detecting Fraudulent Behaviors from Time-series Relational Data
- Microsoft Purview: A System for Central Governance of Data
- Anser: Adaptive Information Sharing Framework of AnalyticDB
- TPCx-AI - An Industry Standard Benchmark for Artificial Intelligence and Machine Learning Systems
- OneProvenance: Efficient Extraction of Dynamic Coarse-Grained Provenance From Database Query Event Logs
- Techniques and Efficiencies from Building a Real-Time DBMS
- Real-time Workload Pattern Analysis for Large-scale Cloud Databases
- Big Data Analytic Toolkit: A general-purpose, modular, and heterogeneous acceleration toolkit for data analytical engines
- Lindorm TSDB: A Cloud-native Time-series Database for Large-scale Monitoring Systems
- OceanBase Paetica: A Hybrid Shared-nothing/Shared-everything Database for Supporting Single Machine and Distributed Cluster
- SimpleTS: An Efficient and Universal Model Selection Framework for Time Series Forecasting
- PolarDB-SCC: A Cloud-Native Database Ensuring Low Latency for Strongly Consistent Reads
- ScalarDB: Universal Transaction Manager for Polystores
- Angel-PTM: A Scalable and Economical Large-scale Pre-training System in Tencent
- Eigen: End-to-end Resource Optimization for Large-Scale Databases on the Cloud
- MagicScaler: Uncertainty-aware, Predictive Autoscaling
- Kora: A Cloud-Native Event Streaming Platform for Kafka
- Automatic SQL Error Mitigation in Oracle
- PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel
- Time Series Data Mining: A Unifying View
- Machine Learning for Subgraph Extraction: Methods, Applications and Challenges
- Private Information Retrieval in Large Scale Public Data Repositories
- Data and AI Model Markets: Opportunities for Data and Model Sharing, Discovery, and Integration
- Efficient Execution of User-Defined Functions in SQL Queries
- Natural Language Interfaces for Databases with Deep Learning
- Join Order Selection with Deep Reinforcement Learning: Fundamentals, Techniques, and Challenges
- Full-Power Graph Querying: State of the Art and Challenges
- A Tutorial on Visual Representations of Relational Queries
- Databases on Modern Networks: A Decade of Research that now comes into Practice
- Building a Collaborative Data Analytics System: Opportunities and Challenges
- PAINE Demo: Optimizing Video Selection Queries With Commonsense Knowledge
- DoveDB: A Declarative and Low-Latency Video Database
- DeepVQL: Deep Video Queries on PostgreSQL
- A Demonstration of DLBD: Database Logic Bug Detection System
- PSFQ: A Blockchain-based Privacy-preserving and Verifiable Student Feedback Questionnaire Platform
- QO-Insight: Inspecting Steered Query Optimizers
- Lynx: A Graph Query Framework for Multiple Heterogeneous Data Sources
- Showcasing Data Management Challenges for Future IoT Applications with NebulaStream
- CEDA: Learned Cardinality Estimation with Domain Adaptation
- FastMosaic in Action: A New Mosaic Operator for Array DBMSs
- Sniffer: A Novel Model Type Detection System against Machine-Learning-as-a-Service Platforms
- KGNav: A Knowledge Graph Navigational Visual Query System
- On-the-fly Data Transformation in Action
- Demonstrating Waffle: A Self-driving Grid Index
- CM-Explorer: Dissecting Data Ingestion Problems
- Explaining Differentially Private Query Results With DPXPlain
- Ganos Aero: A Cloud-Native System for Big Raster Data Management and Processing
- Demonstration of OpenDBML, a Framework for Democratizing In-Database Machine Learning
- Demonstration of SPARQL-𝑀𝐿: An Interfacing Language for Supporting Graph Machine Learning for RDF Graphs
- EQUI-VOCAL Demonstration: Synthesizing Video Queries from User Interactions
- TsQuality: Measuring Time Series Data Quality in Apache IoTDB
- Approximate Queries over Concurrent Updates
- Solving Hard Variants of Database Schema Matching on Quantum Computers
- Interpretable Clustering of Multivariate Time Series with Time2Feat
- DHive: Query Execution Performance Analysis via Dataflow in Apache Hive
- MLWHATIF: What If You Could Stop Re-Implementing Your Machine Learning Pipeline Analyses Over and Over?
- AQUA: Automatic Collaborative Query Processing in Analytical Database
- VisualNeo: Bridging the Gap between Visual Query Interfaces and Graph Query Engines
- KG-Roar: Interactive Datalog-based Reasoning on Virtual Knowledge Graphs
- To UDFs and Beyond: Demonstration of a Fully Decomposed Data Processor for General Data Wrangling Tasks
- ChainDash: An Ad-Hoc Blockchain Data Analytics System
- BrewER: Entity Resolution On-Demand
- Visualizing Spreadsheet Formula Graphs Compactly
- DuckPGQ: Bringing SQL/PGQ to DuckDB
- Demo of QueryBooster: Supporting Middleware-based SQL Query Rewriting as a Service
- Web Connector: A Unified API Wrapper to Simplify Web Data Collection
- FS-Real: A Real-World Cross-Device Federated Learning Platform
- ADOps: An Anomaly Detection Pipeline in Structured Logs
- Portals: A Showcase of Multi-Dataflow Stateful Serverless
- CORNET: Learning Spreadsheet Formatting Rules By Example
- Fanglue: An Interactive System for Decision Rule Crafting
- Odyssey: An Engine Enabling The Time-Series Clustering Journey
- ERICA: Query Refinement for Diversity Constraint Satisfaction
- Lingua Manga: A Generic Large Language Model Centric System for Data Curation
- XDB in Action: Decentralized Cross-Database Query Processing for Black-Box DBMSes
- Interactive Demonstration of EVA
- RESCU-SQL: Oblivious Querying for the Zero Trust Cloud
- DataRinse: Semantic Transforms for Data preparation based on Code Mining
- Demonstrating ADOPT: Adaptively Optimizing Attribute Orders for Worst-Case Optimal Joins via Reinforcement Learning
- Demonstrating GPT-DB: Generating Query-Specific and Customizable Code for SQL Processing with GPT-4
- SHEVA: A Visual Analytics System for Statistical Hypothesis Exploration
- PikePlace: Generating Intelligence for Marketplace Datasets
- A Learned Query Rewrite System
- Will LLMs reshape, supercharge, or kill data science?
- Towards Auto-Generated Data Systems
- Generations of Knowledge Graphs: The Crazy Ideas and the Business Impact
- The Story of GraphLab – From Scaling Machine Learning to Shaping Graph Systems Research
- Common Sense: the Dark Matter of Language and Intelligence
- Modernization of Databases in the Cloud Era: Building Databases that Run Like Legos
- On the Cusp: Computing Thrills and Perils and Professional Awakening
- Front Matter
- Doquet: Differentially Oblivious Range and Join Queries with Private Data Structures
- AMNES: Accelerating the computation of data correlation using FPGAs
- VOCALExplore: Pay-as-You-Go Video Data Exploration and Model Building
- Flexible Resource Allocation for Relational Database-as-a-Service
- ShadowAQP: Efficient Approximate Group-by and Join Query via Attribute-oriented Sample Size Allocation and Data Generation
- Optimizing Data Pipelines for Machine Learning in Feature Stores
- SparqLog: A System for Efficient Evaluation of SPARQL 1.1 Queries via Datalog
- Solver-In-The-Loop Cluster Resource Management for Database-as-a-Service
- RTIndeX: Exploiting Hardware-Accelerated GPU Raytracing for Database Indexing
- ContTune: Continuous Tuning by Conservative Bayesian Optimization for Distributed Stream Data Processing Systems
- Single Update Sketch with Variable Counter Structure
- Can Large Language Models Predict Data Correlations from Column Names?
- GraphOS: Towards Oblivious Graph Processing
- Catalyst: Optimizing Cache Management for Large In-memory Key-value Systems
Volume 15
https://www.vldb.org/pvldb/volumes/15/
- Front Matter
- ANN Softmax: Acceleration of Extreme Classification Training
- WindTunnel: Towards Differentiable ML Pipelines Beyond a Single Model
- DBOS: A DBMS-oriented Operating System
- Deep Indexed Active Learning for Matching Heterogeneous Entity Representations
- A Learned Query Rewrite System using Monte Carlo Tree Search
- On Detecting Cherry-picked Generalizations
- FACE: A Normalizing Flow based Cardinality Estimator
- Learned Cardinality Estimation: A Design Space Exploration and A Comparative Evaluation
- DeepEverest: Accelerating Declarative Top-K Queries for Deep Neural Network Interpretation
- Cosine: A Cloud-Cost Optimized Self-Designing Key-Value Storage Engine
- Accelerating Recommendation System Training by Leveraging Popular Choices
- Front Matter
- (p,q)-biclique Counting and Enumeration for Large Sparse Bipartite Graphs
- Evaluating Query Languages and Systems for High-Energy Physics Data
- Distributed Hop-Constrained s-t Simple Path Enumeration at Billion Scale
- ETO: Accelerating Optimization of DNN Operators by High-Performance Tensor Program Reuse
- Babelfish: Efficient Execution of Polyglot Queries
- Butterfly Counting on Uncertain Bipartite Networks
- METRO: A Generic Graph Neural Network Framework for Multivariate Time Series Forecasting
- LargeEA: Aligning Entities for Large-scale Knowledge Graphs
- HVS: Hierarchical Graph Structure Based on Voronoi Diagrams for Solving Approximate Nearest Neighbor Search
- Origami: A High-Performance Mergesort Framework
- Learning to be a Statistician: Learned Estimator for Number of Distinct Values
- ParChain: A Framework for Parallel Hierarchical Agglomerative Clustering using Nearest-Neighbor Chain
- Answering Regular Path Queries through Exemplars
- HET: Scaling out Huge Embedding Model Training via Cache-enabled Distributed Framework
- FINEdex: A Fine-grained Learned Index Scheme for Scalable and Concurrent Memory Systems
- TaGSim: Type-aware Graph Similarity Learning and Computation
- Analysis of Influence Contribution in Social Advertising
- Scabbard: Single-Node Fault-Tolerant Stream Processing
- Enabling Personal Consent in Databases
- Front Matter
- Enabling SQL-based Training Data Debugging for Federated Learning
- Leveraging Query Logs and Machine Learning for Parametric Query Optimization
- Pre-training Summarization Models of Structured Datasets for Cardinality Estimation
- xFraud: Explainable Fraud Transaction Detection
- Subgraph Matching over Graph Federation
- Provenance-based Data Skipping
- Deep Transfer Learning for Multi-source Entity Linkage via Domain Adaptation
- An Experimental Evaluation and Investigation of Waves of Misery in R-trees
- PRUC : P-Regions with User-Defined Constraint
- Points-of-Interest Relationship Inference with Spatial-enriched Graph Neural Networks
- SAFE: A Share-and-Aggregate Bandwidth Exploration Framework for Kernel Density Visualization
- The next 50 Years in Database Indexing or: The Case for Automatically Generated Index Structures
- DARLING: Data-Aware Load Shedding in Complex Event Processing Systems
- Rearchitecting In-Memory Object Stores for Low Latency
- MT-Teql: Evaluating and Augmenting Neural NLIDB on Real-world Linguistic and Schema Variations
- Theoretically and Practically Efficient Parallel Nucleus Decomposition
- APEX: A High-Performance Learned Index on Persistent Memory
- Unsupervised Time Series Outlier Detection with Diversity-Driven Convolutional Ensembles
- Efficient and Effective Data Imputation with Influence Functions
- Parallel Training of Knowledge Graph Embedding Models: A Comparison of Techniques
- Detecting Layout Templates in Complex Multiregion Files
- What Is the Price for Joining Securely? Benchmarking Equi-Joins in Trusted Execution Environments
- Efficient Temporal Pattern Mining in Big Time Series Using Mutual Information
- Efficient Label-Constrained Shortest Path Queries on Road Networks: A Tree Decomposition Approach
- Ember: No-Code Context Enrichment via Similarity-Based Keyless Joins
- Incremental Partitioning for Efficient Spatial Data Analytics
- Lux: Always-on Visualization Recommendations for Exploratory Dataframe Workflows
- Flexible Rule-Based Decomposition and Metadata Independence in Modin: A Parallel Dataframe System
- Front Matter
- Cardinality Estimation in DBMS: A Comprehensive Benchmark Evaluation
- Redy: Remote Dynamic Memory Cache
- Robust and Budget-Constrained Encoding Configurations for In-Memory Database Systems
- Fast Neural Ranking on Bipartite Graph Indices
- BAGUA: Scaling up Distributed Learning with System Relaxations
- SWS: A Complexity-Optimized Solution for Spatial-Temporal Kernel Density Visualization
- Projected Federated Averaging with Heterogeneous Differential Privacy
- Popularity Prediction for Social Media over Arbitrary Time Horizons
- LANNS: A Web-Scale Approximate Nearest Neighbor Lookup System
- Fast Detection of Denial Constraint Violations
- Chukonu: A Fully-Featured High-Performance Big Data Framework that Integrates a Native Compute Engine into Spark
- COMET: A Novel Memory-Efficient Deep Learning Training Framework by Using Error-Bounded Lossy Compression
- Federated Matrix Factorization with Privacy Guarantee
- Scalable Robust Graph Embedding with Spark
- Database Workload Characterization with Query Plan Encoders
- New Query Optimization Techniques in the Spark Engine of Azure Synapse
- DQDF: Data-Quality-Aware Dataframes
- Retrofitting GDPR Compliance onto Legacy Databases
- AutoCTS: Automated Correlated Time Series Forecasting
- Replicated Layout for In-Memory Database Systems
- Front Matter
- Projection-Compliant Database Generation
- Making RDBMSs Efficient on Graph Workloads Through Predefined Joins
- Ranked Enumeration of Join Queries with Projections
- Hippo: Sharing Computations in Hyper-Parameter Optimization
- DSON: JSON CRDT Using Delta-Mutations For Document Stores
- A Neural Database for Differentially Private Spatial Range Queries
- A Critical Analysis of Recursive Model Indexes
- Hybrid Blockchain Database Systems: Design and Performance
- Threshold Queries in Theory and in the Wild
- User-Defined Operators: Efficiently Integrating Custom Algorithms into Modern Databases
- Front Matter
- PACk: An Efficient Partition-based Distributed Agglomerative Hierarchical Clustering Algorithm for Deduplication
- A Near-Optimal Approach to Edge Connectivity-Based Hierarchical Graph Decomposition
- Hu-Fu: Efficient and Secure Spatial Queries over Data Federation
- Sortledton: a universal, transactional graph data structure
- NBTree: a Lock-free PM-friendly Persistent B+-Tree for eADR-enabled PM Systems
- TranAD: Deep Transformer Networks for Anomaly Detection in Multivariate Time Series Data
- SpaceSaving± An Optimal Algorithm for Frequency Estimation and Frequent items in the Bounded Deletion Model
- ByteGNN: Efficient Graph Neural Network Training at Large Scale
- Query Driven-Graph Neural Networks for Community Search: From Non-Attributed, Attributed, to Interactive Attributed
- Hyper-Tune: Towards Efficient Hyper-parameter Tuning at Scale
- Multivariate correlations discovery in static and streaming data
- Moneyball: Proactive Auto-Scaling in Microsoft Azure SQL Database Serverless
- PGE: Robust Product Graph Embedding Learning for Error Detection
- CHEX: Multiversion Replay with Ordered Checkpoints
- Front Matter
- Prefix Filter: Practically and Theoretically Better Than Bloom
- Scalar DL: Scalable and Practical Byzantine Fault Detection for Transactional Database Systems
- In-Network Leaderless Replication for Distributed Data Stores
- Fast Algorithms for Core Maximization on Large Graphs
- NLC: Search Correlated Window Pairs on Long Time Series
- Edge-based Local Push for Personalized PageRank
- Continuous Social Distance Monitoring in Indoor Space
- An In-Depth Study of Continuous Subgraph Matching
- OnlineSTL: Scaling Time Series Decomposition by 100x
- Stingy Sketch: A Sketch Framework for Accurate and Fast Frequency Estimation
- A Study of Database Performance Sensitivity to Experiment Settings
- The Inherent Time Complexity and An Efficient Algorithm for Subsequence Matching Problem
- Selective Data Acquisition in the Wild for Model Charging
- Discovering Association Rules from Big Graphs
- DeepTEA: Effective and Efficient Online Time-dependent Trajectory Outlier Detection
- Entity Resolution On-Demand
- Front Matter
- ForBackBench: A Benchmark for Chasing vs. Query-Rewriting
- Accurate Summary-based Cardinality Estimation Through the Lens of Cardinality Estimation Graphs
- Distributed D-core Decomposition over Large Directed Graphs
- Efficient Maximal Biclique Enumeration for Large Sparse Bipartite Graphs
- TGL: A General Framework for Temporal GNN Training onBillion-Scale Graphs
- Distributed Learning of Fully Connected Neural Networks using Independent Subnet Training
- Netherite: Efficient Execution of Serverless Workflows
- Endure: A Robust Tuning Paradigm for LSM Trees Under Workload Uncertainty
- An I/O-Efficient Disk-based Graph System for Scalable Second-Order Random Walk of Large Graphs
- SNARF: A Learning-Enhanced Range Filter
- DLCR: Efficient Indexing for Label-Constrained Reachability Queries on Large Dynamic Graphs
- QueryFormer: A Tree Transformer Model for Query Plan Representation
- Index Checkpoints for Instant Recovery in In-Memory Database Systems
- MATE: Multi-Attribute Table Extraction
- TSB-UAD: An End-to-End Benchmark Suite for Univariate Time-Series Anomaly Detection
- A Critical Re-evaluation of Neural Methods for Entity Alignment
- Analyzing How BERT Performs Entity Matching
- Front Matter
- Scalable Byzantine Fault Tolerance via Partial Decentralization
- Efficient and Error-bounded Spatiotemporal Quantile Monitoring in Edge Computing Environments
- HDPView: Differentially Private Materialized View for Exploring High Dimensional Relational Data
- Anomaly Detection in Time Series: A Comprehensive Evaluation
- Guided Exploration of Data Summaries
- Facilitating Database Tuning with Hyper-Parameter Optimization: A Comprehensive Experimental Evaluation
- Efficient Secure and Verifiable Location-Based Skyline Queries over Encrypted Data
- AB-tree: Index for Concurrent Random Sampling and Updates
- On Repairing Timestamps for Regular Interval Time Series
- Towards Event Prediction in Temporal Graphs
- Decentralized Crowdsourcing for Human Intelligence Tasks with Efficient On-Chain Cost
- Towards Distributed Bitruss Decomposition on Bipartite Graphs
- Generalized Supervised Meta-blocking
- Your Read is Our Priority in Flash Storage
- New Wine in an Old Bottle: Data-aware Hash Functions for Bloom Filters
- SANCUS: Staleness-Aware Communication-Avoiding Full-Graph Decentralized Training in Large-Scale Graph Neural Networks
- CORE: a COmplex event Recognition Engine
- TAOBench: An End-to-End Benchmark for Social Networking Workloads
- Front Matter
- VIP Hashing - Adapting to Skew in Popularity of Data on the Fly
- Near-Data Processing in Database Systems on Native Computational Storage under HTAP Workloads
- Hercules Against Data Series Similarity Search
- DISTILL: Low-Overhead Data-Driven Techniques for Filtering and Costing Indexes for Scalable Index Tuning
- Optimizing Machine Learning Inference Queries with Correlative Proxy Models
- Banyan: A Scoped Dataflow Engine for Graph Query Service
- Frequency Estimation Under Multiparty Differential Privacy: One-shot and Streaming
- Optimizing Inference Serving on Serverless Platforms
- Columnar Formats for Schemaless LSM-based Document Stores
- Efficient Shortest Path Counting on Large Road Networks
- Towards Communication-efficient Vertical Federated Learning Training via Cache-enabled Local Update
- DESIRE: An Efficient Dynamic Cluster-based Forest Indexing for Similarity Search in Multi-Metric Spaces
- ABC: Attributed Bipartite Co-clustering
- Time Series Data Encoding for Efficient Storage: A Comparative Analysis in Apache IoTDB
- SA-LSM : Optimize Data Layout for LSM-tree Based Storage using Survival Analysis
- Improving Matrix-vector Multiplication via Lossless Grammar-Compressed Matrices
- NFL: Robust Learned Index via Distribution Transformation
- LEGOStore: A Linearizable Geo-Distributed Store Combining Replication and Erasure Coding
- Misinformation Mitigation under Differential Propagation Rates and Temporal Penalties
- Serving Deep Learning Models with Deduplication from Relational Databases
- Density-optimized Intersection-free Mapping and Matrix Multiplication for Join-Project Operations
- Design Trade-offs for a Robust Dynamic Hybrid Hash Join
- YeSQL: “You extend SQL” with Rich and Highly Performant User-Defined Functions in Relational Databases
- Magic Shapes for SHACL Validation
- Front Matter
- Succinct Graph Representations as Distance Oracles: An Experimental Evaluation
- Effective Community Search over Large Star-Schema Heterogeneous Information Networks
- A New Distributional Treatment for Time Series and An Anomaly Detection Investigation
- Witan: Unsupervised Labelling Function Generation for Assisted Data Programming
- Skellam Mixture Mechanism: a Novel Approach to Federated Learning with Differential Privacy
- Zero-Shot Cost Models for Out-of-the-box Learned Cost Prediction
- Waffle: In-memory Grid Index for Moving Objects with Reinforcement Learning-based Configuration Tuning System
- Designing an Open Framework for Query Optimization and Compilation
- In-Page Shadowing and Two-Version Timestamp Ordering for Mobile DBMSs
- RapidFlow: An Efficient Approach to Continuous Subgraph Matching
- A Scalable AutoML Approach Based on Graph Neural Networks
- Don't Be a Tattle-Tale: Preventing Leakages through Data Dependencies on Access Control Protected Data
- Efficient Load-Balanced Butterfly Counting on GPU
- PerMA-Bench: Benchmarking Persistent Memory Access
- Evaluating Persistent Memory Range Indexes: Part Two
- Orchestrating Data Placement and Query Execution in Heterogeneous CPU-GPU DBMS
- Interactive Mining with Ordered and Unordered Attributes
- Fast Dataset Search with Earth Mover's Distance
- AcX: System, Techniques, and Experiments for Acronym Expansion
- G-Tran: A High Performance Distributed Graph Database with a Decentralized Architecture
- Tenant Placement in Over-subscribed Database-as-a-Service Clusters
- Example-based Spatial Pattern Matching
- NeuChain: A Fast Permissioned Blockchain System with Deterministic Ordering
- AIM: An Adaptive and Iterative Mechanism for Differentially Private Synthetic Data
- Troubles with Nulls, Views from the Users
- Ginex: SSD-enabled Billion-scale Graph Neural Network Training on a Single Machine via Provably Optimal In-memory Caching
- Shortest-Path Queries on Complex Networks: Experiments, Analyses, and Improvement
- MIDE: Accuracy Aware Minimally Invasive Data Exploration For Decision Support
- JENNER: Just-in-time Enrichment in Query Processing
- CARMI: A Cache-Aware Learned Index with a Cost-based Construction Algorithm
- Maximizing Fair Content Spread via Edge Suggestion in Social Networks
- Turbo-Charging SPJ Query Plans with Learned Physical Join Operator Selections
- Finding Locally Densest Subgraphs: A Convex Programming Approach
- Decoupled Dynamic Spatial-Temporal Graph Neural Network for Traffic Forecasting
- Harmony: Overcoming the hurdles of GPU memory capacity to train massive DNN models on commodity servers
- On Shapley Value in Data Assemblage Under Independent Utility
- Volume Under the Surface: A New Accuracy Evaluation Measure for Time-Series Anomaly Detection
- Algorithm and System Co-design for Efficient Subgraph-based Graph Representation Learning
- Memory-Optimized Multi-Version Concurrency Control for Disk-Based Database Systems
- Query Processing on Tensor Computation Runtimes
- Reliable Community Search in Dynamic Networks
- Qanaat: A Scalable Multi-Enterprise Permissioned Blockchain System with Confidentiality Guarantees
- Fast Network K-function-based Spatial Analysis
- Cost Modelling for Optimal Data Placement in Heterogeneous Main Memory
- SwitchTx: Scalable In-Network Coordination for Distributed Transaction Processing
- Plush: A Write-Optimized Persistent Log-Structured Hash-Table
- Effective Indexing for Dynamic Structural Graph Clustering
- CodexDB: Synthesizing Code for Query Processing from Natural Language Instructions using GPT-3 Codex
- UPLIFT: Parallelization Strategies for Feature Transformations in Machine Learning Workloads
- Lotus: Scalable Multi-Partition Transactions on Single-Threaded Partitioned Databases
- LlamaTune: Sample-Efficient DBMS Configuration Tuning
- On-Demand State Separation for Cloud Data Warehousing
- BABOONS: Black-Box Optimization of Data Summaries in Natural Language
- ConnectorX: Accelerating Data Loading From Databases to Dataframes
- Are Updatable Learned Indexes Ready?
- A Scalable and Generic Approach to Range Joins
- SCAR - Spectral Clustering Accelerated and Robustified
- Rewriting the Infinite Chase
- Chimp: Efficient Lossless Floating Point Compression for Time Series Databases
- Spooky: Granulating LSM-Tree Compactions Correctly
- Identifying Similar-Bicliques in Bipartite Graphs
- Fine-Grained Modeling and Optimization for Intelligent Resource Management in Big Data Processing
- FHL-Cube: Multi-Constraint Shortest Path Querying with Flexible Combination of Constraints
- Tiresias: Enabling Predictive Autonomous Storage and Indexing
- Towards Distribution-aware Query Answering in Data Markets
- Cardinality Estimation of Approximate Substring Queries using Deep Learning
- Containerized Execution of UDFs: An Experimental Evaluation
- Data Station: Delegated, Trustworthy, and Auditable Computation to Enable Data-Sharing Consortia with a Data Escrow
- Optimizing Differentially-Maintained Recursive Queries on Dynamic Graphs
- Diversified Top-k Route Planning in Road Network
- Migrating Social Event Recommendation Over Microblogs
- Spatial and Temporal Constrained Ranked Retrieval over Videos
- SCARA: Scalable Graph Neural Networks with Feature-Oriented Optimization
- Enabling Efficient and General Subpopulation Analytics in Multidimensional Data Streams
- Dynamic Spanning Trees for Connectivity Queries on Fully-dynamic Undirected Graphs
- Front Matter
- Hardware Acceleration of Compression and Encryption in SAP HANA
- Frost: A Platform for Benchmarking and Exploring Data Matching Results
- ByteGraph: A High-Performance Distributed Graph Database in ByteDance
- CDI-E: An Elastic Cloud Service for Data Engineering
- Operon: An Encrypted Database for Ownership-Preserving Data Management
- Tair-PMem: a Fully Durable Non-Volatile Memory Database
- Trie memtables in Cassandra
- Velox: Meta’s Unified Execution Engine
- OceanBase: A 707 Million tpmC Distributed Relational Database System
- VRE: A Versatile, Robust, and Economical Trajectory Data System
- ByteHTAP: ByteDance’s HTAP System with High Data Freshness and Strong Data Consistency
- Beaconnect: Continuous Web Performance A/B Testing at Scale
- CloudJump: Optimizing Cloud Databases for Cloud Storages
- DyHealth: Making Neural Networks Dynamic for Effective Healthcare Analytics
- Blueprint: a constraint-solving approach for document extraction
- TencentCLS: The Cloud Log Service with High Query Performances
- Ganos: A Multidimensional, Dynamic, and Scene-Oriented Cloud-Native Spatial Database Engine
- Magma: A high data density storage engine used in Couchbase
- Doppler: Automated SKU Recommendation in Migrating SQL Workloads to the Cloud
- Meta's Next-generation Realtime Monitoring and Analytics Platform
- SQLite: Past, Present, and Future
- Manu: A Cloud Native Vector Database Management System
- Automated Relational Data Explanation using External Semantic Knowledge
- Kelpie: an Explainability Framework for Embedding-based Link Prediction Models
- OREO: Detection of Cherry-picked Generalizations
- DuckDB-Wasm: Fast Analytical Processing for the Web
- EasyDR: A Human-in-the-loop Error Detection&Repair Platform for Holistic Table Cleaning
- Hu-Fu: A Data Federation System for Secure Spatial Queries
- Demonstrating CAT: Synthesizing Data-Aware Conversational Agents for Transactional Databases
- EDA4SUM: Guided Exploration of Data Summaries
- CaJaDE: Explaining Query Results by Augmenting Provenance with Context
- Share the Tensor Tea: How Databases can Leverage the Machine Learning Ecosystem
- MOCHA: A Tool for Visualizing Impact of Operator Choices in Query Execution Plans for Database Education
- LIBKDV: A Versatile Kernel Density Visualization Library for Geospatial Analytics
- A Demonstration of Multi-Region CockroachDB
- DPDS: Assisting Data Science with Data Provenance
- POEM: Pattern-Oriented Explanations of CNN Models
- WebArrayDB: A Geospatial Array DBMS in Your Web Browser
- AutoDI: Towards an Automatic Plan Regression Analysis
- PHOcus: Efficiently Archiving Photos
- VINCENT: Towards Efficient Exploratory Subgraph Search in Graph Databases
- ActivePDB: Active Probabilistic Databases
- CERTEM: Explaining and Debugging Black-box Entity Resolution Systems with CERTA
- Satellite Image Search in AgoraEO
- SENSOR: Data-driven Construction of Sketch-based Visual Query Interfaces for Time Series Data
- DiscoPG: Property Graph Schema Discovery and Exploration
- SA-Q: Observing, Evaluating, and Enhancing the Quality of the Results of Sentiment Analysis Tools
- SmartBench: Demonstrating Automatic Generation of Comprehensive Benchmarks for Question Answering Over Knowledge Graphs
- DADER: Hands-Off Entity Resolution with Domain Adaptation
- Sigma Workbook: A Spreadsheet for Cloud Data Warehouses
- ReMac: A Matrix Computation System with Redundancy Elimination
- TimeEval: A Benchmarking Toolkit for Time Series Anomaly Detection Algorithms
- DBMS Annihilator: A High-Performance Database Workload Generator in Action
- FedTSC: A Secure Federated Learning System for Interpretable Time Series Classification
- AMRAS: A Visual Analysis System for Spatial Crowdsourcing
- SparkCAD: Caching Anomalies Detector for Spark Applications
- AvantGraph Query Processing Engine
- Theseus: Navigating the Labyrinth of Time-Series Anomaly Detection
- A Demonstration of AutoOD: A Self-tuning Anomaly Detection System
- Pipemizer: An Optimizer for Analytics Data Pipelines
- DORIAN in action: Assisted Design of Data Science Pipelines
- WebMILE: Democratizing Network Representation Learning at Scale
- Demonstrating Quest: A Query-Driven Framework to Explain Classification Models on Tabular Data
- IsoBugView: Interactively Debugging Isolation Bugs in Database Applications
- YeSQL: Rich User-Defined Functions without the Overhead
- Demonstration of Accelerating Machine Learning Inference Queries with Correlative Proxy Models
- Demonstration of Collaborative and Interactive Workflow-Based Data Analytics in Texera
- SimDB in Action: Road Trafic Simulations Completely Inside Array DBMS
- Transformers for Tabular Data Representation: A Tutorial on Models and Applications
- Polyglot Data Management: State of the Art & Open Challenges
- Machine Programming: Turning Data into Programmer Productivity
- Cloud Databases: New Techniques, Challenges, and Opportunities
- Modern Techniques for Querying Graph-Structured Relations: Foundations, System Implementations, and Open Challenges
- Densest Subgraph Discovery on Large Graphs: Applications, Challenges, and Techniques
- From BERT to GPT-3 Codex: Harnessing the Potential of Very Large Language Models for Data Management
- The Past, Present and Future of Indexing on Persistent Memory
- Unified Data Analytics: State-of-the-art and Open Problems
- Big Graphs: Challenges and Opportunities
- Towards AI-Powered Data-Driven Education
- Heterogeneous Information Networks: the Past, the Present, and the Future
- Toward Interpretable and Actionable Data Analysis with Explanations and Causality
- Reflections On My Data Management Research Journey (VLDB Women in Database Research Award Talk)
- Panel: Startups Founded by Database Researchers
- Cloud Data Systems: What are the Opportunities for the Database Research Community?
- Front Matter
- High-dimensional Data Cubes
- Fast and Scalable Mining of Time Series Motifs with Probabilistic Guarantees
- FEDEX: An Explainability Framework for Data Exploration Steps
- Enabling Transparent Acceleration of Big Data Frameworks using Heterogeneous Hardware
- Discovering Polarization Niches via Dense Subgraphs with Attractors and Repulsers
- Sage: A System for Uncertain Network Analysis
- Mining Bursting Core in Large Temporal Graph
- Cost-based or Learning-based? A Hybrid Query Optimizer for Query Plan Selection
- ONe Index for All Kernels (ONIAK): A Zero Re-Indexing LSH Solution to ANNS-ALT
- Learned Index Benefits: Machine Learning Based Index Performance Estimation
- Online Ridesharing with Meeting Points
- Exploiting the Power of Equality-generating Dependencies in Ontological Reasoning
- No Repetition: Fast and Reliable Sampling with Highly Concentrated Hashing
- Witness Generation for JSON Schema
- Towards Observability for Production Machine Learning Pipelines [Vision]
- DINOMO: An Elastic, Scalable, High-Performance Key-Value Store for Disaggregated Persistent Memory
- Bolt-on, Compact, and Rapid Program Slicing for Notebooks [Scalable Data Science]
- Fairness Matters: A Tit-For-Tat Strategy Against Selfish Mining
- SageDB: An Instance-Optimized Data Analytics System
- Budget-Conscious Fine-Grained Configuration Optimization for Spatio-Temporal Applications
- Nemo: Guiding and Contextualizing Weak Supervision for Interactive Data Programming
Volume 14
https://www.vldb.org/pvldb/volumes/14/
- Front Matter
- Benchmarking Learned Indexes
- Tempura: A General Cost-Based Optimizer Framework for Incremental Data Processing
- Inspector Gadget: A Data Programming-based Labeling System for Industrial Images
- Scaling Attributed Network Embedding to Massive Graphs
- Deep Entity Matching with Pre-Trained Language Models
- NeuroCard: One Cardinality Estimator for All Tables
- Front Matter
- Tsunami: A Learned Multi-dimensional Index for Correlated Data and Skewed Workloads
- Jointly Optimizing Preprocessing and Inference for DNN-based Visual Analytics
- Permutable Compiled Queries: Dynamically Adapting Compiled Queries without Recompiling
- EMOGI: Efficient Memory-access for Out-of-memory Graph-traversal In GPUs
- On-Off Sketch: A Fast and Accurate Sketch on Persistence
- Real-Time Distance-Based Outlier Detection in Data Streams
- Seagull: An Infrastructure for Load Prediction and Optimized Resource Allocation
- On the Efficiency of K-Means Clustering: Evaluation, Optimization, and Algorithm Selection
- RapidMatch: A Holistic Approach to Subgraph Query Processing
- Taurus: Lightweight Parallel Logging for In-Memory Database Management Systems
- Improving Execution Efficiency of Just-in-time Compilation based Query Processing on GPUs
- PPQ-Trajectory: Spatio-temporal Quantization for Querying in Large Trajectory Repositories
- Aggregated Deletion Propagation for Counting Conjunctive Query Answers
- Front Matter
- Breaking Down Memory Walls: Adaptive Memory Management in LSM-based Storage Systems
- Nearest Neighbor Classifiers over Incomplete Information: From Certain Answers to Certain Predictions
- Elle: Inferring Isolation Anomalies from Experimental Observations
- Scotch: Generating FPGA-Accelerators for Sketching at Line Rate
- ORBITS: Online Recovery of Missing Values in Multiple Time Series Streams
- TURL: Table Understanding through Representation Learning
- EdgeDIPN: a Unified Deep Intent Prediction Network Deployed at the Edge
- LOCATER: Cleaning WiFi Connectivity Datasets for Semantic Localization
- Multi-Modal Transportation Recommendation with Unified Route Representation Learning
- DISK: A Distributed Framework for Single-Source SimRank with Accuracy Guarantee
- Toward a Better Understanding and Evaluation of Tree Structures on Flash SSDs
- Answering Multi-Dimensional Range Queries under Local Differential Privacy
- Ananke: A Streaming Framework for Live Forward Provenance
- RECEIPT: REfine CoarsE-grained IndePendent Tasks for Parallel Tip decomposition of Bipartite Graphs
- Comprehensive and Efficient Workload Compression
- CoroBase: Coroutine-Oriented Main-Memory Database Engine
- Scalable Querying of Nested Data
- Front Matter
- Space- and Computationally-Efficient Set Reconciliation via Parity Bitmap Sketch (PBS)
- Astrid: Accurate Selectivity Estimation for String Predicates using Deep Learning
- Compact, Tamper-Resistant Archival of Fine-Grained Provenance
- Rumble: Data Independence for Large Messy Data Sets
- Capturing and querying fine-grained provenance of preprocessing pipelines in data science
- Local Dampening: Differential Privacy for Non-numeric Queries via Local Sensitivity
- Mainlining Databases: Supporting Fast Transactional Workloads on Universal Columnar Data File Formats
- Accelerating Exact Constrained Shortest Paths on GPUs
- Towards an Efficient Weighted Random Walk Domination
- Scalable Mining of Maximal Quasi-Cliques: An Algorithm-System Codesign Approach
- CALYPSO: Private Data Management for Decentralized Ledgers
- Stacked Filters: Learning to Filter by Structure
- Maximizing Social Welfare in a Competitive Diffusion Model
- Understanding the Idiosyncrasies of Real Persistent Memory
- Explaining Ranking Functions
- ConnectIt: A Framework for Static and Incremental Parallel Graph Connectivity Algorithms
- Quality of Sentiment Analysis Tools: The Reasons of Inconsistency
- Hindsight Logging for Model Training
- Scalable Structural Index Construction for JSON Analytics
- Efficient Join Algorithms For Large Database Tables in a Multi-GPU Environment
- Front Matter
- FlashP: An Analytical Pipeline for Real-time Forecasting of Time-Series Relational Data
- Efficient Streaming Subgraph Isomorphism with Graph Neural Networks
- Epoch-based Commit and Replication in Distributed OLTP Databases
- Hierarchical Core Maintenance on Large Dynamic Graphs
- Analyzing and Mitigating Data Stalls in DNN Training
- Persistent Memory Hash Indexes: An Experimental Evaluation
- Optimizing An In-memory Database System For AI-powered On-line Decision Augmentation Using Persistent Memory
- DBTagger: Multi-Task Learning for Keyword Mapping in NLIDBs Using Bi-Directional Recurrent Neural Networks
- Improving Information Extraction from Visually Rich Documents using Visual Span Representations
- Zen: a High-Throughput Log-Free OLTP Engine for Non-Volatile Main Memory
- Differentially Private Binary- and Matrix-Valued Data Query: An XOR Mechanism
- Front Matter
- Errata for "Cerebro: A Data System for Optimized Deep Learning Model Selection"
- ParaX: Boosting Deep Learning for Big Data Analytics on Many-Core CPUs
- Optimization of Threshold Functions over Streams
- Budget Constrained Interactive Search for Multiple Targets
- On the String Matching with k Differences in DNA Databases
- Fast Algorithm for Anchor Graph Hashing
- Adaptive Code Generation for Data-Intensive Analytics
- Materializing Knowledge Bases via Trigger Graphs
- Dealer: An End-to-End Model Marketplace with Differential Privacy
- NOAH: Interactive Spreadsheet Exploration with Dynamic Hierarchical Overviews
- Efficient Bi-triangle Counting for Large Bipartite Networks
- Glean: Structured Extractions from Templatic Documents
- ICS-GNN: Lightweight Interactive Community Search via Graph Neural Network
- Building Enclave-Native Storage Engines for Practical Encrypted Databases
- From Natural Language Processing to Neural Databases
- Randomized Error Removal for Online Spread Estimation in Data Streaming
- Teseo and the Analysis of Structural Dynamic Graphs
- Charting the Design Space of Query Execution using VOILA
- Heracles: An Efficient Storage Model And Data Flushing For Performance Monitoring Timeseries
- Fine-Grained Lineage for Safer Notebook Interactions
- FREDE: Anytime Graph Embeddings
- On Analyzing Graphs with Motif-Paths
- Front Matter
- Collective Influence Maximization for Multiple Competing Products with an Awareness-to-Influence Model
- Finding Group Steiner Trees in Graphs with both Vertex and Edge Weights
- Optimizing Bipartite Matching in Real-World Applications by Incremental Cost Computation
- The Case for NLP-Enhanced Database Tuning: Towards Tuning Tools that "Read the Manual"
- Errata for "Unifying Consensus and Atomic Commitment for Effective Cloud Data Management"
- Software-Defined Data Protection: Low Overhead Policy Compliance at the Storage Layer is Within Reach!
- TRACE: Real-time Compression of Streaming Trajectories in Road Networks
- Shortest Paths and Centrality in Uncertain Networks
- Adaptive Data Augmentation for Supervised Learning over Missing Data
- KLL±: Approximate Quantile Sketches over Dynamic Datasets
- Distributed Numerical and Machine Learning Computations via Two-Phase Execution of Aggregated Join Trees
- An Inquiry into Machine Learning-based Automatic Configuration Tuning Services on Real-World Database Management Systems
- Front Matter
- RPT: Relational Pre-trained Transformer Is Almost All You Need towards Democratizing Data Preparation
- Lachesis: Automated Partitioning for UDF-Centric Analytics (Revision of Paper 270)
- Updatable Learned Index with Precise Positions
- MDTP: A Multi-source Deep Traffic Prediction Framework over Spatio-Temporal Trajectory Data
- Symmetric Continuous Subgraph Matching with Bidirectional Dynamic Programming
- Approaching DRAM performance by using microsecond-latency flash memory for small-sized random read accesses: a new access method and its graph applications
- CBench: Towards Better Evaluation of Question Answering Over Knowledge Graphs
- Tensor Relational Algebra for Distributed Machine Learning System Design
- Parallel Discrepancy Detection and Incremental Detection
- Towards Crowd-aware Indoor Path Planning
- Procedural Extensions of SQL: Understanding their usage in the wild
- Discovering Related Data At Scale
- CGPTuner: a Contextual Gaussian Process Bandit Approach for the Automatic Tuning of IT Configurations Under Varying Workload Conditions
- Language-Agnostic Integrated Queries in a Managed Polyglot Runtime
- Achieving High Throughput and Elasticity in a Larger-than-Memory Store
- Efficient Size-Bounded Community Search over Large Networks
- Front Matter
- Minimum Vertex Augmentation
- Database Isolation By Scheduling
- SaS: SSD as SQL Database System
- FLAT: Fast, Lightweight and Accurate Method for Cardinality Estimation
- Fast Augmentation Algorithms for Network Kernel Density Visualization
- AutoGR: Automated Geo-Replication with Fast System Performance and Preserved Application Semantics
- Local Algorithms for Distance-generalized Core Decomposition over Large Dynamic Graphs
- Viper: An Efficient Hybrid PMem-DRAM Key-Value Store
- Estimating Spread of Contact-Based Contagions in a Population Through Sub-Sampling
- Trident: Task Scheduling over Tiered Storage Systems in Big Data Platforms
- Comprehensible Counterfactual Explanation on Kolmogorov-Smirnov Test
- Accelerating Large Scale Real-Time GNN Inference using Channel Pruning
- Towards Cost-Optimal Query Processing in the Cloud
- Automating Incremental Graph Processing with Flexible Memoization
- In-Network Support for Transaction Triaging
- Are We Ready For Learned Cardinality Estimation?
- On the algebra of data sketches
- Massively Parallel Algorithms for Personalized PageRank
- GeCo: Quality Counterfactual Explanations in Real Time
- Automated Feature Engineering for Algorithmic Fairness
- Front Matter
- How to Design Robust Algorithms using Noisy Comparison Oracle
- SAND: Streaming Subsequence Anomaly Detection
- Optimizing Fitness-For-Use of Differentially Private Linear Queries
- Cryptanalysis of An Encrypted Database in SIGMOD '14
- Unconstrained Submodular Maximization with Modular Costs: Tight Approximation and Application to Profit Maximization
- Distributed Deep Learning on Data Systems: A Comparative Analysis of Approaches
- PR-Sketch: Monitoring Per-key Aggregation of Streaming Data with Nearly Full Accuracy
- Tensors: An abstraction for general data processing
- Budget Sharing for Multi-Analyst Differential Privacy
- In the Land of Data Streams where Synopses are Missing, One Framework to Bring Them All
- Data Acquisition for Improving Machine Learning Models
- Efficiently Answering Reachability and Path Queries on Temporal Bipartite Graphs
- Preference Queries over Taxonomic Domains
- Revisiting the Design of LSM-tree Based OLTP Storage Engine with Persistent Memory
- Kamino: Constraint-Aware Differentially Private Data Synthesis
- Towards Cost-Effective and Elastic Cloud Database Deployment via Memory Disaggregation
- Dual-Objective Fine-Tuning of BERT for Entity Matching
- Front Matter
- GraphMineSuite: Enabling High-Performance and Programmable Graph Mining Algorithms with Set Algebra
- PATSQL: Efficient Synthesis of SQL Queries from Example Tables with Quick Inference of Projected Columns
- Fauce: Fast and Accurate Deep Ensembles with Uncertainty for Cardinality Estimation
- A Comprehensive Survey and Experimental Comparison of Graph-Based Approximate Nearest Neighbor Search
- Towards Plug-and-Play Visual Graph Query Interfaces: Data-driven Canned Pattern Selection for Large Networks
- ThunderRW: An In-Memory Graph Random Walk Engine
- Butterfly-Core Community Search over Labeled Graphs
- Flow-Loss: Learning Cardinality Estimates That Matter
- On Querying Historical K-Cores
- Frequency Estimation under Local Differential Privacy
- Doing More with Less: Characterizing Dataset Downsampling for AutoML
- LES3: Learning-based exact set similarity search
- Large Graph Convolutional Network Training with GPU-Oriented Data Communication Architecture
- FlexPushdownDB: Hybrid Pushdown and Caching in a Cloud DBMS
- Approximating Median Absolute Deviation with Bounded Error
- An Experimental Evaluation and Guideline for Path Finding in Weighted Dynamic Network
- Robustness against Read Committed for Transaction Templates
- LANCET: Labeling Complex Data at Scale
- VolcanoML: Speeding up End-to-End AutoML via Scalable Search Space Decomposition
- A Queueing-Theoretic Framework for Vehicle Dispatching in Dynamic Car-Hailing
- Data Synthesis via Differentially Private Markov Random Field
- Scaling Replicated State Machines with Compartmentalization
- Constructing and Analyzing the LSM Compaction Design Space
- ByShard: Sharding in a Byzantine Environment
- SetSketch: Filling the Gap between MinHash and HyperLogLog
- CGM: An Enhanced Mechanism for Streaming Data Collectionwith Local Differential Privacy
- Errata for "Teseo and the Analysis of Structural Dynamic Graph"
- QARTA: An ML-based System for Accurate Map Services
- Real-World Trajectory Sharing with Local Differential Privacy
- PolyFrame: A Retargetable Query-based Approach to Scaling Dataframes
- Scalable Community Detection via Parallel Correlation Clustering
- SlimChain: Scaling Blockchain Transactions through Off-Chain Storage and Parallel Processing
- Towards an Optimized GROUP BY Abstraction for Large-Scale Machine Learning
- Accelerating Approximate Aggregation Queries with Expensive Predicates
- A four-dimensional Analysis of Partitioned Approximate Filters
- SKT: A One-Pass Multi-Sketch Data Analytics Accelerator
- A Practical Approach to Groupjoin and Nested Aggregates
- Robust Voice Querying with MUVE: Optimally Visualizing Results of Phonetically Similar Queries
- CHEF: A Cheap and Fast Pipeline for Iteratively Cleaning Label Uncertainties
- COMPARE: Accelerating Groupwise Comparison in Relational Databases for Data Analytics
- Crystal: A Unified Cache Storage System for Analytical Databases
- The Smallest Extraction Problem
- Deep Learning for Blocking in Entity Matching: A Design Space Exploration
- Grain: Improving Data Efficiency of Graph Neural Networks via Diversified Influence Maximization
- Database Technology for the Masses: Sub-Operators as First-Class Entities
- Columnar Storage and List-based Processing for Graph Database Management Systems
- Phoebe: A Learning-based Checkpoint Optimizer
- Tailoring Data Source Distributions for Fairness-aware Data Integration
- Missing Value Imputation on Multidimensional Time Series
- Horizon: Scalable Dependency-driven Data Cleaning
- Declarative Data Serving: The Future of Machine Learning Inference on the Edge
- Auto-Pipeline: Synthesize Data Pipelines By-Target Using Reinforcement Learning and Search
- Explaining Inference Queries with Bayesian Optimization
- Decomposed Bounded Floats for Fast Compression and Queries
- Beyond Equi-joins: Ranking, Enumeration and Factorization
- Exathlon: A Benchmark for Explainable Anomaly Detection over Time Series
- Progressive Compressed Records: Taking a Byte out of Deep Learning Data
- TQEL: Framework for Query-Driven Linking of Top-K Entities in Social Media Blogs
- Front Matter
- KDV-Explorer: A Near Real-Time Kernel Density Visualization System for Spatial Analysis
- Refiner: A Reliable Incentive-Driven Federated Learning System Powered by Blockchain
- MultiCategory: Multi-model Query Processing Meets Category Theory and Functional Programming
- Cquirrel: Continuous Query Processing over Acyclic Relational Schemas
- DeFiHap: Detecting and Fixing HiveQL Anti-Patterns
- A Demonstration of KGLac: A Data Discovery and Enrichment Platform for Data Science
- Assessing the Existence of a Model in your Data with ADESIT
- Path Advisor: A Multi-Functional Campus Map Tool for Shortest Path
- Intermittent Human-in-the-Loop Model Selection using Cerebro: A Demonstration
- Low-Latency Compilation of SQL Queries to Machine Code
- Sound of Databases: Sonification of a Semantic Web Database Engine
- HyMAC: A Hybrid Matrix Computation System
- GraphScope: A One-Stop Large Graph Processing System
- Just Move It! Dynamic Parameter Allocation in Action
- CBench: Demonstrating Comprehensive Evaluation of Question Answering Systems over Knowledge Graphs Through Deep Analysis of Benchmarks
- PostCENN: PostgreSQL with Machine Learning Models for Cardinality Estimation
- DENOUNCER: Detection of Unfairness in Classifiers
- A Demonstration of QARTA: An ML-based System for Accurate Map Services
- TraNCE: Transforming Nested Collections Efficiently
- Debugging Missing Answers for Spark Queries over Nested Data with Breadcrumb
- Demonstration of Panda: A Weakly Supervised Entity Matching System
- Automatic Data Acquisition for Deep Learning
- DBMind: A Self-Driving Platform in openGauss
- Demonstration of Dealer: An End-to-End Model Marketplace with Differential Privacy
- Assassin: an Automatic claSSificAtion system baSed on algorithm SelectIoN
- ATLANTIC: Making Database Differentially Private and Faster with Accuracy Guarantee
- Demo of Marius: A System for Large-scale Graph Embeddings
- From Papers to Practice: The openclean Open-Source Data Cleaning Library
- Demonstration of Apperception: A Database Management System for Geospatial Video Data
- Automated energy consumption forecasting with EnForce
- RealGraph-Web: A Graph Analysis Platform on the Web
- Interactive Demonstration of SQLCHECK
- T-Cove: An exposure tracing System based on Cleaning Wi-Fi Events on Organizational Premises
- Demonstration of Generating Explanations for Black-Box Algorithms Using Lewis
- Auctus: A Dataset Search Engine for Data Discovery and Augmentation
- A Demonstration of Relic: A System for REtrospective Lineage InferenCe of Data Workflows
- SChain: A Scalable Consortium Blockchain Exploiting Intra- and Inter-Block Concurrency
- EPICGen: An Experimental Platform for Indoor Congestion Generation and Forecasting
- Wikinegata: a Knowledge Base with Interesting Negative Statements
- Full Encryption: An end to end encryption mechanism in GaussDB
- DatAgent: The Imminent Age of Intelligent Data Assistants
- DICE: Data Discovery by Example
- AnyOLAP: Analytical Processing of Arbitrary Data-Intensive Applications without ETL
- A Demonstration of the Exathlon Benchmarking Platform for Explainable Anomaly Detection
- An Intermediate Representation for Hybrid Database and Machine Learning Workloads
- How Divergent Is Your Data?
- An Extensible and Reusable Pipeline for Automated Utterance Paraphrases
- Compliant Geo-distributed Data Processing in Action
- Query-Driven Video Event Processing for the Internet of Multimedia Things
- A Demonstration of NoDA: Unified Access to NoSQL Stores
- AutoExecutor: Predictive Parallelism for Spark SQL Queries
- Catch a Blowfish Alive: A Demonstration of Policy-Aware Differential Privacy for Interactive Data Exploration
- RONIN: Data Lake Exploration
- SAND in Action: Subsequence Anomaly Detection for Streams
- Valentine in Action: Matching Tabular Data at Scale
- GEDet: Detecting Erroneous Nodes with A Few Examples
- GraphScope: A Unified Engine For Big Graph Processing
- Davos: A System for Interactive Data-Driven Decision Making
- Mixer: Efficiently Understanding and Retrieving Visual Content at Web-Scale
- Towards A Polyglot Framework for Factorized ML
- The End of Moore's Law and the Rise of The Data Processor
- tf.data: A Machine Learning Data Processing Framework
- Not Black-Box Anymore! Enabling Analytics-Aware Optimizations in Teradata Vantage
- Fangorn: Adaptive Execution Framework for Heterogeneous Workloads on Shared Clusters
- Napa: Powering Scalable Data Warehousing with Robust Query Performance at Google
- The Art of Balance: A RateupDB Experience of Building a CPU/GPU Hybrid Database Product
- RAMP-TAO: Layering Atomic Transactions on Facebook's Online TAO Data Store
- openGauss: An Autonomous Database System
- Hyperspace: The Indexing Subsystem of Azure Synapse
- SpeakNav: Voice-based Route Description Language Understanding for Template Driven Path Search
- Railgun: managing large streaming windows under MAD requirements
- Big Metadata : When Metadata is Big Data
- Tanium Reveal: A Federated Search Engine for Querying Unstructured File Data on Large Enterprise Networks
- Hazelcast Jet: Low-latency Stream Processing at the 99.99th Percentile
- SparkCruise: Workload Optimization in Managed Spark Clusters at Microsoft
- Watermarks in Stream Processing Systems: Semantics and Comparative Analysis of Apache Flink and Google Cloud Dataflow
- The Cosmos Big Data Platform at Microsoft: Over a Decade of Progress and a Decade to Look Forward
- The evolution of Amazon Redshift
- Using VDMS to Index and Search 100M Images
- On the Limits of Machine Knowledge: Completeness, Recall and Negation in Web-scale Knowledge Bases
- Managing ML Pipelines: Feature Stores and the Coming Wave of Embedding Ecosystems
- Data Augmentation for ML-driven Data Preparation and Integration
- Array DBMS: Past, Present, and (Near) Future
- Machine Learning for Databases
- Extending the Lifetime of NVM: Challenges and Opportunities
- New Trends in High-D Vector Similarity Search: AI-driven, Progressive, and Distributed
- Machine Learning for Cloud Data Systems: the Promise, the Progress, and the Path Forward
- It’s not just Cookies and Tea
- Evolution of a Compiling Query Engine
- Make Your Database System Dream of Electric Sheep: Towards Self-Driving Operation
- Towards instance-optimized data systems
- Knowledge Graphs 2021: A Data Odyssey
- The future of data(base) education: Is the "cow book" dead?
- Front Matter
- TSCache: An Efficient Flash-based Caching Scheme for Time-series Data Workloads
- MP-RW-LSH: An Efficient Multi-Probe LSH Solution to ANNS-L_1
- View Selection over Knowledge Graphs in Triple Stores
- Frequency-Hiding Order-Preserving Encryption with Small Client Storage
- Modularis: Modular Relational Analytics over Heterogeneous Distributed Platforms
- Time-Topology Analysis
- Quantifying identifiability to choose and audit epsilon in differentially private deep learning
- Data Management in Microservices: State of the Practice, Challenges, and Research Directions
- PerfGuard: Deploying ML-for-Systems without Performance Regressions, Almost!
- DSB: A Decision Support Benchmark for Workload-Driven and Traditional Database Systems
- Computing How-Provenance for SPARQL Queries via Query Rewriting
- UDO: Universal Database Optimization using Reinforcement Learning
- Internet Traffic Analysis at Scale
- The Power of Summarization in Graph Mining and Learning: Smaller Data, Faster Methods, More Interpretability
- Summarizing Patients Like Mine via an On-demand Consultation Service
- Towards Scalable Online Machine Learning Collaborations with OpenML
- From ML Models to Intelligent Applications: The Rise of MLOps
- Designing Production-Friendly Machine Learning
Volume 13
https://www.vldb.org/pvldb/volumes/13/
- Front Matter
- Revenue Maximization for Query Pricing
- Realtime Top-k Personalized PageRank over Large Graphs on GPUs
- Fast Large-Scale Trajectory Clustering
- Automating Distributed Tiered Storage Management in Cluster Computing
- APOLLO: Automatic Detection and Diagnosis of Performance Regressions in Database Systems
- Lowering the Latency of Data Processing Pipelines Through FPGA based Hardware Acceleration
- Front Matter
- Interleaved Multi-Vectorizing
- A Unified Optimization Algorithm For Solving Regret-Minimizing Representative Problems
- Pushing Data-Induced Predicates Through Joins in Big-Data Clusters
- Discovery of Approximate (and Exact) Denial Constraints
- Deep Unsupervised Cardinality Estimation
- Free Gap Information from the Differentially Private Sparse Vector and Noisy Max Mechanisms
- An End-to-End Learning-based Cost Estimator
- Last-Mile Delivery Made Practical: An Efficient Route Planning Framework with Theoretical Guarantees
- Database Processing-in-Memory: An Experimental Study
- Incorporating Super-Operators in Big-Data Query Optimizers
- Efficient Progressive Minimum k-core Search
- Harmonia: Near-Linear Scalability for Replicated Storage with In-Network Conflict Detection
- Learning to Sample: Counting with Complex Queries
- Return of the Lernaean Hydra: Experimental Evaluation of Data Series Approximate Similarity Search
- Front Matter
- DPTree: Differential Indexing for Persistent Memory
- AJoin: Ad-hoc Stream Joins at Scale
- On Performance Stability in LSM-based Storage Systems
- Hop-constrained s-t Simple Path Enumeration: Towards Bridging Theory and Practice
- Panorama: A Data System for Unbounded Vocabulary Querying over Video
- Planting Trees for scalable and efficient Canonical Hub Labeling
- Operationalizing Individual Fairness with Pairwise Fair Representations
- Optimizing Databases by Learning Hidden Parameters of Solid State Drives
- BlazeIt: Optimizing Declarative Aggregation and Limit Queries for Neural Network-Based Video Analytics
- Join on Samples: A Theoretical Guide for Practitioners
- Mining an Anti-Knowledge Base from Wikipedia Updates with Applications to Fact Checking and Beyond
- Evaluating Persistent Memory Range Indexes
- Front Matter
- A.M.B.R.O.S.I.A: Providing Performant Virtual Resiliency for Distributed Applications
- Efficient Shortest Path Index Maintenance on Dynamic Road Networks with Theoretical Guarantees
- ParPaRaw: Massively Parallel Parsing of Delimiter-Separated Raw Data
- Opportunities for Optimism in Contended Main-Memory Multicore Transactions
- PM-LSH: A Fast and Accurate LSH Framework for High-Dimensional Approximate NN Search
- Hunting multiple bumps in graphs
- Homogeneous Network Embedding for Massive Graphs via Reweighted Personalized PageRank
- Pattern Functional Dependencies for Data Cleaning
- MEGA: Multi-View Semi-Supervised Clustering of Hypergraphs
- MDedup: Duplicate Detection with Matching Dependencies
- Programmable View Update Strategies on Relations
- Amber: A Debuggable Dataflow System Based on the Actor Model
- Dynamic Speculative Optimizations for SQL Compilation in Apache Spark
- Mind the Gap: An Experimental Evaluation of Imputation of Missing Values Techniques in Time Series
- Front Matter
- Graphite: A NUMA-aware HPC System for Graph Analytics Based on a new MPI * X Parallelism Model
- Personal Insights for Altering Decisions of Tree-based Ensembles over Time
- Answering Billion-Scale Label-Constrained Reachability Queries within Microsecond
- Effective and Efficient Retrieval of Structured Entities
- Micro-architectural Analysis of OLAP: Limitations and Opportunities
- Effective and Efficient Community Search over Large Heterogeneous Information Networks
- ResilientDB: Global Scale Resilient Blockchain Fabric
- Data-Parallel Query Processing on Non-Uniform Data
- Evaluating Memory-Hard Proof-of-Work Algorithms on Three Processors
- Approximate Summaries for Why and Why-not Provenance
- PIDS: Attribute Decomposition for Improved Compression and Query Performance in Columnar Storage
- On Detecting Cherry-picked Trendlines
- Front Matter
- Data-Driven Domain Discovery for Structured Datasets
- Realtime Index-Free Single Source SimRank Processing on Web-Scale Graphs
- Demand-Aware Route Planning for Shared Mobility Services
- DeepDB: Learn from Data, not from Queries!
- Data Migration using Datalog Program Synthesis
- LiveGraph: A Transactional Graph Storage System with Purely Sequential Adjacency List Scans
- KBPearl: A Knowledge Base Population System Supported by Joint Entity and Relation Linking
- Compression of Uncertain Trajectories in Road Networks
- Understanding and Benchmarking the Impact of GDPR on Database Systems
- LB+-Trees: Optimizing Persistent Index Performance on 3DXPoint Memory
- Enabling Low Tail Latency on Multicore Key-Value Stores
- Approximate Analytics System over Compressed Time Series with Tight Deterministic Error Guarantees
- Traversing Large Graphs on GPUs with Unified Memory
- Supporting Hard Queries over Probabilistic Preferences
- Front Matter
- Dash: Scalable Hashing on Persistent Memory
- The PGM-index: a fully-dynamic compressed learned index with provable worst-case bounds
- Diagnosing Root Causes of Intermittent Slow Queries in Large-Scale Cloud Databases
- Pangolin: An Efficient and Flexible Graph Mining System on CPU and GPU
- Quantifying TPC-H Choke Points and Their Optimizations
- Efficient Algorithms for Crowd-Aided Categorization
- Set-valued Data Publication with Local Privacy: Tight Error Bounds and Efficient Mechanisms
- Translation of Array-Based Loops to Distributed Data-Parallel Programs
- Incrementalization of Graph Partitioning Algorithms
- Optimizing Item and Subgroup Configurations for Social-Aware VR Shopping
- Efficient Confidentiality-Preserving Data Analytics over Symmetrically Encrypted Datasets
- Single Machine Graph Analytics on Massive Datasets Using Intel Optane DC Persistent Memory
- Front Matter
- Atomic Commitment Across Blockchains
- HydraList: A Scalable In-Memory Index Using Asynchronous Updates and Partial Replication
- eXtreme Modelling in Practice
- Maximum Biclique Search at Billion Scale
- ARDA: Automatic Relational Data Augmentation for Machine Learning
- An LSM-based Tuple Compaction Framework for Apache AsterixDB
- ADnEV: Cross-Domain Schema Matching using Deep Similarity Matrix Adjustment and Evaluation
- Query Performance Prediction for Concurrent Queries using Graph Embedding
- Scalable, NearZero Loss Disaster Recovery for Distributed Data Stores
- VHP: Approximate Nearest Neighbor Search via Virtual Hypersphere Partitioning
- IDAR: Fast Supergraph Search Using DAG Integration
- Guided Exploration of User Groups
- iDEC: Indexable Distance Estimating Codes for Approximate Nearest Neighbor Search
- Efficient Algorithms for Budgeted Influence Maximization on Massive Social Networks
- Mining Top-k Pairs of Correlated Subgraphs in a Large Network
- FireLedger: A High Throughput Blockchain Consensus Protocol
- Put an Elephant into a Fridge: Optimizing Cache Efficiency for In-memory Key-value Stores
- Anytime Stochastic Routing with Hybrid Learning
- Understanding the Effect of Data Center Resource Disaggregation on Production DBMSs
- Optimal Algorithms for Ranked Enumeration of Answers to Full Conjunctive Queries
- Sage: Parallel Semi-Asymmetric Graph Algorithms for NVRAMs
- Front Matter
- Pricing Influential Nodes in Online Social Networks
- KClist++: A Simple Algorithm for Finding k-Clique Densest Subgraphs in Large Graphs
- Dynamic Interleaving of Content and Structure for Robust Indexing of Semi-Structured Hierarchical Data
- ChiSeL: Graph Similarity Search using Chi-Squared Statistics in Large Probabilistic Graphs
- Fast Incremental Discovery of Pointwise Order Dependencies
- Approximate Denial Constraints
- Sharing Opportunities for OLTP Workloads in Different Isolation Levels
- Biclustering and Boolean Matrix Factorization in Data Streams
- Effective and Efficient Relational Community Detection and Search in Large Dynamic Heterogeneous Information Networks
- Natural language to SQL: Where are we today?
- Accelerating Truss Decomposition on Heterogeneous Processors
- Searching a Database of Source Codes Using Contextualized Code Search
- Data Stream Event Prediction Based on Timing Knowledge and State Transitions
- Shared Arrangements: practical inter-query sharing for streaming dataflows
- Front Matter
- SmartBench: A Benchmark For Data Management In Smart Spaces
- Series2Graph: Graph-based Subsequence Anomaly Detection for Time Series
- Sato: Contextual Semantic Type Detection in Tables
- TransNet: Training Privacy-Preserving Neural Network over Transformed Layer
- Capturing Associations in Graphs
- Dynamic Parameter Allocation in Parameter Servers
- Adopting Worst-Case Optimal Joins in Relational Database Systems
- A workload-adaptive mechanism for linear queries under local differential privacy
- SPORES: Sum-Product Optimization via Relational Equality Saturation for Large Scale Linear Algebra
- Data Market Platforms: Trading Data Assets to Solve Data Problems
- Baran: Effective Error Correction via a Unified Context Representation and Transfer Learning
- Relational Data Synthesis using Generative Adversarial Networks: A Design Space Exploration
- Leaper: A Learned Prefetcher for Cache Invalidation in LSM-tree based Storage Engines
- Approximate Selection with Guarantees using Proxies
- 2R: Efficiently Isolating Cold Pages in Flash Storages
- Knowledge Translation
- Towards Scalable Dataframe Systems
- Aria: A Fast and Practical Deterministic OLTP Database
- The Computation of Optimal Subset Repairs
- Pytheas: Pattern-based Table Discovery in CSV Files
- Privacy Preserving Vertical Federated Learning for Tree-based Models
- Topic-based Community Search over Spatial-Social Networks
- LOG-Means: Efficiently Estimating the Number of Clusters in Large Datasets
- Efficient Oblivious Database Joins
- Evaluating Top-k Queries with Inconsistency Degrees
- Cerebro: A Data System for Optimized Deep Learning Model Selection
- CoopStore: Optimizing Precomputed Summaries for Aggregation
- Fast Subtrajectory Similarity Search in Road Networks under Weighted Edit Distance Constraints
- SimTab: Accuracy-Guaranteed SimRank Queries through Tighter Confidence Bounds and Multi-Armed Bandits
- Efficiently Approximating Selectivity Functions using Low Overhead Regression Models
- Identifying Insufficient Data Coverage in Databases with Multiple Relations
- Continuously Monitoring Alternative Shortest Paths on Road Networks
- Hypergraph Motifs: Concepts, Algorithms, and Discoveries
- Hitting Set Enumeration with Partial Information for Unique Column Combination Discovery
- SSTD: A Distributed System on Streaming Spatio-Textual Data
- Continuous Prefetch for Interactive Data Applications
- Efficient and Effective Similar Subtrajectory Search with Deep Reinforcement Learning
- A Benchmarking Study of Embedding-based Entity Alignment for Knowledge Graphs
- Effectively Learning Spatial Indices
- Stable Learned Bloom Filters for Data Streams
- Auto-Transform: Learning-to-Transform by Patterns
- Magic mirror in my hand, which is the best in the land? An Experimental Evaluation of Index Selection Algorithms
- MorphStore: Analytical Query Engine with a Holistic Compression-Enabled Processing Model
- Fast and Effective Distribution-Key Recommendation for Amazon Redshift
- Sieve: A Middleware Approach to Scalable Access Control for Database Management Systems
- Cloudburst: Stateful Functions-as-a-Service
- ODIN: Automated Drift Detection and Recovery in Video Analytics
- Front Matter
- Demand-based Sensor Data Gathering with Multi-Query Optimization
- CheetahVIS: A Visual Analytical System for Large Urban Bus Data
- UNMASQUE: A Hidden SQL Query Extractor
- G3: When Graph Neural Networks Meet Parallel Graph Processing Systems on GPUs
- PiBench Online: Interactive Benchmarking of Persistent Memory Indexes
- VisClean: Interactive Cleaning for Progressive Visualization
- IMO: A Toolbox for Simulating and Querying ``Infected'' Moving Objects
- COUNTATA: Dataset Labeling Using Pattern Counts
- A Demonstration of Willump: A Statistically-Aware End-to-end Optimizer for Machine Learning Inference
- Ease.ml/snoopy in Action: Towards Automatic Feasibility Analysis for Machine Learning Application Development
- DeepTrack: Monitoring and Exploring Spatio-Temporal Data - A Case of Tracking COVID-19 -
- DF-Toolkit: Interacting with Low-Level Database Storage
- Like Water and Oil: With a Proper Emulsifier, Query Compilation and Data Parallelism Will Mix Well
- SQUARES : A SQL Synthesizer Using Query Reverse Engineering
- SuccinctEdge: A Succinct RDF Store for Edge Computing
- SuDocu: Summarizing Documents by Example
- CONCIERGE: Improving Constrained Search Results by Data Melioration
- Demonstrating the Voice-Based Exploration of Large Data Sets with CiceroDB-Zero
- FASTS: A Satisfaction-Boosting Bus Scheduling Assistant
- Vaas: Video Analytics At Scale
- sPaQLTooLs: A Stochastic Package Query Interface for Scalable Constrained Optimization
- ActiveDeeper: A Model-based Active Data Enrichment System
- RDFFrames: Knowledge Graph Access for Machine Learning Tools
- Scalable, Resilient and Configurable Permissioned Blockchain Fabric
- BIRDS: Programming view update strategies in Datalog
- Apache IoTDB: Time-series database for Internet of Things
- Evaluating Ridesharing Algorithms using the Jargo Real-Time Stochastic Simulator
- BitFun: Fast Answers to Queries with Tunable Functions in Geospatial Array DBMS
- SPHINX: A System for Metapath-based Entity Exploration in Heterogeneous Information Networks
- ExplainED: Explanations for EDA Notebooks
- MuSe: Multiple Deletion Semantics for Data Repair
- Tabula in Action: A Sampling Middleware for Interactive Geospatial Visualization Dashboards
- X^2R^2: a Tool for Explainable and Explorative Reidentification Risk Analysis
- Obi-Wan: Ontology-Based RDF Integration of Heterogeneous Data
- CrocodileDB in Action: Resource-Efficient Query Execution by Exploiting Time Slackness
- GraphAn: Graph-based Subsequence Anomaly Detection
- LMFAO: An Engine for Batches of Group-By Aggregates
- ESTOCADA: Towards Scalable Polystore Systems
- Demonstration of Interactive Runtime Debugging of Distributed Dataflows in Texera
- DeepTRANS: A Deep Learning System for Public Bus Travel Time Estimation using Traffic Forecasting
- Demonstration of ScroogeDB: Getting More Bang For the Buck with Deterministic Approximation in the Cloud
- Scrutinizer: Fact Checking Statistical Claims
- SciLens News Platform: A System for Real-Time Evaluation of News Articles
- HDAG-Explorer: A System for Hierarchical DAG Summarization and Exploration
- Orca-SR: A Real-Time Traffic Engineering Framework leveraging Similarity Joins
- nKV in Action: Accelerating KV-Stores on NativeComputational Storage with Near-Data Processing
- Demonstration of Inferring Causality from Relational Databases with CaRL
- SQL for Data Scientists: Designing SQL Tutorials for Scalable Online Teaching
- Debugging Large-Scale Data Science Pipelines using Dagger
- I-Rex: An Interactive Relational Query Explainer for SQL
- PANDA: Policy-aware Location Privacy for Epidemic Surveillance
- PyTorch Distributed: Experiences on Accelerating Data Parallel Training
- Towards Multi-way Join Aware Optimizer in SAP HANA
- InvaliDB: Scalable Push-Based Real-Time Queries on Top of Pull-Based Databases (Extended)
- Automated Generation of Materialized Views in Oracle
- Native JSON Datatype Support: Maturing SQL and NoSQL convergence in Oracle Database
- TiDB: A Raft-based HTAP Database
- A system design for elastically scaling transaction processing engines in virtualized servers
- Industrial Strength OLTP Using Main Memory and Many Cores
- Asymmetric-Partition Replication for Highly Scalable Distributed Transaction Processing in Practice
- AGL: A Scalable System for Industrial-purpose Graph Machine Learning
- LedgerDB: A Centralized Ledger Database for Universal Audit and Verification
- AnalyticDB-V: A Hybrid Analytical Engine Towards Query Fusion for Structured and Unstructured Data
- Oracle AutoML: A Fast and Predictive AutoML Pipeline
- Monarch: Google's Planet-Scale In-Memory Time Series Database
- Concurrent Updates to Pages with Fixed-Size rows Using Lock-Free Algorithms
- POLARIS: The Distributed SQL Engine in Azure Synapse
- MyRocks: LSM-Tree Database Storage Engine Serving Facebook's Social Graph
- Helios: Hyperscale Indexing for the Cloud & Edge
- Replication at the Speed of Change - a Fast, Scalable Replication Solution for Near Real-Time HTAP Processing
- Exploiting Domain Knowledge to address Multi-Class Imbalance and a Heterogeneous Feature Space in Classification Tasks for Manufacturing Data
- Alibaba Hologres: A Cloud-Native Service for Hybrid Serving/Analytical Processing
- DIAMetrics: Benchmarking Query Engines at Scale
- Db2 Event Store: A Purpose-Built IoT Database Engine
- F1 Lightning: HTAP as a Service
- AutoToken: Predicting Peak Parallelism for Big Data Analytics at Microsoft
- A Drop-in Middleware for Serializable DB Clustering across Geo-distributed Sites
- Improving Reproducibility of Data Science Pipelines through Transparent Provenance Capture
- Conversational BI: An Ontology-Driven ConversationSystem for Business Intelligence Applications
- Magnet: Push-based Shuffle Service for Large-scale Data Processing
- Leveraging Organizational Resources to Adapt Models to New Data Modalities
- Delta Lake: High-Performance ACID Table Storage over Cloud Object Stores
- Robust Query Processing: Mission Possible
- Data Collection and Quality Challenges for Deep Learning
- Table Extraction and Understanding for Scientific and Enterprise Applications
- Similarity Query Processing for High-Dimensional Data
- Building High Throughput Permissioned Blockchain Fabrics: Challenges and Opportunities
- Fairly Evaluating and Scoring Items in a Data Set
- Spitz: A Verifiable Database System
- Dremel: A Decade of Interactive SQL Analysis at Web Scale
- JIT works: decide when all data is known
- Responsible Data Management
- Out-of-order Execution of Database Queries
- The Relational Data Borg is Learning
- Winds from Seattle: Database Research Directions
- Front Matter
- The Simpler The Better: An Indexing Approach for Shared-Route Planning Queries
- An Analysis of Concurrency Control Protocols for In-Memory Database with CCBench
- Improving Utility and Security of the Shuffler-based Differential Privacy
- Cuckoo Index: A Lightweight Secondary Index Structure
- MorphoSys: Automatic Physical Design Metamorphosis for Distributed Database Systems
- Parallel Graph Algorithms in Constant Adaptive Rounds: Theory meets Practice
- DeltaPQ: Lossless Product Quantization Code Compression for High Dimensional Similarity Search
Volume 12
https://www.vldb.org/pvldb/volumes/12/
- Front Matter
- List Intersection for Web Search: Algorithms, Cost Models, and Optimizations
- Interactive Checks for Coordination Avoidance
- Pigeonring: A Principle for Faster Thresholded Similarity Search
- Local Algorithms for Hierarchical Dense Subgraph Discovery
- Cost-Effective Data Annotation using Game-Based Crowdsourcing
- Optimization for Active Learning-based Interactive Database Exploration
- Front Matter
- Exploring Change - A New Dimension of Data Analytics
- The Flexible Socio Spatial Group Queries
- The Lernaean Hydra of Data Series Similarity Search: An Experimental Evaluation of the State of the Art
- Rafiki: Machine Learning as an Analytics Service System
- Automatic Index Selection for Large-Scale Datalog Computation
- Start Late or Finish Early: A Distributed Graph Processing System with Redundancy Reduction
- Improving Optimistic Concurrency Control Through Transaction Batching and Operation Reordering
- Front Matter
- Query Log Compression for Workload Analytics
- The Maximum Trajectory Coverage Query in Spatial Databases
- Towards a Learning Optimizer for Shared Clouds
- Snuba: Automating Weak Supervision to Label Training Data
- On Obtaining Stable Rankings
- PS-Tree-based Efficient Boolean Expression Matching for High Dimensional and Dense Workloads
- SWIFT: Mining Representative Patterns from Large Event Streams
- Smurf: Self-Service String Matching Using Random Forests
- Chasing Similarity: Distribution-aware Aggregation Scheduling
- ShrinkWrap: Efficient SQL Query Processing in Differentially Private Data Federations
- Front Matter
- A Study of Partitioning Policies for Graph Analytics on Large-scale Distributed Platforms
- Utility-Driven Graph Summarization
- ColumnML: Column-Store Machine Learning with On-The-Fly Data Transformation
- Cost-efficient Data Acquisition on Online Data Marketplaces for Correlation Analysis
- Cleaning Crowdsourced Labels Using Oracles For Statistical Classification
- Beyond Macrobenchmarks: Microbenchmark-based Graph Database Evaluation
- IPA: Invariant-preserving Applications for Weakly consistent Replicated Databases
- DIFF: A Relational Interface for Large-Scale Data Explanation
- Stream Frequency Over Interval Queries
- Helix: Holistic Optimization for Accelerating Iterative Machine Learning
- Front Matter
- Fast Approximate Nearest Neighbor Search With The Navigating Spreading-out Graph
- Document Reordering for Faster Intersection
- Correlation Constraint Shortest Path over Large Multi-Relation Graphs
- Performance-Optimal Filtering: Bloom overtakes Cuckoo at High-Throughput
- Analyzing Efficient Stream Processing on Modern Hardware
- Efficient Data Ingestion and Query Processing for LSM-Based Storage Systems
- HetExchange: Encapsulating heterogeneous CPU–GPU parallelism in JIT compiled engines
- Meta-Mappings for Schema Mapping Reuse
- An Experimental Evaluation of Garbage Collectors on Big Data Applications
- Adaptive Optimistic Concurrency Control for Heterogeneous Workloads
- MgCrab: Transaction Crabbing for Live Migration in Deterministic Database Systems
- Unifying Consensus and Atomic Commitment for Effective Cloud Data Management
- Front Matter
- Autoscaling Tiered Cloud Storage in Anna
- Snapshot Semantics for Temporal Multiset Relations
- Certus: An Effective Entity Resolution Approach with Graph Differential Dependencies (GDDs)
- Efficient and Effective Algorithms for Clustering Uncertain Graphs
- Pangea: Monolithic Distributed Storage for Data Analytics
- Scaling-Up In-Memory Datalog Processing: Observations and Techniques
- Cache-aware load balancing of data center applications
- Front Matter
- Minimizing Cost by Reducing Scaling Operations in Distributed Stream Processing
- ProvCite: Provenance-based Data Citation
- Deducing Certain Fixes to Graphs
- Solving k-center Clustering (with Outliers) in MapReduce and Streaming, almost as Accurately as Sequentially
- Explain3D: Explaining Disagreements in Disjoint Datasets
- DASH: Database Shadowing for Mobile DBMS
- Accelerating Generalized Linear Models with MLWeaving: A One-Size-Fits-All System for Any-precision Learning
- Declarative Recursive Computation on an RDBMS, or, Why You Should Use a Database For Distributed Machine Learning
- Front Matter
- Design, Implementation, and Evaluation of Write-Back Policy with Cache Augmented Data Stores
- User Guidance for Efficient Fact Checking
- An In-Depth Comparison of s-t Reliability Algorithms over Uncertain Graphs
- Dynamic Scaling for Parallel Graph Computations
- TopoX: Topology Refactorization for Efficient Graph Partitioning and Processing
- Multi-Dimensional Balanced Graph Partitioning via Projected Gradient Descent
- Efficient Discovery of Sequence Outlier Patterns
- A Comparative Evaluation of Order-Revealing Encryption Schemes and Secure Range-Query Protocols
- Front Matter
- k/2-hop: Fast Mining of Convoy Patterns With Effective Pruning
- Balance-Aware Distributed String Similarity-Based Query Processing System
- Fine-Grained, Secure and Efficient Data Provenance on Blockchain Systems
- Progressive Top-k Subarray Query Processing in Array Databases
- Megaphone: Latency-conscious state migration for distributed streaming dataflows
- From Anomaly Detection to Rumour Detection using Data Streams of Social Platforms
- Obscure: Information-Theoretic Oblivious and Verifiable Aggregation Queries
- Selectivity Estimation for Range Predicates using Lightweight Models
- Front Matter
- Constrained Shortest Path Query in a Large Time-Dependent Graph
- Finding Theme Communities from Database Networks
- Ridesharing: Simulator, Benchmark, and Evaluation
- Distributed Subgraph Matching on Timely Dataflow
- Hyper Dimension Shuffle: Efficient Data Repartition at Petabyte Scale in Scope
- Answering Range Queries Under Local Differential Privacy
- Vertex Priority Based Butterfly Counting for Large-scale Bipartite Networks
- Block as a Value for SQL over NoSQL
- Optimal and General Out-of-Order Sliding-Window Aggregation
- Creating Top Ranking Options in the Continuous Option and Preference Space
- Ontology-based Entity Matching in Attributed Graphs
- Real-time Distributed Co-Movement Pattern Detection on Streaming Trajectories
- iBTune: Individualized Buffer Tuning for Large-scale Cloud Databases
- Front Matter
- Online Template Induction for Machine-Generated Emails
- Querying Shortest Paths on Time Dependent Road Networks
- Example-Driven Query Intent Discovery: Abductive Reasoning using Semantic Similarity
- Automated Verification of Query Equivalence Using Satisfiability Modulo Theories
- Towards a Unified Framework for String Similarity Joins
- NETS: Extremely Fast Outlier Detection from a Data Stream via Set-Based Processing
- STAR: Scaling Transactions through Asymmetric Replication
- Subjective Databases
- Fast and Robust Distributed Subgraph Enumeration
- An Experimental Evaluation of Large Scale GBDT Systems
- PrivateSQL: A Differentially Private SQL Query Engine
- CAPER: A Cross-Application Permissioned Blockchain
- Crossbow: Scaling Deep Learning with Small Batch Sizes on Multi-GPU Servers
- Finding Attribute-Aware Similar Region for Data Analysis
- Intermittent Query Processing
- Hillview: A trillion-cell spreadsheet for big data
- Embedded Functional Dependencies and Data-completeness Tailored Database Design
- Ocean Vista: Gossip-Based Visibility Control for Speedy Geo-Distributed Transactions
- An IDEA: An Ingestion Framework for Data Enrichment in AsterixDB
- DimmStore: Memory Power Optimization for Database Systems
- Generating Application-specific Data Layouts for In-memory Databases
- Rewriting of Plain SO Tgds into Nested Tgds
- Blockchain Meets Database: Design and Implementation of a Blockchain Relational Database
- An Intermediate Representation for Optimizing Machine Learning Pipelines
- Accelerating Raw Data Analysis with the ACCORDA Software and Hardware Architecture
- Comparing Synopsis Techniques for Approximate Spatial Data Analysis
- BlockchainDB - A Shared Database on Blockchains
- Efficient Task-Specific Data Valuation for Nearest Neighbor Algorithms
- Distributed Implementations of Dependency Discovery Algorithms
- Rethinking Database High Availability with RDMA Networks
- Motivo: Fast Motif Counting via Succinct Color Coding and Adaptive Sampling
- Arx: An Encrypted Database using Semantically Secure Encryption
- Efficient Knowledge Graph Accuracy Evaluation
- Optimizing Subgraph Queries by Combining Binary and Worst-Case Optimal Joins
- Neo: A Learned Query Optimizer
- Efficient Algorithms for Densest Subgraph Discovery
- Plan-Structured Deep Neural Network Models for Query Performance Prediction
- SLOG: Serializable, Low-latency, Geo-replicated Transactions
- GRAIL: Efficient Time-Series Representation Learning
- Front Matter
- GALO: Guided Automated Learning for re-Optimization
- Synergistic Graph and SQL Analytics Inside IBM Db2
- Cleanits: A Data Cleaning System for Industrial Time Series
- ITAA: An Intelligent Trajectory-driven Outdoor Advertising Deployment Assistant
- SystemER: A Human-in-the-loop System for Explainable Entity Resolution
- Buckle: Evaluating Fact Checking Algorithms Built on Knowledge Bases
- A Query System for Efficiently Investigating Complex Attack Behaviors for Enterprise Security
- CAPE: Explaining Outliers by Counterbalancing
- BlackMagic: Automatic Inlining of Scalar UDFs into SQL Queries with Froid
- ProgressiveDB - Progressive Data Analytics as a Middleware
- doppioDB 2.0: Hardware Techniques for Improved Integration of Machine Learning into Databases
- COVIZ: A System for Visual Formation and Exploration of Patient Cohorts
- PRIMAT: A Toolbox for Fast Privacy-preserving Matching
- NashDB: Fragmentation, Replication, and Provisioning using Economic Methods
- Flash in Action: Scalable Spatial Data Analysis Using Markov Logic Networks
- I Can't Believe It's Not (Only) Software! Bionic Distributed Storage for Parquet Files
- VISE: Vehicle Image Search Engine with Traffic Camera
- WiClean: A System for Fixing Wikipedia Interlinks Using Revision History Patterns
- SparkCruise: Handsfree Computation Reuse in Spark
- In-database Distributed Machine Learning: Demonstration using Teradata SQL Engine
- SHOAL: Large-scale Hierarchical Taxonomy via Graph-based Query Coalition in E-commerce
- DPSAaS: Multi-Dimensional Data Sharing and Analytics as Services under Local Differential Privacy
- PriSTE: Protecting Spatiotemporal Event Privacy in Continuous Location-Based Services
- Datalignment: Ontology Schema Alignment Through Datalog Containment
- IHCS: An Integrated Hybrid Cleaning System
- CAPRIO: Graph-based Integration of Indoor and Outdoor Data for Path Discovery
- HERMIT in Action: Succinct Secondary Indexing Mechanism via Correlation Exploration
- DISPERS: Securing Highly Distributed Queries on Personal Data Management Systems
- Stateful Functions as a Service in Action
- Demonstration of Krypton: Optimized CNN Inference for Occlusion-based Deep CNN Explanations
- LensXPlain: Visualizing and Explaining Contributing Subsets for Aggregate Query Answers
- Juneau: Data Lake Management for Jupyter
- ApproxML: Efficient Approximate Ad-Hoc ML Models Through Materialization and Reuse
- Flare & Lantern: Efficiently Swapping Horses Midstream
- Trinity: An Extensible Synthesis Framework for Data Science
- PSynDB: Accurate and Accessible Private Data Generation
- FishStore: Fast Ingestion and Indexing of Raw Data
- Spade: A Modular Framework for Analytical Exploration of RDF Graphs
- Making an RDBMS Data Scientist Friendly: Advanced In-database Interactive Analytics with Visualization Support
- UDAO: A Next-Generation Unified Data Analytics Optimizer
- AggChecker: A Fact-Checking System for Text Summaries of Relational Data Sets
- GRANO: Interactive Graph-based Root Cause Analysis for Cloud-Native Distributed Data Platform
- Dietcoin: Hardening Bitcoin Transaction Verification Process For Mobile Devices
- Raptor: Large Scale Analysis of Big Raster and Vector Data
- Data Civilizer 2.0: A Holistic Framework for Data Preparation and Analytics
- Tuplex: Robust, Efficient Analytics When Python Rules
- Ease.ml/ci and Ease.ml/meter in Action: Towards Data Management for Statistical Generalization
- PivotE: Revealing and Visualizing the Underlying Entity Structures for Exploration
- Speedup Your Analytics: Automatic Parameter Tuning for Databases and Big Data Systems
- TextCube: Automated Construction and Multidimensional Exploration
- The Ever Evolving Online Labor Market: Overview, Challenges and Opportunities
- Machine Learning Meets Big Spatial Data
- Data Lake Management: Challenges and Opportunities
- Combating Fake News: A Data Management and Mining Perspective
- Personal Database Security and Trusted Execution Environments: A Tutorial at the Crossroads
- SAP HANA goes private - From Privacy Research to Privacy Aware Enterprise Analytics
- Guided automated learning for query workload re-optimization
- Procella: Unifying serving and analytical data at YouTube
- A Lightweight and Efficient Temporal Database Management System in TDSQL
- Native Store Extension for SAP HANA
- AnalyticDB: Real-time OLAP Database System at Alibaba Cloud
- Tunable Consistency in MongoDB
- TitAnt: Online Real-time Transaction Fraud Detection in Ant Financial
- AliGraph: A Comprehensive Graph Neural Network Platform
- Customizable and Scalable Fuzzy Join for Big Data
- QTune: A Query-Aware Database Tuning System with Deep Reinforcement Learning
- Experiences with Approximating Queries in Microsoft's Production Big-Data Clusters
- Constant Time Recovery in Azure SQL Database
- Yugong: Geo-Distributed Data and Job Placement at Scale
- Choosing A Cloud DBMS: Architectures and Tradeoffs
- S3: A Scalable In-memory Skip-List Index for Key-Value Store
- DDSketch: A Fast and Fully-Mergeable Quantile Sketch with Relative-Error Guarantees
- A Distributed System for Large-scale n-gram Language Models at Tencent
- A Morsel-Driven Query Execution Engine for Heterogeneous Multi-Cores
- Smile: A System to Support Machine Learning on EEG Data at Scale
- Updating Graph Databases with Cypher
- Adapting TPC-C Benchmark to Measure Performance of Multi-Document Transactions in MongoDB
- Cloud native database systems at Alibaba: Opportunities and Challenges
- In-Memory for the masses: Enabling cost-efficient deployments of in-memory data management platforms for business applications
- Couchbase Analytics: NoETL for Scalable NoSQL Data Analysis
- Performance in the spotlight
- Integration of Large-Scale Data Processing Systems and Traditional Parallel Database Technology
- PNUTS to Sherpa: Lessons from Yahoo!’s Cloud Database
- What I probably did right and what I think I could have done better
- Enabling Data Science for the Majority
- Opportunities for Data Management Research in the Era of Horizontal AI/ML
- Front Matter
- Strong consistency is not hard to get: Two-Phase Locking and Two-Phase Commit on Thousands of Cores
- Discovery and Ranking of Embedded Uniqueness Constraints
- Online Density Bursting Subgraph Detection from Temporal Graphs
- Progressive Indexes: Indexing for Interactive Data Analysis
- Distributed Edge Partitioning for Trillion-edge Graphs
- Optimal Column Layout for Hybrid Workloads
- Selecting Data to Clean for Fact Checking: Minimizing Uncertainty vs. Maximizing Surprise
Volume 11
https://www.vldb.org/pvldb/volumes/11/
- Front Matter
- Relaxed Operator Fusion for In-Memory Databases: Making Compilation, Vectorization, and Prefetching Work Together At Last
- ProbeSim: Scalable Single-Source and Top-k SimRank Computations on Dynamic Graphs
- A Formal Semantics of SQL Queries, Its Validation, and Applications
- Efficient Haar+ Synopsis Construction for the Maximum Absolute Error Measure
- Approximate String Joins with Abbreviations
- Query-Driven On-The-Fly Knowledge Base Construction
- GRETA: Graph-based Real-time Event Trend Aggregation
- Parallel Personalized Pagerank on Dynamic Graphs
- Accelerating Dynamic Graph Analytics on GPUs
- Front Matter
- Analyzing the Impact of System Architecture on the Scalability of OLTP Engines for High-Contention Workloads
- Scalable Database Logging for Multicores
- An Analytical Study of Large SPARQL Query Logs
- Approximately Counting Triangles in Large Graph Streams Including Edge Duplicates with a Fixed Memory Usage
- Subgraph Matching: on Compression and Computation
- Synthesizing Entity Matching Rules by Examples
- Stylus: A Strongly-Typed Store for Serving Massive RDF Data
- Holistic Query Evaluation over Information Extraction Pipelines
- Interleaving with Coroutines: A Practical Approach for Robust Index Joins
- Front Matter
- Efficient Structural Graph Clustering: An Index-Based Approach
- An Authorization Model for Multi-Provider Queries
- Snorkel: Rapid Training Data Creation with Weak Supervision
- VERIFAS: A Practical Verifier for Artifact Systems
- A Distributed Multi-GPU System for Fast Graph Processing
- Efficient Denial Constraint Discovery with Hydra
- ReCache: Reactive Caching for Fast Analytics over Heterogeneous Data
- Effective and Efficient Dynamic Graph Coloring
- GPU Rasterization for Real-Time Spatial Aggregation over Arbitrary Polygons
- Are Key-Foreign Key Joins Safe to Avoid when Learning High-Capacity Classifiers?
- Worker Recommendation for Crowdsourced Q&A Services: A Triple-Factor Aware Approach
- Front Matter
- Clustering Stream Data by Exploring the Evolution of Density Mountain
- Query Fresh: Log Shipping on Steroids
- The Ubiquity of Large Graphs and Surprising Challenges of Graph Processing
- Froid: Optimization of Imperative Programs in a Relational Database
- An Experimental Study on Hub Labeling based Shortest Path Algorithms
- Concurrent Log-Structured Memory for Many-Core Key-Value Stores
- Clustering Uncertain Graphs
- Lusail: A System for Querying Linked Data at Scale
- Cardinality Estimation: An Experimental Survey
- SQL Statement Logging for Making SQLite Truly Lite
- Front Matter
- Towards Practical Differential Privacy for SQL Queries
- CloudKit: Structured Storage for Mobile Applications
- BzTree: A High-Performance Latch-free Range Index for Non-Volatile Memory
- FlexPS: Flexible Parallelism Control in Parameter Server Architecture
- Automated Migration of Hierarchical Data to Relational Tables using Programming-by-Example
- TOAIN: A Throughput Optimizing Adaptive Index for Answering Dynamic kNN Queries on Road Networks
- Ease.ml: Towards Multi-tenant Resource Sharing for Machine Learning Workloads
- Theoretically Optimal and Empirically Efficient R-trees with Strong Parallelizability
- Domain-Aware Multi-Truth Discovery from Conflicting Sources
- Contention-Aware Lock Scheduling for Transactional Databases
- Front Matter
- Quickstep: A Data Platform Based on the Scaling-Up Approach
- Coconut: A Scalable Bottom-Up Approach for Building Data Series Indexes
- Distributed Evaluation of Subgraph Queries Using Worst-case Optimal and Low-Memory Dataflows
- Model-free Control for Distributed Stream Data Processing using Deep Reinforcement Learning
- Smoke: Fine-grained Lineage at Interactive Speed
- Front Matter
- Conjunctive Queries with Inequalities Under Updates
- Bubble Execution: Resource-aware Reliable Analytics at Cloud Scale
- Efficient Discovery of Approximate Dependencies
- RC-Index: Diversifying Answers to Range Queries
- UlTraMan: A Unified Platform for Big Trajectory Data Management and Analytics
- Selecting Subexpressions to Materialize at Datacenter Scale
- Table Union Search on Open Data
- Scalable Training of Hierarchical Topic Models
- Front Matter
- Indexed Fast Network Proximity Querying
- Order Dispatch in Price-aware Ridesharing
- Exact Processing of Uncertain Top-k Queries in Multi-criteria Settings
- Discovery of Genuine Functional Dependencies from Relational Data with Missing Values
- Effective Temporal Dependence Discovery in Time Series Data
- HD-Index: Pushing the Scalability-Accuracy Boundary for Approximate kNN Search in High-Dimensional Spaces
- LA3: A Scalable Link- and Locality-Aware Linear Algebra-Based Graph Analytics System
- Front Matter
- Trajectory Simplification: An Experimental Study and Quality Analysis
- Constraint-based Explanation and Repair of Filter-Based Transformations
- Scalable Semantic Querying of Text
- The Vadalog System: Datalog-based Reasoning for Knowledge Graphs
- Noticeable Network Delay Minimization via Node Upgrades
- Evaluating End-to-End Optimization for Data Analytics Applications in Weld
- Improved Selectivity Estimation by Combining Knowledge from Sampling and Synopses
- Efficient Algorithms for Adaptive Influence Maximization
- Morton Filters: Faster, Space-Efficient Cuckoo Filters via Biasing, Compression, and Decoupled Logical Sparsity
- An Optimal and Progressive Approach to Online Search of Top-K Influential Communities
- Front Matter
- Errata for "Analysis of two existing and one new dynamic programming algorithm for the generation of optimal bushy join trees without cross products"
- Data Synthesis based on Generative Adversarial Networks
- CERES: Distantly Supervised Relation Extraction from the Semi-Structured Web
- Efficient Estimation of Inclusion Coefficient using HyperLogLog Sketches
- Set Similarity Joins on MapReduce: An Experimental Survey
- Plan Stitch: Harnessing the Best of Many Plans
- ForkBase: An Efficient Storage Engine for Blockchain and Forkable Applications
- Experimental Analysis of Distributed Graph Systems
- Transform-Data-by-Example (TDE): An Extensible Search Engine for Data Transformations
- Frontier: Resilient Edge Processing for the Internet of Things
- LightDB: A DBMS for Virtual Reality Video
- Optimizing error of high-dimensional statistical queries under differential privacy
- MLBench: Benchmarking Machine Learning Services Against Human Experts
- Maximum Co-located Community Search in Large Scale Social Networks
- ChronosDB: Distributed, File Based, Geospatial Array DBMS
- Adaptive Sampling for Rapidly Matching Histograms
- Leveraging Similarity Joins for Signal Reconstruction
- Sundial: Harmonizing Concurrency Control and Caching in a Distributed OLTP Database Management System
- Chi: A Scalable and Programmable Control Plane for Distributed Stream Processing Systems
- Front Matter
- In-RDBMS Hardware Acceleration of Advanced Analytics
- Join Query Optimization Techniques for Complex Event Processing Applications
- Efficient Adaptive Detection of Complex Event Patterns
- Robustness Metrics for Relational Query Execution Plans
- Question Answering Over Knowledge Graphs: Question Understanding Via Template Decomposition
- Explaining Repaired Data with CFDs
- AIDA - Abstraction for Advanced In-Database Analytics
- RHEEM: Enabling Cross-Platform Data Processing - May The Big Data Be With You! -
- An Experimental Evaluation of Task Assignment in Spatial Crowdsourcing
- 2SCENT: An Efficient Algorithm to Enumerate All Simple Temporal Cycles
- Distributed Representations of Tuples for Entity Resolution
- Efficient Construction of Approximate Ad-Hoc ML models Through Materialization and Reuse
- Axiomatic Foundations and Algorithms for Deciding Semantic Equivalences of SQL Queries
- HomeRun: Scalable Sparse-Spectrum Reconstruction of Aggregated Historical Data
- Differentially Private Hierarchical Count-of-Counts Histograms
- Efficient Document Analytics on Compressed Data: Method, Challenges, Algorithms, Insights
- You Say 'What', I Hear 'Where' and 'Why'? (Mis-)Interpreting SQL to Derive Fine-Grained Provenance
- An Eight-Dimensional Systematic Evaluation of Optimized Search Algorithms on Modern Processors
- Vocalizing Large Time Series Efficiently
- Filter Before You Parse: Faster Analytics on Raw Data with Sparser
- Streaming Graph Partitioning: An Experimental Study
- Efficient Distributed Memory Management with RDMA and Caching
- Causal Consistency and Latency Optimality: Friend or Foe?
- A Unified Approach to Route Planning for Shared Mobility
- Moment-Based Quantile Sketches for Efficient High Cardinality Aggregation Queries
- How Good Are Modern Spatial Analytics Systems?
- Locality-Sensitive Hashing for Earthquake Detection: A Case Study Scaling Data-Driven Science
- ModelarDB: Modular Model-Based Time Series Management with Spark and Cassandra
- Exploiting Coroutines to Attack the "Killer Nanoseconds"
- The Tao of Inference in Privacy-Protected Databases
- Efficient Searchable Encryption Through Compression
- Front Matter
- Challenges and Experiences in Building an Efficient Apache Beam Runner For IBM Streams
- On Optimizing Operator Fusion Plans for Large-Scale Machine Learning in SystemML
- OLTPShare: The Case for Sharing in OLTP Workloads
- Automating Large-Scale Data Quality Verification
- Taking Omid to the Clouds: Fast, Scalable Transactions for Real-Time Cloud Analytics
- Providing Streaming Joins as a Service at Facebook
- FusionInsight LibrA: Huawei's Enterprise Cloud Data Analytics Platform
- F1 Query: Declarative Querying at Scale
- PolarFS: An Ultra-low Latency and Failure Resilient Distributed File System for Shared Storage Cloud Database
- Accordion: Better Memory Organization for LSM Key-Value Stores
- Real-time Constrained Cycle Detection in Large Dynamic Graphs
- BTrim - Hybrid In-Memory Database Architecture for Extreme Transaction Processing in VLDBs
- Sherlock: A System for Interactive Summarization of Large Text Collections
- DataStorm-FE: A Data- and Decision-Flow and Coordination Engine for Coupled Simulation Ensembles
- A Demonstration of the OtterTune Automatic Database Management System Tuning Service
- OctopusFS in Action: Tiered Storage Management for Data Intensive Computing
- TRIPS: A System for Translating Raw Indoor Positioning Data into Visual Mobility Semantics
- A Demonstration of PERC: Probabilistic Entity Resolution With Crowd Errors
- CDB: A Crowd-Powered Database System
- FASTER: An Embedded Concurrent Key-Value Store for State Management
- Maverick: A System for Discovering Exceptional Facts from Knowledge Graphs
- PTRider: A Price-and-Time-Aware Ridesharing System
- CoreKG: a Knowledge Lake Service
- RuDiK: Rule Discovery in Knowledge Bases
- The return of JedAI: End-to-End Entity Resolution for Structured and Semi-Structured Data
- Provenance Summaries for Answers and Non-Answers
- Helix: Accelerating Human-in-the-loop Machine Learning
- ShapeSearch: Flexible Pattern-based Querying of Trend Line Visualizations
- PANDA: A System for Partial Topology-based Search on Large Networks
- MSQL+: a Plugin Toolkit for Similarity Search under Metric Spaces in Distributed Relational Database Systems
- HYDRA: A Dynamic Big Data Regenerator
- A Demonstration of MAGiQ: Matrix Algebra Approach for Solving RDF Graph Queries
- REGAL+: Reverse Engineering SPJA Queries
- NLProveNAns: Natural Language Provenance for Non-Answers
- Fault-Tolerance for Distributed Iterative Dataflows in Action
- QuestPro: Queries in SPARQL Through Provenance
- GOLDRUSH: Rule Sharing System for Fraud Detection
- Discovering Diversified Paths in Knowledge Bases
- Declarative and distributed graph analytics with GRADOOP
- A collaborative framework for tweaking properties in a synthetic dataset
- Tooling Framework for Instantiating Natural Language Querying System
- Koko: A System for Scalable Semantic Querying of Text
- GC: A Graph Caching System for Subgraph/Supergraph Queries
- X2Q: Your Personal Example-based Graph Explorer
- ConnectionLens: Finding Connections Across Heterogeneous Data Sources
- ProvSQL:Provenance and Probability Management in PostgreSQL
- CYADB: A Database that Covers Your Ask
- CloudMatcher: A Hands-Off Cloud/Crowd Service for Entity Matching
- Collaborative Edge and Cloud Neural Networks for Real-Time Video Processing
- Dhalion in Action: Automatic Management of Streaming Applications
- Ease.ml in Action: Towards Multi-tenant Declarative Learning Services
- MustaCHE: A Multiple Clustering Hierarchies Explorer
- HypDB: A Demonstration of Detecting, Explaining and Resolving Bias in OLAP queries
- Learning Efficiently Over Heterogeneous Databases
- Scalable and Efficient Data Analytics and Mining with Lemonade
- SkinnerDB: Regret-Bounded Query Evaluation via Reinforcement Learning
- iSPEED: a Scalable and Distributed In-Memory Based Spatial Query System for Large and Structurally Complex 3D Data
- DfAnalyzer: Runtime Dataflow Analysis of Scientific Applications using Provenance
- A Demonstration of Sterling: A Privacy-Preserving Data Marketplace
- ConTPL: Controlling Temporal Privacy Leakage in Differentially Private Continuous Data Release
- Data Integration and Machine Learning: A Natural Synergy
- Database and Distributed Computing Fundamentals for Scalable, Fault-tolerant, and Consistent Maintenance of Blockchains
- Forecasting Big Time Series: Old and New
- Graph Data Models, Query Languages and Programming Paradigms
- Computational fact-checking: a content management perspective
- Information and Data Management at PUC-Rio and UFMG
- Open Data Integration
- Ten Years of WebTables
- Northstar: An Interactive Data Science System
- Panel: A Debate on Data and Algorithmic Ethics
- Front Matter
- A Comparative Evaluation of Systems for Scalable Linear Algebra-based Analytics
- A Concave Path to Low-overhead Robust Query Processing
- Interactive Summarization and Exploration of Top Aggregate Query Answers
- Everything You Always Wanted to Know About Compiled and Vectorized Queries But Were Afraid to Ask
- Durable Top-k Queries on Temporal Data
- Scalable, Variable-Length Similarity Search in Data Series: The ULISSE Approach
- FineLine: log-structured transactional storage and recovery
- ICARUS: Minimizing Human Effort in Iterative Data Completion
Volume 10
https://www.vldb.org/pvldb/volumes/10/
- Front Matter
- Cohort Query Processing
- Remember Where You Came From: On The Second-Order Random Walk Based Proximity Measures
- IL-Miner: Instance-Level Discovery of Complex Event Patterns
- Front Matter
- Adaptive NUMA-aware data placement and task scheduling for analytical workloads in main-memory column-stores
- Mostly-Optimistic Concurrency Control for Highly Contended Dynamic Workloads on a Thousand Cores
- Effective Indexing for Approximate Constrained Shortest Path Queries on Large Road Networks
- Front Matter
- Toward High-Performance Distributed Stream Processing via Approximate Fault Tolerance
- Path Cost Distribution Estimation Using Trajectory Data
- Fast Hierarchy Construction for Dense Subgraphs
- Sapprox: Enabling Efficient and Accurate Approximations on Sub-datasets with Distribution-aware Online Sampling
- Multi-Query Optimization for Subgraph Isomorphism Search
- Efficient Computation of Feedback Arc Set at Web-Scale
- A Declarative Query Processing System for Nowcasting
- NG-DBSCAN: Scalable Density-Based Clustering for Arbitrary Data
- Interactive Time Series Exploration Powered by the Marriage of Similarity Distances
- Computing Longest Increasing Subsequences over Sequential Data Streams
- Knowledge Exploration using Tables on the Web
- HubPPR: Effective Indexing for Approximate Personalized PageRank
- Scalable Distributed Subgraph Enumeration
- Fast Algorithm for the Lasso based L1-Graph Construction
- Resisting Tag Spam by Leveraging Implicit User Behaviors
- A General Framework for Estimating Graphlet Statistics via Random Walk
- Fast In-Memory SQL Analytics on Typed Graphs
- Stochastic Data Acquisition for Answering Queries as Time Goes by
- Front Matter
- Finding Persistent Items in Data Streams
- BlueCache: A Scalable Distributed Flash-based Key-value Store
- A General and Parallel Platform for Mining Co-Movement Patterns over Large-scale Trajectories
- VIP-Tree: An Effective Index for Indoor Spatial Queries
- Write-Behind Logging
- The TileDB Array Data Storage Manager
- DOCS: Domain-Aware Crowdsourcing System
- Lifting the Haze off the Cloud: A Consumer-Centric Market for Database Computation in the Cloud
- Two Birds, One Stone: A Fast, yet Lightweight, Indexing Scheme for Modern Database Systems
- History is a mirror to the future: Best-effort approximate complex event matching with insufficient resources
- PHyTM: Persistent Hybrid Transactional Memory
- Skipping-oriented Partitioning for Columnar Layouts
- Estimating Quantiles from the Union of Historical and Streaming Data
- Clay: Fine-Grained Adaptive Partitioning for General Database Schemas
- Effortless Data Exploration with zenvisage: An Expressive and Interactive Visual Analytics System
- Front Matter
- MapReduce and Streaming Algorithms for Diversity Maximization in Metric Spaces of Bounded Doubling Dimension
- Plausible Deniability for Privacy-Preserving Data Synthesis
- An Experimental Comparison of Partitioning Strategies in Distributed Graph Processing
- Shrink - Prescribing Resiliency Solutions for Streaming
- Distributed Join Algorithms on Thousands of Cores
- Clue-based Spatio-textual Query
- Truth Inference in Crowdsourcing: Is the Problem Solved?
- An Evaluation of Distributed Concurrency Control
- KBQA: Learning Question Answering over QA Corpora and Knowledge Bases
- Provenance for Natural Language Queries
- AdaptDB: Adaptive Partitioning for Distributed Joins
- An Experimental Evaluation of SimRank-based Similarity Search Algorithms
- High Performance Transactions via Early Write Visibility
- ZooBP: Belief Propagation for Heterogeneous Networks
- Front Matter
- Understanding the Sparse Vector Technique for Differential Privacy
- OLAK: An Efficient Algorithm to Prevent Unraveling in Social Networks
- Data Tweening: Incremental Visualization of Data Transforms
- SMCQL: Secure Query Processing for Private Data Networks
- The End of a Myth: Distributed Transaction Can Scale
- NED: An Inter-Graph Node Metric Based On Edit Distance
- Effective Community Search over Large Spatial Graphs
- Front Matter
- Effective and Complete Discovery of Order Dependencies via Set-based Axiomatization
- Adaptive Work Placement for Query Processing on Heterogeneous Computing Resources
- LFTF: A Framework for Efficient Tensor Analytics at Scale
- Local Search Methods for k-Means with Outliers
- Dimensional Testing for Reverse k-Nearest Neighbor Search
- An Empirical Evaluation of In-Memory Multi-Version Concurrency Control
- Finding Diverse, High-Value Representatives on a Surface of Answers
- Real-Time Influence Maximization on Dynamic Social Streams
- From Community Detection to Community Profiling
- Understanding Workers, Developing Effective Tasks, and Enhancing Marketplace Dynamics: A Study of a Large Crowdsourcing Marketplace
- One-Pass Error Bounded Trajectory Simplification
- Front Matter
- MILC: Inverted List Compression in Memory
- Cümülön-D: Data Analytics in a Dynamic Spot Market
- Automatic Algorithm Transformation for Efficient Multi-Snapshot Analytics on Temporal Graphs
- Looking Ahead Makes Query Plans Robust
- Bridging the Gap between HPC and Big Data frameworks
- Front Matter
- Revisiting the Stop-and-Stare Algorithms for Influence Maximization
- Leveraging Set Relations in Exact Set Similarity Join
- READS: A Random Walk Approach for Efficient and Accurate Dynamic SimRank
- Attribute-Driven Community Search
- Bias-Aware Sketches
- Data Driven Approximation with Bounded Resources
- Errata for ``Lightning Fast and Space Efficient Inequality Joins'' (PVLDB 8(13): 2074-2085)
- Front Matter
- Scalable Asynchronous Gradient Descent Optimization for Out-of-Core Models
- When Engagement Meets Similarity: Efficient (k,r)-Core Computation on Social Networks
- An Experimental Evaluation of Point-of-interest Recommendation in Location-based Social Networks
- Don't Hold My Data Hostage - A Case For Client Protocol Redesign
- Auto-Join: Joining Tables by Leveraging Transformations
- Time Series Data Cleaning: From Anomaly Detection to Anomaly Repairing
- Pivot-based Metric Indexing
- Heterogeneous Recommendations: What You Might Like To Read After Watching Interstellar
- SilkMoth: An Efficient Method for Finding Related Sets with Maximum Matching Constraints
- A Data Quality Metric (DQM): How to Estimate the Number of Undetected Errors in Data Sets
- Slalom: Coasting Through Raw Data via Adaptive Partitioning and Indexing
- Mison: A Fast JSON Parser for Data Analytics
- OrpheusDB: Bolt-on Versioning for Relational Databases
- Revisiting Reuse for Approximate Query Processing
- Probabilistic Database Summarization for Interactive Data Exploration
- Front Matter
- Memory Management Techniques for Large-Scale Persistent-Main-Memory Systems
- Trajectory Similarity Join in Spatial Networks
- HoloClean: Holistic Data Repairs with Probabilistic Inference
- Caribou: Intelligent Distributed Storage
- Towards Linear Algebra over Normalized Data
- Comparative Evaluation of Big-Data Systems on Scientific Image Analytics Workloads
- Revenue Maximization in Incentivized Social Advertising
- SquirrelJoin: Network-Aware Distributed Join Processing with Lazy Partitioning
- I’ve Seen “Enough”: Incrementally Improving Visualizations to Support Rapid Decision Making
- Minimal On-Road Time Route Scheduling on Time-Dependent Graphs
- A holistic view of stream partitioning costs
- Truss-based Community Search: a Truss-equivalence Based Indexing Approach
- Query Optimization for Dynamic Imputation
- In Search of an Entity Resolution OASIS: Optimal Asymptotic Sequential Importance Sampling
- Flexible Online Task Assignment in Real-Time Spatial Data
- A Forward Scan based Plane Sweep Algorithm for Parallel Interval Joins
- ASAP: Prioritizing Attention via Time Series Smoothing
- Knowledge Verification for LongTail Verticals
- SkyGraph: Retrieving Regions of Interest using Skyline Subgraph Queries
- Reverse Engineering Aggregation Queries
- LDA*: A Robust and Large-scale Topic Modeling System
- Social Hash Partitioner: A Scalable Distributed Hypergraph Partitioner
- On Sampling from Massive Graph Streams
- Pyramid Sketch: a Sketch Framework for Frequency Estimation of Data Streams
- Reconciling Skyline and Ranking Queries
- CleanM: An Optimizable Query Language for Unified Scale-Out Data Cleaning
- Distributed Trajectory Similarity Search
- Runtime Optimization of Join Location in Parallel Data Management Systems
- Stitching Web Tables for Improving Matching Quality
- DigitHist: a Histogram-Based Data Summary with Tight Error Bounds
- Fast Scans on Key-Value Stores
- Finding the maximum clique in massive graphs
- Privacy-preserving Network Provenance
- Truth Discovery for SpatioTemporal Events from Crowdsourced Data
- Data Vocalization: Optimizing Voice Output of Relational Data
- NoScope: Optimizing Deep CNN-Based Queries over Video Streams at Scale
- Front Matter
- Parallel Replication across Formats in SAP HANA for Scaling Out Mixed OLTP/OLAP Workloads
- Developing a Low Dimensional Patient Class Profile in Accordance to Their Respiration-Induced Tumor Motion
- Dimensions Based Data Clustering and Zone Maps
- Stateful Scalable Stream Processing at LinkedIn
- Query-able Kafka: An agile data analytics pipeline for mobile wireless networks
- Statisticum: Data Statistics Management in SAP HANA
- Quaestor: Query Web Caching for Database-as-a-Service Providers
- Fiber-based architecture for NFV cloud databases
- Probabilistic Demand Forecasting at Scale
- ExtraV: Boosting Graph Processing Near Storage with a Coherent Accelerator
- State Management in Apache Flink®: Consistent Stateful Distributed Stream Processing
- PaxosStore: High-availability Storage Made Practical in WeChat
- Resumable Online Index Rebuild in SQL Server
- SAP HANA Adoption of Non-Volatile Memory
- CarStream: An Industrial System of Big Data Processing for Internet-of-Vehicles
- FAD.js: Fast JSON Data Access Using JIT-based Speculative Optimizations
- Colt: Concept Lineage Tool for Data Flow Metadata Capture and Analysis
- Matrix Profile IV: Using Weakly Labeled Time Series to Predict Outcomes
- Adaptive Statistics in Oracle 12c
- Dhalion:Self-Regulating Stream Processing in Heron
- Interactive Navigation of Open Data Linkages
- noWorkflow: a Tool for Collecting, Analyzing, and Managing Provenance from Python Scripts
- ARShop: A Cloud-based Augmented Reality System for Shopping
- Mind the Gap: Bridging Multi-Domain Query Workloads with EmptyHeaded
- Crossing the finish line faster when paddling the Data Lake with Kayak
- Debugging Transactions and Tracking their Provenance with Reenactment
- PICASSO: Exploratory Search of Connected Subgraph Substructures in Graph Databases
- DITIR: Distributed Index for High Throughput Trajectory Insertion and Real-time Temporal Range Query
- FlashView: An Interactive Visual Explorer for Raw Data
- Upsortable: Programming TopK Queries Over Data Streams
- QUIS: InSitu Heterogeneous Data Source Querying
- Automating Data Citation in CiteDB
- C-Explorer: Browsing Communities in Large Graphs
- GRAPE: Parallelizing Sequential Graph Computations
- Flower: A Data Analytics Flow Elasticity Manager
- STEED: An Analytical Database System for TrEE-structured Data
- LocLok: Location Cloaking with Differential Privacy via Hidden Markov Model
- Strider: An Adaptive, Inference-enabled Distributed RDF Stream Processing Engine
- A Confidence-Aware Top-k Query Processing Toolkit on Crowdsourcing
- Explaining and Querying Knowledge Graphs by Relatedness
- Thoth in Action: Memory Management in Modern Data Analytics
- Monopedia: Staying Single is Good Enough - The HyPer Way for Web Scale Applications
- Dima: A Distributed In-Memory Similarity-Based Query Processing System
- TeCoRe: Temporal Conflict Resolution in Knowledge Graphs
- MLog: Towards Declarative In-Database Machine Learning
- Foresight: Recommending Visual Insights
- A BAD Demonstration: Towards Big Active Data
- ClaimBuster:The First-ever End-to-end Fact-checking System
- QIRANA Demonstration: Real time Scalable Query Pricing
- DataTweener: A Demonstration of a Tweening Engine for Incremental Visualization of Data Transforms
- ZaliQL: Causal Inference from Observational Data at Scale
- A Demonstration of ST-Hadoop: A MapReduce Framework for Big Spatio-temporal Data
- Creation and Interaction with Large-scale Domain-Specific Knowledge Bases
- A Demonstration of Stella: A Crowdsourcing-Based Geotagging Framework
- Exploring big volume sensor data with Vroom
- New Trends on Exploratory Methods for Data Analytics
- Summarizing Static and Dynamic Big Graphs
- Geometric Approaches for Top-k Queries
- Spatial Crowdsourcing: Challenges, Techniques, and Applications
- The Era of Big Spatial Data
- Complex Event Recognition in the Big Data Era
- Blockchains and Databases
- Caching at the Web Scale
- Human-in-the-loop Data Integration
- The Data Center under your Desk - How Disruptive is Modern Hardware for DB System Design?
- 7 Secrets That My Mother Didn't Tell Me
- Intelligent Probing for Locality Sensitive Hashing: Multi-Probe LSH and Beyond
- Front Matter
- Scalable Replay-Based Replication For Fast Databases
- SlimDB: A Space-Efficient Key-Value Storage Engine For Semi-Sorted Data
- A Survey and Experimental Comparison of Distributed SPARQL Engines for Very Large RDF Data
- BlockJoin: Efficient Matrix Partitioning Through Joins
- Efficient Mining of Regional Movement Patterns in Semantic Trajectories
- Estimating Join Selectivities using Bandwidth-Optimized Kernel Density Models
Volume 9
https://www.vldb.org/pvldb/volumes/9/
- Front Matter
- Query-Aware Locality-Sensitive Hashing for Approximate Nearest Neighbor Search
- K-Core Decomposition of Large Networks on a Single PC
- Walking in the Cloud: Parallel SimRank at Scale
- Front Matter
- Messing Up with BART: Error Generation for Evaluating Data-Cleaning Algorithms
- Fully Dynamic Betweenness Centrality Maintenance on Massive Networks
- From Competition to Complementarity: Comparative Influence Diffusion and Maximization
- PIXIDA: Optimizing Data Parallel Jobs in Wide-Area Data Analytics
- Front Matter
- Spatial Online Sampling and Aggregation
- A Seven-Dimensional Analysis of Hashing Methods and its Implications on Query Processing
- The iBench Integration Metadata Generator
- QuERy: A Framework for Integrating Entity Resolution with Query Processing
- Processing and Optimizing Main Memory Spatial-Keyword Queries
- Neighbor-Sensitive Hashing
- Cumulon: Matrix-Based Data Analytics in the Cloud with Spot Instances
- New Lower and Upper Bounds for Shortest Distance Queries on Terrains
- The Complexity of Resilience and Responsibility for Self-Join-Free Conjunctive Queries
- Streaming Anomaly Detection Using Randomized Matrix Sketching
- How Good Are Query Optimizers, Really?
- Titian: Data Provenance Support in Spark
- Front Matter
- High-Speed Query Processing over High-Speed Networks
- Behavior Query Discovery in System-Generated Temporal Graphs
- Asynchronous Memory Access Chaining
- Design of Policy-Aware Differentially Private Algorithms
- Approximate Closest Community Search in Networks
- Cache locality is not enough: High-Performance Nearest Neighbor Search with Product Quantization Fast Scan
- Combining Quantitative and Logical Data Cleaning
- Schema-agnostic vs Schema-based Configurations for Blocking Methods on Homogeneous Data
- Ego-net Community Mining Applied to Friend Suggestion
- Temporal Rules Discovery for Web Data Cleaning
- Explaining Query Answers with Explanation-Ready Databases
- An Efficient Partition Based Method for Exact Set Similarity Joins
- CLAMShell: Speeding up Crowds for Low-latency Data Labeling
- Front Matter
- Online Entity Resolution Using an Oracle
- Exploiting Equality Generating Dependencies in Checking Chase Termination
- A Shifting Bloom Filter Framework for Set Queries
- Husky: Towards a More Efficient and Expressive Distributed Computing Framework
- Repairing Data through Regular Expressions
- Leveraging Lock Contention to Improve OLTP Application Performance
- Front Matter
- Maximizing Bichromatic Reverse Spatial and Textual k Nearest Neighbor Queries
- Inferray: fast in-memory RDF inference
- MQJoin: Efficient Shared Execution of Main-Memory Joins
- k-Nearest Neighbors on Road Networks: A Journey in Experimentation and In-Memory Implementation
- BCC: Reducing False Aborts in Optimistic Concurrency Control with Low Cost for In-Memory Databases
- Front Matter
- I/O Efficient ECC Graph Decomposition via Graph Reduction
- The End of Slow Networks: It's Time for a Redesign
- LEOPARD: Lightweight Edge-Oriented Partitioning and Replication for Dynamic Graphs
- SlimShot: In-Database Probabilistic Inference for Knowledge Bases
- A General-Purpose Query-Centric Framework for Querying Big Graphs
- Scalable Package Queries in Relational Database Systems
- SKYPE: Top-k Spatial-keyword Publish/Subscribe Over Sliding Window
- Discovering the Skyline of Web Databases
- Front Matter
- Crowdsourced Top-k Algorithms: An Experimental Evaluation
- Front Matter
- Decibel: The Relational Dataset Branching System
- An Empirical Evaluation of Set Similarity Join Techniques
- Multiple Query Optimization on the D-Wave 2X Adiabatic Quantum Computer
- Parallelizing Query Optimization on Shared-Nothing Architectures
- The shortest path is not always a straight line
- Comparative Analysis of Approximate Blocking Techniques for Entity Resolution
- An Experimental Evaluation of Datacenter Workloads On Low-Power Embedded Micro Servers
- Front Matter
- Cleaning Timestamps with Temporal Constraints
- Tempo: Robust and Self-Tuning Resource Management in Multi-tenant Parallel Databases
- Parallel Evaluation of Multi-Semi-Joins
- WarpLDA: a Cache Efficient O(1) Algorithm for Latent Dirichlet Allocation
- Faster Plan Generation through Consideration of Functional Dependencies and Keys
- RUMA has it: Rewired User-space Memory Access is Possible!
- WiSeDB: A Learning-based Workload Management Advisor for Cloud Databases
- Streaming Similarity Self-Join
- S2RDF: RDF Querying with SPARQL on Spark
- BlinkFill: Semi-supervised Programming By Example for Syntactic String Transformations
- META: An Efficient Matching-Based Method for Error-Tolerant Autocompletion
- Front Matter
- Semantic SPARQL Similarity Search Over RDF Knowledge Graphs
- Weaver: A High-Performance, Transactional Graph Database Based on Refinable Timestamps
- Distributed Data Deduplication
- A framework for annotating CSV-like data
- Query Reranking As A Service
- Front Matter
- G-SQL: Fast Query Processing via Graph Exploration
- Measuring and Optimizing Distributed Array Programs
- YourSQL: A High-Performance Database System Leveraging In-Storage Computing
- Lifetime-Based Memory Management for Distributed Data Processing Systems
- ActiveClean: Interactive Data Cleaning For Statistical Modeling
- Compressed Linear Algebra for Large-Scale Machine Learning
- Fast Queries Over Heterogeneous Data Through Engine Customization
- Data-driven Visual Graph Query Interface Construction and Maintenance: Challenges and Opportunities
- Detecting Data Errors: Where are we and what needs to be done?
- Exploiting Soft and Hard Correlations in Big Data Query Optimization
- Interactive Browsing and Navigation in Relational Databases
- Cheap Data Analytics using Cold Storage Devices
- Parallel Local Graph Clustering
- Online Minimum Matching in Real-Time Spatial Data: Experiments and Analysis
- Index-Assisted Hierarchical Computations in Main-Memory RDBMS
- Dynamic Influence Analysis in Evolving Networks
- Distance-based Outlier Detection in Data Streams
- On Measuring the Lattice of Commonalities Among Several Linked Datasets
- Oblivious RAM: A Dissection and Experimental Evaluation
- Optimization of Conjunctive Predicates for Main Memory Column Stores
- Explaining Outputs in Modern Data Analytics
- RDF Graph Alignment with Bisimulation
- Teaching an RDBMS about ontological constraints
- BLAST: a Loosely Schema-aware Meta-blocking Approach for Entity Resolution
- LSH Ensemble: Internet-Scale Domain Search
- Magellan: Toward Building Entity Matching Management Systems
- ATHENA: An Ontology-Driven System for Natural Language Querying over Relational Data Stores
- Incremental Computation of Common Windowed Holistic Aggregates
- Effective Community Search for Large Attributed Graphs
- Front Matter
- Not for the Timid: On the Impact of Aggressive Over-booking in the Cloud
- Using Domain-Specific Languages For Analytic Graph Databases
- Kodiak: Leveraging Materialized Views For Very Low-Latency Analytics Over High-Dimensional Web-Scale Data
- GraphJet: Real-Time Content Recommendations at Twitter
- dmapply: A functional primitive to express distributed machine learning algorithms in R
- Cubrick: Indexing Millions of Records per Second for Interactive Analytics
- LDBC Graphalytics: A Benchmark for Large-Scale Graph Analysis on Parallel and Distributed Platforms
- Database System Support of Simulation Data
- Consistent Regions: Guaranteed Tuple Processing in IBM Streams
- Hybrid Row-Column Partitioning in Teradata
- TrafficDB: HERE’s High Performance Shared-Memory Data Store
- Comdb2: Bloomberg’s Highly Available Relational Database System
- Aerospike: Architecture of a Real-Time Operational DBMS
- The MemSQL Query Optimizer: A modern optimizer for real-time analytics in a distributed database
- Nitro: A Fast, Scalable In-Memory Storage Engine for NoSQL Global Secondary Index
- SystemML: Declarative Machine Learning on Spark
- Accelerating Analytics with Dynamic In-Memory Expressions
- GARUDA: A System for Large-Scale Mining of Statistically Significant Connected Subgraphs
- Vita: A Versatile Toolkit for Generating Indoor Mobility Data for Real-World Buildings
- Generating Flexible Workloads for Graph Databases
- ArchimedesOne: Query Processing over Probabilistic Knowledge Bases
- Rudolf: Interactive Rule Refinement System for Fraud Detection
- Graph databases in the browser: using LevelGraph to explore New Delhi
- Ziggy: Characterizing Query Results for Data Explorers
- Blaeu: Mapping and Navigating Large Tables with Cluster Analysis
- Sapphire: Querying RDF Data Made Simple
- December: A Declarative Tool for Crowd Member Selection
- A Demonstration of VisDPT: Visual Exploration of Differentially Private Trajectories
- JexLog: A Sonar for the Abyss
- Collaborative Crowdsourcing with Crowd4U
- YASK: A Why-Not Question Answering Engine for Spatial Keyword Query Services
- AutoG: A Visual Query Autocompletion Framework for Graph Databases
- SI2P: A Restaurant Recommendation System Using Preference Queries over Incomplete Information
- Mixed-instance querying: a lightweight integration architecture for data journalism
- Precision Performance Surgery for PostgreSQL: LLVM-based Expression Compilation, Just in Time
- Exploratory Querying of Extended Knowledge Graphs
- Exploring Databases via Reverse Engineering Ranking Queries with PALEO
- ExRank: An Exploratory Ranking Interface
- SPARQLByE: Querying RDF data by example
- NLProv: Natural Language Provenance
- Partial Marking for Automated Grading of SQL Queries
- Towards Personalized Maps: Mining User Preferences from Geo-textual Data
- A System for Region Search and Exploration
- Squall: Scalable Real-time Analytics
- Graph-based Exploration of Non-graph Datasets
- Rogas: A Declarative Framework for Network Analytics
- LocationSpark: A Distributed In-Memory Data Management System for Big Spatial Data
- Amoeba: A Shape changing Storage System for Big Data
- F: Regression Models over Factorized Views
- SigmaKB: Multiple Probabilistic Knowledge Base Fusion
- Magellan: Toward Building Entity Matching Management Systems over Data Science Stacks
- Large-scale Complex Analytics on Semi-structured Datasets using AsterixDB and Spark
- Schema Independent and Scalable Relational Learning By Castor
- AD-WIRE: Add-on for Web Item Reviewing System
- Machine Learning in the Real World
- Operational Analytics Data Management Systems
- Qualitative Data Cleaning
- Modern Main-Memory Database Systems
- Differential Privacy in the Wild: A tutorial on current practices & open challenges
- Human Factors in Crowdsourcing
- Trends and Challenges in Big Data Processing
- Data-Driven Disruption: The View from Silicon Valley
- Leave No Valuable Data Behind: The Crazy Ideas and the Business
- Location Data Management: A Tale of Two Systems and the "Next Destination"!
- Front Matter
- Quill: Efficient, Transferable, and Rich Analytics at Scale
- Perturbation Analysis of Database Queries
- HippogriffDB: Balancing I/O and GPU Bandwidth in Big Data Analytics
- Non-Invasive Progressive Optimization for In-Memory Databases
- Dscaler: Synthetically Scaling A Given Relational Database
- Fast and Adaptive Indexing of Multi-Dimensional Observational Data
- Price-Optimal Querying with Data APIs
- Voodoo - A Vector Algebra for Portable Database Performance on Modern Hardware
Volume 8
https://www.vldb.org/pvldb/volumes/8/
- Front Matter
- SRS: Solving c-Approximate Nearest Neighbor Queries in High Dimensional Euclidean Space with a Tiny Index
- Top-k Nearest Neighbor Search In Uncertain Data Series
- Resource Bricolage for Parallel Database Systems
- In-Memory Performance for Big Data
- Trajectory Simplification: On Minimizing the Direction-based Error
- Interpretable and Informative Explanations of Outcomes
- Constructing an Interactive Natural Language Interface for Relational Databases
- Leveraging Graph Dimensions in Online Graph Search
- Spatial Joins in Main Memory: Implementation Matters!
- Front Matter
- Selectivity Estimation on Streaming Spatio-Textual Data Using Local Correlations
- Processing Moving kNN Queries Using Influential Neighbor Sets
- Scaling Up Crowd-Sourcing to Very Large Datasets: A Case for Active Learning
- CANDS: Continuous Optimal Navigation via Distributed Stream Processing
- Rare Time Series Motif Discovery from Unbounded Streams
- Pregelix: Big(ger) Graph Analytics on a Dataflow Engine
- Profiling R on a Contemporary Processor
- Front Matter
- Coordination Avoidance in Database Systems
- QuickFOIL: Scalable Inductive Logic Programming
- Staring into the Abyss: An Evaluation of Concurrency Control with One Thousand Cores
- Multi-Objective Parametric Query Optimization
- Deployment of Query Plans on Multicores
- E-Store: Fine-Grained Elastic Partitioning for Distributed Transaction Processing
- Beyond Itemsets: Mining Frequent Featuresets over Structured Items
- Inferring Continuous Dynamic Social Influence and Personal Preference for Temporal Behavior Prediction
- Large-Scale Distributed Graph Computing Systems: An Experimental Evaluation
- Faster Set Intersection with SIMD instructions by Reducing Branch Mispredictions
- Scalable Topical Phrase Mining from Text Corpora
- Efficient Top-K SimRank-based Similarity Join
- Front Matter
- In-Cache Query Co-Processing on Coupled CPU-GPU Architectures
- Scaling Manifold Ranking Based Image Retrieval
- Memory-Efficient Hash Joins
- Preference-aware Integration of Temporal Data
- MOCgraph: Scalable Distributed Graph Processing Using Message Online Computing
- NVRAM-aware Logging in Transaction Systems
- Trill: A High-Performance Incremental Query Processor for Diverse Analytics
- Event Pattern Matching over Graph Streams
- A Confidence-Aware Approach for Truth Discovery on Long-Tail Data
- Fast Failure Recovery in Distributed Graph Processing Systems
- The More the Merrier: Efficient Multi-Source Graph Traversal
- Front Matter
- MRCSI: Compressing and Searching String Collections with Multiple References
- YADING: Fast Clustering of Large-Scale Time Series Data
- Hear the Whole Story: Towards the Diversity of Opinion in Crowdsourcing Markets
- REWIND: Recovery Write-Ahead System for In-Memory Non-Volatile Data-Structures
- Influential Community Search in Large Networks
- Rapid Sampling for Visualizations with Ordering Guarantees
- Optimal Enumeration: Efficient Top-k Tree Matching
- Monitoring Distributed Streams using Convex Decompositions
- UDA-GIST: An In-database Framework to Unify Data-Parallel and State-Parallel Analytics
- Efficient Partial-Pairs SimRank Search for Large Networks
- Linearized and Single-Pass Belief Propagation
- Mining Revenue-Maximizing Bundling Configuration
- Reverse k Nearest Neighbors Query Processing: Experiments and Analysis
- Exploiting Vertex Relationships in Speeding up Subgraph Isomorphism over Large Graphs
- Approximate Lifted Inference with Probabilistic Databases
- Errata for “Crowdsourcing Algorithms for Entity Resolution” (PVLDB 7(12):1071-1082)
- Front Matter
- Improving Main Memory Hash Joins on Intel Xeon Phi Processors: An Experimental Approach
- DREAM: Distributed RDF Engine with Adaptive Query Planner and Minimal Communication
- Online Topic-Aware Influence Maximization
- Walk, Not Wait: Faster Sampling Over Online Social Networks
- Querying with Access Patterns and Integrity Constraints
- Front Matter
- General Incremental Sliding-Window Aggregation
- Shared Execution of Recurring Workloads in MapReduce
- Sharing Buffer Pool Memory in Multi-Tenant Relational Database-as-a-Service
- Answering Why-not Questions on Reverse Top-k Queries
- Practical Authenticated Pattern Matching with Optimal Proof Size
- A Performance Study of Big Data on Small Nodes
- Divide & Conquer-based Inclusion Dependency Discovery
- Persistent B+-Trees in Non-Volatile Main Memory
- Robust Local Community Detection: On Free Rider Effect and Its Elimination
- Understanding the Causes of Consistency Anomalies in Apache Cassandra
- Viral Marketing Meets Social Advertising: Ad Allocation with Minimum Regret
- Front Matter
- ALID: Scalable Dominant Cluster Detection
- An Efficient Similarity Search Framework for SimRank over Large Dynamic Graphs
- Compaction Management in Distributed Key-Value Datastores
- D2P: Distance-Based Differential Privacy in Recommenders
- FrogWild! – Fast PageRank Approximations on Graph Engines
- Optimal Probabilistic Cache Stampede Prevention
- Front Matter
- DAQ: A New Paradigm for Approximate Query Processing
- A Scalable Search Engine for Mass Storage Smart Objects
- Schema Management for Document Stores
- On the Surprising Difficulty of Simple Things: the Case of Radix Partitioning
- Knowledge-Based Trust: Estimating the Trustworthiness of Web Sources
- Giraph Unchained: Barrierless Asynchronous Parallel Execution in Pregel-like Graph Processing Systems
- Work-Efficient Parallel Skyline Computation for the GPU
- Front Matter
- Scalable Subgraph Enumeration in MapReduce
- Indexing Highly Dynamic Hierarchical Data
- Community Detection in Social Networks: An In-depth Benchmarking Study with a Procedure-Oriented Framework
- Growing a Graph Matching from a Handful of Seeds
- Reliable Diversity-Based Spatial Crowdsourcing by Moving Workers
- Leveraging History for Faster Sampling of Online Social Networks
- TOP: A Framework for Enabling Algorithmic Optimizations for Distance-Related Problems
- Efficient Processing of Window Functions in Analytical SQL Queries
- Real-time Targeted Influence Maximization for Online Advertisements
- Functional Dependency Discovery: An Experimental Evaluation of Seven Algorithms
- Searchlight: Enabling Integrated Search and Exploration over Large Multidimensional Data
- Privacy Implications of Database Ranking
- Front Matter
- Possible and Certain SQL Key
- Scaling Similarity Joins over Tree-Structured Data
- Worker Skill Estimation in Team-Based Tasks
- DPT: Differentially Private Trajectory Synthesis Using Hierarchical Reference Systems
- Supporting Scalable Analytics with Latency Constraints
- SCAN++: Efficient Algorithm for Finding Clusters, Hubs and Outliers on Large-scale Graphs
- Rethinking serializable multiversion concurrency control
- Rank aggregation with ties: Experiments and Analysis
- GraphMat: High performance graph analytics made productive
- Mega-KV: A Case for GPUs to Maximize the Throughput of In-Memory Key-Value Stores
- Taming Subgraph Isomorphism for RDF Query Processing
- SnapToQuery: Providing Interactive Feedback during Exploratory Query Specification
- GraphTwist: Fast Iterative Graph Computation with Two-tier Optimizations
- SIMD- and Cache-Friendly Algorithm for Sorting an Array of Structures
- Enriching Data Imputation with Extensive Similarity Neighbors
- To Lock, Swap, or Elide: On the Interplay of Hardware Transactional Memory and Lock-Free Indexing
- Incremental Knowledge Base Construction Using DeepDive
- Learning User Preferences By Adaptive Pairwise Comparison
- Front Matter
- Aggregate Estimations over Location Based Services
- Principles of Dataset Versioning: Exploring the Recreation/Storage Tradeoff
- SEMA-JOIN: Joining Semantically-Related Tables Using Big Table Corpora
- Stale View Cleaning: Getting Fresh Answers from Stale Materialized Views
- Compressed Spatial Hierarchical Bitmap (cSHB) Indexes for Efficiently Processing Spatial Range Query Workloads
- Selective Provenance for Datalog Programs Using Top-K Queries
- Processing of Probabilistic Skyline Queries Using MapReduce
- Bonding Vertex Sets Over Distributed Graph: A Betweenness Aware Approach
- A Natural Language Interface for Querying General and Individual Knowledge
- Scaling Up Concurrent Main-Memory Column-Store Scans: Towards Adaptive NUMA-aware Data and Task Placement
- SQLite Optimization with Phase Change Memory for Mobile Applications
- An Architecture for Compiling UDF-centric Workflows
- A Scalable Distributed Graph Partitioner
- Take me to your leader! Online Optimization of Distributed Storage Configurations
- Association Rules with Graph Patterns
- Fuzzy Joins in MapReduce: An Experimental Study
- PARADIS: An Efficient Parallel Algorithm for In-place Radix Sort
- Join Size Estimation Subject to Filter Conditions
- Asynchronous and Fault-Tolerant Recursive Datalog Evaluation in Shared-Nothing Engines
- Maximum Rank Query
- Performance and Scalability of Indexed Subgraph Query Processing Methods
- Lenses: An On-Demand Approach to ETL
- Keys for Graphs
- Spatial Partitioning Techniques in Spatial Hadoop
- Extracting Logical Hierarchical Structure of HTML Documents Based on Headings
- Permutation Search Methods are Efficient, Yet Faster Search is Possible
- Distributed Architecture of Oracle Database In-memory
- Argonaut: Macrotask Crowdsourcing for Complex Data Processing
- Building a Replicated Logging System with Apache Kafka
- Indexing and Selecting Hierarchical Business Logic
- Schema-Agnostic Indexing with Azure DocumentDB
- JetScope: Reliable and Interactive Analytics at Cloud Scale
- Differential Privacy in Telco Big Data Platform
- Optimization of Common Table Expressions in MPP Database Systems
- Towards Scalable Real-time Analytics: An Architecture for Scale-out of OLxP Workloads
- FIT to Monitor Feed Quality
- Real-Time Analytical Processing with SQL Server
- Efficient Evaluation of Object-Centric Exploration Queries for Visualization
- Gobblin: Unifying Data Ingestion for Hadoop
- Query Optimization in Oracle 12c Database In-Memory
- Live Programming in the LogicBlox System: A MetaLogiQL Approach
- The Dataflow Model: A Practical Approach to Balancing Correctness, Latency, and Cost in Massive-Scale, Unbounded, Out-of-Order Data Processing
- One Trillion Edges: Graph Processing at Facebook-Scale
- Gorilla: A Fast, Scalable, In-Memory Time Series Database
- ConfSeer: Leveraging Customer Support Knowledge Bases for Automated Misconfiguration Detection
- Scaling Spark in the Real World: Performance and Usability
- StarDB: A Large-Scale DBMS for Strings
- Evaluating SPARQL Queries on Massive RDF Datasets
- A Topic-based Reviewer Assignment System
- FP-Hadoop: Efficient Execution of Parallel Jobs Over Skewed Data
- Data Profiling with Metanome
- Demonstration of Santoku: Optimizing Machine Learning over Normalized Data
- PRISM: Concept-preserving Summarization of Top-K Social Image Search Results
- Provenance for SQL through Abstract Interpretation: Value-less, but Worthwhile
- SDB: A Secure Query Processing System with Data Interoperability
- SPARTex: A Vertex-Centric Framework for RDF Data Analytics
- I2RS: A Distributed Geo-Textual Image Retrieval and Recommendation System
- Reformulation-based query answering in RDF: alternatives and performance
- SAASFEE: Scalable Scientific Workflow Execution Engine
- A Demonstration of HadoopViz: An Extensible MapReduce System for Visualizing Big Spatial Data
- QOCO: A Query Oriented Data Cleaning System with Oracles
- TreeScope: Finding Structural Anomalies In Semi-Structured Data
- A Demonstration of the BigDAWG Polystore System
- RINSE: Interactive Data Series Exploration with ADS+
- Collaborative Data Analytics with DataHub
- Mindtagger: A Demonstration of Data Labeling in Knowledge Base Construction
- Perseus: An Interactive Large-Scale Graph Mining and Visualization Tool
- Smart Drill-Down: A New Data Exploration Operator
- Virtual eXist-db: Liberating Hierarchical Queries from the Shackles of Access Path Dependence
- Annotating Database Schemas to Help Enterprise Search
- VIIQ: Auto-Suggestion Enabled Visual Interface for Interactive Graph Query Formulation
- FLORIN – A System to Support (Near) Real-Time Applications on User Generated Content on Daily News
- VINERy: A Visual IDE for Information Extraction
- KATARA: Reliable Data Cleaning with Knowledge Bases and Crowdsourcing
- GIS Navigation Boosted by Column Stores
- Gain Control over your Integration Evaluations
- AIDE: An Automatic User Navigation System for Interactive Data Exploration
- A Demonstration of AQWA: Adaptive Query-Workload-Aware Partitioning of Big Spatial Data
- Janiform Intra-Document Analytics for Reproducible Research
- A Framework for Clustering Uncertain Data
- EFQ: Why-Not Answer Polynomials in Action
- Error Diagnosis and Data Profiling with Data X-Ray
- Sharing and Reproducing Database Applications
- A Demonstration of TripleProv: Tracking and Querying Provenance over Web Data
- WADaR: Joint Wrapper and Data Repair
- DATASPREAD: Unifying Databases and Spreadsheets
- Wisteria: Nurturing Scalable Data Cleaning Infrastructure
- CODD: A Dataless Approach to Big Data Testing
- Query-Oriented Summarization of RDF Graphs
- Universal-DB: Towards Representation Independent Graph Analytics
- Tornado: A Distributed Spatio-Textual Stream Processing System
- Vizdom: Interactive Analytics through Pen and Touch
- S+EPPs: Construct and Explore Bisimulation Summaries, plus Optimize Navigational Queries; all on Existing SPARQL Systems
- GraphGen: Exploring Interesting Graphs in Relational Data
- DBSeer: Pain-free Database Administration through Workload Intelligence
- Real Time Analytics: Algorithms and Systems
- On Uncertain Graphs Modeling and Queries
- A Time Machine for Information: Looking Back to Look Forward
- Structured Analytics in Social Media
- Truth Discovery and Crowdsourcing Aggregation: A Unified Perspective
- Tutorial: SQL-on-Hadoop Systems
- Engineering Database Hardware and Software Together
- Big Data Research: Will Industry Solve all the Problems?
- Big Plateaus of Big Data on the Big Island
- Databases and Hardware: The Beginning and Sequel of a Beautiful Friendship
- Front Matter
- AQWA: Adaptive Query-Workload-Aware Partitioning of Big Spatial Data
- Lightning Fast and Space Efficient Inequality Joins
- Finding Pareto Optimal Groups: Group-based Skyline
- k-Regret Queries with Nonlinear Utilities
- Clash of the Titans: MapReduce vs. Spark for Large Scale Data Analytics
- Towards Maximum Independent Sets on Massive Graphs
- S-Store: Streaming Meets Transaction Processing
- Multi-Version Range Concurrency Control in Deuteronomy
- Query From Examples: An Iterative, Data-Driven Approach to Query Construction
- Tracking the Conductance of Rapidly Evolving Topic-Subgraphs
- SEEDB: Efficient Data-Driven Visualization Recommendations to Support Visual Analytics
- DEXTER: Large-Scale Discovery and Extraction of Product Specifications on the Web
Volume 7
https://www.vldb.org/pvldb/volumes/7/
- Front Matter
- Efficient and Effective KNN Sequence Search with Approximate n-grams
- More is Simpler: Effectively and Efficiently Assessing Node-Pair Similarities Based on Hyperlinks
- An Approach towards the Study of Symmetric Queries
- CPU Sharing Techniques for Performance Isolation in Multitenant Relational Database-as-a-Service
- Authenticating Top-k Queries in Location-based Services with Confidentiality
- Toward a Distance Oracle for Billion-Node Graphs
- Finding Shortest Paths on Terrains by Killing Two Birds with One Stone
- Multi-Core, Main-Memory Joins: Sort vs. Hash Revisited
- Front Matter
- The Uncracked Pieces in Database Cracking
- Diversity based Relevance Feedback for Time Series Search
- Storage Management in the NVRAM Era
- Front Matter
- Online Ordering of Overlapping Data Sources
- Multi-Query Optimization in MapReduce Framework
- Attraction and Avoidance Detection from Movements
- A Partition-Based Approach to Structure Similarity Search
- Highly Available Transactions: Virtues and Limitations
- From "Think Like a Vertex" to "Think Like a Graph"
- Probabilistic Nearest Neighbor Queries on Uncertain Moving Object Trajectories
- Front Matter
- Delta: Scalable Data Dissemination under Capacity Constraints
- GeoScope: Online Detection of Geo-Correlated Information Trends in Social Networks
- Optimization for iterative queries on MapReduce
- Willingness Optimization for Social Group Activity
- High Performance Stream Query Processing With Correlation-Aware Partitioning
- OLTP-Bench: An Extensible Testbed for Benchmarking Relational Databases
- Gestural Query Specification
- Scalable Discovery of Unique Column Combinations
- Earth Mover's Distance based Similarity Search at Scale
- SeeDB: Visualizing Database Queries Efficiently
- Front Matter
- MaaT: Effective and scalable coordination of distributed transactions in the cloud
- A Data- and Workload-Aware Query Answering Algorithm for Range Queries Under Differential Privacy
- Certain Query Answering in Partially Consistent Databases
- Exemplar Queries: Give me an Example of What You Need
- An efficient reconciliation algorithm for social networks
- Computing k-Regret Minimizing Sets
- Reverse Top-k Search using Random Walk with Restart
- Write-limited sorts and joins for persistent memory
- Folk-IS: Opportunistic Data Services in Least Developed Countries
- Front Matter
- Shared Workload Optimization
- Scalable and Adaptive Online Joins
- Support the Data Enthusiast: Challenges for Next-Generation Data-Analysis Systems
- A Provenance Framework for Data-Dependent Process Analysis
- Tracking Entities in the Dynamic World: A Fast Algorithm for Matching Temporal Records
- Edelweiss: Automatic Storage Reclamation for Distributed Programming
- Front Matter
- Rank Join Queries in NoSQL Databases
- Biperpedia: An Ontology for Search Applications
- GRAMI: Frequent Subgraph and Pattern Mining in a Single Large Graph
- Lightweight Indexing of Observational Data in Log-Structured Storage
- epiC: an Extensible and Scalable System for Processing Big Data
- Hybrid Parallelization Strategies for Large-Scale Machine Learning in SystemML
- Schemaless and Structureless Graph Querying
- Optimizing Graph Algorithms on Pregel-like Systems
- Toward Computational Fact-Checking
- Front Matter
- A Principled Approach to Bridging the Gap between Graph Data and their Schemas
- An Efficient Publish/Subscribe Index for ECommerce Databases
- String Similarity Joins: An Experimental Evaluation
- Calibrating Data to Sensitivity in Private Data Analysis
- Effective Multi-Modal Retrieval based on Stacked Auto-Encoders
- Front Matter
- PRESS: A Novel Framework of Trajectory Compression in Road Networks
- Finding the Cost-Optimal Path with Time Constraint over Time-Dependent Graphs
- Optimal Crowd-Powered Rating and Filtering Algorithms
- Incremental Record Linkage
- Low-Latency Handshake Join
- Path Problems in Temporal Graphs
- Retrieving Regions of Interest for User Exploration
- SK-LSH: An Efficient Index Structure for Approximate Nearest Neighbor Search
- On Arbitrage-free Pricing for General Data Queries
- Splitter: Mining Fine-Grained Sequential Patterns in Semantic Trajectories
- Towards Building Wind Tunnels for Data Center Design
- Front Matter
- Reverse k-Ranks Query
- M4: A Visualization-Oriented Time Series Data Aggregation
- Continuous Matrix Approximation on Distributed Data
- An Evaluation of the Advantages and Disadvantages of Deterministic Database Systems
- Efficient In-memory Data Management: An Analysis
- Workload Matters: Why RDF Databases Need a New Design
- Storage Management in AsterixDB
- Building Efficient Query Engines in a High-Level Language
- Scalable Logging through Emerging Non-Volatile Memory
- When Data Management Systems Meet Approximate Hardware: Challenges and Opportunities
- From Data Fusion to Knowledge Fusion
- On k-Path Covers and their Applications
- The Case for Data Visualization Management Systems
- WideTable: An Accelerator for Analytical Data Processing
- A Framework for Protecting Worker Location Privacy in Spatial Crowdsourcing
- Front Matter
- Trekking Through Siberia: Managing Cold Data in a Memory-Optimized Database
- The Case for Personal Data-Driven Decision Making
- ConfluxDB: Multi-Master Replication for Partitioned Snapshot Isolation Databases
- Υ-DB: Managing scientific hypotheses as uncertain data
- Ibex - An Intelligent Storage Engine with Support for Advanced SQL Off-loading
- NOMAD: Nonlocking, stOchastic Multi-machine algorithm for Asynchronous and Decentralized matrix completion
- Repairing Vertex Labels under Neighborhood Constraints
- Progressive Approach to Relational Entity Resolution
- Concurrent Analytical Query Processing with GPUs
- Front Matter
- Computing Personalized PageRank Quickly by Exploiting Graph Structures
- Accordion: Elastic Scalability for Database Systems Supporting Distributed Transactions
- An Experimental Comparison of Pregel-like Graph Processing Systems
- ClusterJoin: A Similarity Joins Framework using Map-Reduce
- Crowdsourcing Algorithms for Entity Resolution
- Distributed Graph Simulation: Impossibility and Possibility
- Code Generation for Efficient Query Processing in Managed Runtimes
- Aggregate Estimation Over Dynamic Hidden Web Databases
- Adaptive Query Processing on RAW Data
- Storing and Querying Tree-Structured Records in Dremel
- Similarity Search for Scientific Workflows
- Differentially Private Event Sequences over Infinite Streams
- Matching Titles with Cross Title Web-Search Enrichment and Community Detection
- On Concise Set of Relative Candidate Keys
- Reachability Querying: An Independent Permutation Labeling Approach
- Hop Doubling Label Indexing for Point-to-Point Distance Querying on Scale-Free Networks
- Semantic Culturomics (vision paper)
- Benchmarking Scalability and Elasticity of Distributed Database Systems
- Bounded Conjunctive Queries
- Optimizing Join Enumeration in Transformation-based Query Optimizers
- A System for Management and Analysis of Preference Data
- Mesa: Geo-Replicated, Near Real-Time, Scalable Data Warehousing
- An Effective Encoding Scheme for Spatial RDF Data
- DimmWitted: A Study of Main-Memory Statistical Analytics
- SQL-on-Hadoop: Full Circle Back to Shared-Nothing Database Architectures
- Optimal Security-Aware Query Processing
- Front Matter
- MRTuner: A Toolkit to Enable Holistic Optimization for MapReduce Jobs
- Reducing Database Locking Contention Through Multi-version Concurrency
- Changing Engines in Midstream: A Java Stream Computational Model for Big Data Processing
- Joins on Encoded and Partitioned Data
- TPC-DI: The First Industry Benchmark for Data Integration
- Real-Time Twitter Recommendation: Online Motif Detection in Large Dynamic Graphs
- Interval Disaggregate: A New Operator for Business Planning
- Fuxi: a Fault-Tolerant Resource Management and Job Scheduling System at Internet Scale
- Large-Scale Graph Analytics in Aster 6: Bringing Context to Big Data Discovery
- Fast Foreign-Key Detection in Microsoft SQL Server PowerPivot for Excel
- Big Data Small Footprint: The Design of A Low-Power Classifier for Detecting Transportation Modes
- Summingbird: A Framework for Integrating Batch and Online MapReduce Computations
- Of Snowstorms and Bushy Trees
- Execution Primitives for Scalable Joins and Aggregations in Map Reduce
- CAP Limits in Telecom Subscriber Database Design
- Advanced Join Strategies for Large-Scale Distributed Computation
- DGFIndex for Smart Grid: Enhancing Hive with a Cost-Effective Multidimensional Range Index
- Error-bounded Sampling for Analytics on Big Sparse Data
- Indexing HDFS Data in PDW: Splitting the data from the index
- Chimera: Large-Scale Classification using Machine Learning, Rules, and Crowdsourcing
- Interactive Join Query Inference with JIM
- MESA: A Map Service to Support Fuzzy Type-ahead Search over Geo-Textual Data
- R3: A Real-Time Route Recommendation System
- PDQ: Proof-driven Query Answering over Web-based Data
- Data In, Fact Out: Automated Monitoring of Facts by FactWatcher
- OceanST: A Distributed Analytic System for Large-Scale Spatiotemporal Mobile Broadband Data
- That's All Folks! LLUNATIC Goes Open Source
- HDBTracker: Monitoring the Aggregates On Dynamic Hidden Web Databases
- BSMA: A Benchmark for Analytical Queries over Social Media Data
- Graph-based Data Integration and Business Intelligence with BIIIG
- SEEDB: Automatically Generating Query Visualizations
- QUEST: An Exploratory Approach to Robust Query Processing
- Redoop Infrastructure for Recurring Big Data Queries
- PackageBuilder: From Tuples to Packages
- Ontology Assisted Crowd Mining
- SOPS: A System for Efficient Processing of Spatial-Keyword Publish/Subscribe
- MLJ: Language-Independent Real-Time Search of Tweets Reported by Media Outlets and Journalists
- Ocelot/HyPE: Optimized Data Processing on Heterogeneous Hardware
- MoveMine 2.0: Mining Object Relationships from Movement Data
- A Partitioning Framework for Aggressive Data Skipping
- Interactive Outlier Exploration in Big Data Streams
- SQL/AA: Executing SQL on an Asymmetric Architecture
- gMission: A General Spatial Crowdsourcing Platform
- S-Store: A Streaming NewSQL System for Big Velocity Applications
- CLEar: A Real-time Online Observatory for Bursty and Viral Events
- AZDBLab: A Laboratory Information System for Large-Scale Empirical DBMS Studies
- Terrain-Toolkit: A Multi-Functional Tool for Terrain Data
- FORWARD: Data-Centric UIs using Declarative Templates that Efficiently Wrap Third-Party JavaScript Components
- SPIRE: Supporting Parameter-Driven Interactive Rule Mining and Exploration
- An Integrated Development Environment for Faster Feature Engineering
- Pronto: A Software-Defined Networking based System for Performance Management of Analytical Queries on Distributed Data Stores
- Getting Your Big Data Priorities Straight: A Demonstration of Priority-based QoS using Social-network-driven Stock Recommendation
- VERTEXICA: Your Relational Friend for Graph Analytics!
- NScale: Neighborhood-centric Analytics on Large Graphs
- DPSynthesizer: Differentially Private Data Synthesizer for Privacy Preserving Data Sharing
- SPOT: Locating Social Media Users Based on Social Network Context
- RASP-QS: Efficient and Confidential Query Services in the Cloud
- Thoth: Towards Managing a Multi-System Cluster
- X-LiSA: Cross-lingual Semantic Annotation
- Combining User Interaction, Speculative Query Execution and Sampling in the DICE System
- STMaker - A System to Make Sense of Trajectory Data
- Faster Visual Analytics through Pixel-Perfect Aggregation
- Systems for Big-Graphs
- Tutorial: Uncertain Entity Resolution
- Knowledge Bases in the Age of Big Data Analytics
- Causality and Explanations in Databases
- Enterprise Search in the Big Data Era: Recent Developments and Open Challenges
- VLDB 2014 Ph.D. Workshop - An Overview
- Datacenters as Computers: Google Engineering & Database Research Perspectives
- The Impact of Columnar In-Memory Databases on Enterprise Systems
- Breaking the Chains: On Declarative Data Analysis and Data Independence in the Big Data Era
- Engineering High-Performance Database Engines
- Realization of the Low Cost and High Performance MySQL Cloud Database
- Fatman: Cost-saving and reliable archival storage based on volunteer resources
- Design and Implementation of a Real-Time Interactive Analytics System for Large Spatio-Temporal Data
- A Personalized Recommendation System for NetEase Dating Site
- GEMINI: An Integrative Healthcare Analytics System
- Mariana: Tencent Deep Learning Platform and its Applications
- yzBigData: Provisioning Customizable Solution for Big Data
- Errata for "Building Efficient Query Engines in a High-Level Language" (PVLDB 7(10): 853-864)
- Front Matter
- Show Me the Money: Dynamic Recommendations for Revenue Maximization
- ScalaGiST: Scalable Generalized Search Trees for MapReduce Systems [Innovative Systems Paper]
- Finding Patterns in a Knowledge Base using Keywords to Compose Table Answers
- Pregel Algorithms for Graph Connectivity Problems with Performance Guarantees
- Auto-Approximation of Graph Computing
- DIADEM: Thousands of Websites to a Single Database
- Uncertainty Aware Query Execution Time Prediction
- Optimizing the Chase: Scalable Data Integration under Constraints
- BF-Tree: Approximate Tree Indexing
- ADDICT: Advanced Instruction Chasing for Transactions
- AsterixDB: A Scalable, Open Source BDMS
- LogGP: A Log-based Dynamic Graph Partitioning Method
- Supervised Meta-blocking
- Generating Top-k Packages via Preference Elicitation
- Fast Range Query Processing with Strong Privacy Protection for Cloud Computing
- Finish Them!: Pricing Algorithms for Human Computation
- TransactiveDB: Tapping into Collective Human Memories
- Blogel: A Block-Centric Framework for Distributed Computation on Real-World Graphs
- Efficient Identification of Implicit Facts in Incomplete OWL2-EL Knowledge Bases
- Where To: Crowd-Aided Path Selection
- Large Scale Real-time Ridesharing with Service Guarantee on Road Networks
Volume 6
https://www.vldb.org/pvldb/volumes/6/
- Front Matter
- Spatio-Textual Similarity Joins
- DisC Diversity: Result Diversification based on Dissimilarity and Coverage
- On Differentially Private Frequent Itemset Mining
- Front Matter
- Less is More: Selecting Sources Wisely for Integration
- Distributed Time-aware Provenance
- Query Processing under GLAV Mappings for Relational and Graph Databases
- Computing Immutable Regions for Subspace Top-k Queries
- Large Scale Cohesive Subgraphs Discovery for Social Network Visual Analysis
- Truth Finding on the Deep Web: Is the Problem Solved?
- Counting with the Crowd
- ClouDiA: A Deployment Advisor for Public Clouds
- An In-depth Comparison of Subgraph Isomorphism Algorithms in Graph Databases
- Lightweight Locking for Main Memory Database Systems
- Front Matter
- Lightweight Privacy-Preserving Peer-to-Peer Data Integration
- Memory Efficient Minimum Substring Partitioning
- NeMa: Fast Graph Search with Label Similarity
- PARAS: A Parameter Space Framework for Online Association Mining
- Actively Soliciting Feedback for Query Answers in Keyword Search-Based Data Integration
- Spatial Keyword Query Processing: An Experimental Evaluation
- Front Matter
- Partitioning and Ranking Tagged Data Sources
- Efficient Implementation of Generalized Quantification in Relational Query Languages
- DAX: A Widely Distributed Multi-tenant Storage Service for DBMS Hosting
- A Distributed Graph Engine for Web Scale RDF Data
- Upper and Lower Bounds on the Cost of a Map-Reduce Computation
- Front Matter
- Processing Analytical Queries over Encrypted Data
- Practical Differential Privacy via Grouping and Smoothing
- On Scaling Up Sensitive Data Auditing
- XORing Elephants: Novel Erasure Codes for Big Data
- Scaling Factorization Machines to Relational Data
- Front Matter
- Question Selection for Crowd Entity Resolution
- A Comparison of Knives for Bread Slicing
- Efficient Error-tolerant Query Autocompletion
- Top-k Publish-Subscribe for Social Annotation of News
- Efficient Querying of Inconsistent Databases with Binary Integer Programming
- Piggybacking on Social Networks
- Schema Extraction for Tabular Data on the Web
- Streaming Algorithms for k-core Decomposition
- Discovering Linkage Points over Web Data
- IS-LABEL: an Independent-Set based Labeling Scheme for Point-to-Point Distance Querying
- Supporting User-Defined Functions on Uncertain Data
- Incremental and Accuracy-Aware Personalized PageRank through Scheduled Approximation
- Front Matter
- Efficient SimRank-based Similarity Join Over Large Graphs
- A Performance Study of Three Disk-based Structures for Indexing and Querying Frequent Itemsets
- TripleBit: a Fast and Compact System for Large Scale RDF Data
- CorrectDB: SQL Engine with Practical Query Authentication
- Front Matter
- Hybrid Storage Management for Database Systems
- Scorpion: Explaining Away Outliers in Aggregate Queries
- Ratio Threshold Queries over Distributed Data Sources
- On the Complexity of Query Result Diversification
- Streaming Quotient Filter: A Near Optimal Approximate Duplicate Detection Approach for Data Streams
- Front Matter
- On Repairing Structural Problems In Semi-structured Data
- A Distributed Algorithm for Large-Scale Generalized Matching
- The LLUNATIC Data-Cleaning Framework
- Sharing Data and Work Across Concurrent Analytical Queries
- Skyline Operator on Anti-correlated Distributions
- Low-Latency Multi-Datacenter Databases using Replicated Commit
- Distribution-Based Query Scheduling
- Making Queries Tractable on Big Data with Preprocessing
- Answering Planning Queries with the Crowd
- Hardware-Oblivious Parallelism for In-Memory Column-Stores
- Permuting Data on Random-Access Block Storage
- Improving Flash Write Performance by Using Update Frequency
- Efficient Indexing for Diverse Query Results
- Reducing Uncertainty of Schema Matching via Crowdsourcing
- Travel Cost Inference from Sparse, Spatio-Temporally Correlated Time Series Using Markov Models
- Front Matter
- Query Optimization over Crowdsourced Data
- A Data-adaptive and Dynamic Segmentation Index for Whole Matching on Time Series
- Extraction and Integration of Partially Overlapping Web Sources
- The Yin and Yang of Processing Data Warehousing Queries on GPU Devices
- Mining and Indexing Graphs for Supergraph Search
- Efficient Recovery of Missing Events
- Hadoop's Adolescence
- RACE: A Scalable and Elastic Parallel System for Discovering Repeats in Very Long Sequences
- LLAMA: A Cache/Storage Subsystem for Modern Hardware
- Revisiting Co-Processing for Hash Joins on the Coupled CPU-GPU Architecture
- Top-K Nearest Keyword Search on Large Graphs
- A General Framework for Geo-Social Query Processing
- Towards Predicting Query Execution Time for Concurrent and Dynamic Database Workloads
- Sketch-based Geometric Monitoring of Distributed Stream Queries
- Direction-Preserving Trajectory Simplification
- Front Matter
- Continuous Cloud-Scale Query Optimization and Processing
- Optimization Strategies for A/B Testing on HADOOP
- Piranha: Optimizing Short Jobs in Hadoop
- Making Updates Disk-I/O Friendly Using SSDs
- Hadoop-GIS: A High Performance Spatial Data Warehousing System over MapReduce
- Statistics Collection in Oracle Spatial and Graph: Fast Histogram Construction for Complex Geometry Objects
- MillWheel: Fault-Tolerant Stream Processing at Internet Scale
- Online, Asynchronous Schema Change in F1
- Scuba: Diving into Data at Facebook
- F1: A Distributed SQL Database That Scales
- DB2 with BLU Acceleration: So Much More than Just a Column Store
- A The Quantcast File System
- Adaptive and Big Data Scale Parallel Execution in Oracle
- WOO: A Scalable and Multi-tenant Platform for Continuous Knowledge Base Synthesis
- Entity Extraction, Linking, Classification, and Tagging for Social Media: A Wikipedia-Based Approach
- Overview of Turn Data Management Platform for Digital Advertising
- Unicorn: A System for Searching the Social Graph
- A New Service for Customer Care Based on the TrentoRise BigData Platform
- Exploiting the Diversity, Mass and Speed of Territorial Data by TELCO Operator for Better User Services
- The Trento Big Data Platform for Public Administration and Large Companies: Use cases and Opportunities
- Designing Query Optimizers for Big Data Problems of The Future
- How to maximize the value of big data with the open source SpagoBI suite through a comprehensive approach
- Context-Aware Computing: Opportunities and Open Issues
- Next Generation Data Analytics at IBM Research
- Learning and Intelligent Optimization (LION): One Ring to Rule Them All
- Microsoft SQL Server's Integrated Database Approach for Modern Applications and Hardware
- Odyssey: A Multi-Store System for Evolutionary Analytics
- A global Entity Name System (ENS) for data ecosystems
- SAP HANA: The Evolution from a Modern Main-Memory Data Platform to an Enterprise Application Platform
- Keeping the TPC Relevant!
- Big Data Integration
- Just-in-time compilation for SQL query processing
- Toward Scalable Transaction Processing
- Towards Database Virtualization for Database as a Service
- Mobility and Social Networking: A Data Management Perspective
- Front Matter
- DesTeller: A System for Destination Prediction Based on Trajectories with Privacy Protection
- Senbazuru: A Prototype Spreadsheet Database Management System
- ReqFlex: Fuzzy Queries for Everyone
- Comprehensive and Interactive Temporal Query Processing with SAP HANA
- Functions Are Data Too (Defunctionalization for PL/SQL)
- NADEEF: A Generalized Data Cleaning System
- QUEST: A Keyword Search System for Relational Data based on Semantic and Machine Learning Techniques
- GroupFinder: A New Approach to Top-K Point-of-Interest Group Retrieval
- A Demonstration of SpatialHadoop: An Efficient MapReduce Framework for Spatial Data
- Aggregate Profile Clustering for Telco Analytics
- ROSeAnn: Reconciling Opinions of Semantic Annotators
- A RecDB in Action: Recommendation Made Easy in Relational Databases
- POIKILO: A Tool for Evaluating the Results of Diversification Models and Algorithms
- CrowdMiner: Mining association rules from the crowd
- TeRec: A Temporal Recommender System Over Tweet Stream
- Graph Queries in a Next-Generation Datalog System
- iRoad: A Framework For Scalable Predictive Query Processing On Road Networks
- SkySuite: A Framework of Skyline-Join Operators for Static and Stream Environments
- Parallel Graph Processing on Graphics Processors Made Easy
- Mosquito: Another One Bites the Data Upload STream
- NoFTL: Database Systems on FTL-less Flash Storage
- SmartMonitor: Using Smart Devices to Perform Structural Health Monitoring
- Lazy ETL in Action: ETL Technology Dates Scientific Data
- EagleTree: Exploring the Design Space of SSD-Based Algorithms
- EnviroMeter: A Platform for Querying Community-Sensed Data
- Scolopax: Exploratory Analysis of Scientific Data
- PROPOLIS: Provisioned Analysis of Data-Centric Processes
- Feature Selection in Enterprise Analytics: A Demonstration using an R-based Data Analytics System
- Flexible Query Processor on FPGAs
- MASTRO STUDIO: Managing Ontology-Based Data Access applications
- PLASMA-HD: Probing the LAttice Structure and MAkeup of High-dimensional Data
- A Demonstration of Iterative Parallel Array Processing in Support of Telescope Image Analysis
- EvenTweet: Online Localized Event Detection from Twitter
- IBminer: A Text Mining Tool for Constructing and Populating InfoBox Databases and Knowledge Bases
- PAQO: A Preference-Aware Query Optimizer for PostgreSQL
- eSkyline: Processing Skyline Queries over Encrypted Data
- GestureQuery: A Multitouch Database Query Interface
- Mining and Linking Patterns across Live Data Streams and Stream Archives
- PhotoStand: A Map Query Interface for a Database of News Photos
- Hone: "Scaling Down" Hadoop on Shared-Memory Systems
- Ringtail: A Generalized Nowcasting System
- IPS: An Interactive Package Configuration System for Trip Planning
- R2-D2: a System to Support Probabilistic Path Prediction in Dynamic Environments via "Semi-Lazy" Learning
- REEF: Retainable Evaluator Execution Framework
- OmniDB: Towards Portable and Efficient Query Processing on Parallel CPU/GPU Architectures
- Complete Approximations of Incomplete Queries
- User Analytics with UbeOne: Insights into Web Printing
- DiAl: Distributed Streaming Analytics Anywhere, Anytime
- Big and Useful: What's in the Data for Me?
- Universal Indexing of Arbitrary Similarity Models
- Why it is time for a HyPE: A Hybrid Query Processing Engine for Efficient GPU Coprocessing in DBMS
- Database Support for Unstructured Meshes
- Domain Specific Multi-stage Query Language for Medical Document Repositories
- Realtime Analysis of Information Diffusion in Social Media
- Mining Frequent Patterns with Differential Privacy
- Automatic ontology-based User Profile Learning from heterogeneous Web Resources in a Big Data Context
- Scalable Transactions across Heterogeneous NoSQL Key-Value Data Stores
- Getting Unique Solution in Data Exchange
- Storing and Processing Temporal Data in a Main Memory Column Store
- Efficiency and Security in Similarity Cloud Services
- Fast Cartography for Data Explorers
- Front Matter
- When Speed Has a Price: Fast Information Extraction Using Approximate Algorithms
- Design and Evaluation of Storage Organizations for Read-Optimized Main Memory Databases
- Aggregating Semantic Annotators
- Discovering Denial Constraints
- Diversified Top-k Graph Pattern Matching
- Bitlist: New Full-text Index for Low Space Cost and Efficient Keyword Search
- RCSI: Scalable similarity search in thousand(s) of genomes
- Approximate MaxRS in Spatial Databases
- Multi-Tuple Deletion Propagation: Approximations and Complexity
- Supporting Distributed Feed-Following Apps over Edge Devices
- Rank Discovery From Web Databases
- SPARSI: Partitioning Sensitive Data amongst Multiple Adversaries
- Scalable Column Concept Determination for Web Tables Using Large Knowledge Bases
- Top-K Structural Diversity Search in Large Networks
- Synthetising Changes in XML Documents as PULs
- Front Matter
- Probabilistic Query Rewriting for Efficient and Effective Keyword Search on Graph Data
- QuEval: Beyond high-dimensional indexing a la carte
- Discovering Longest-lasting Correlation in Sequence Databases
- PREDIcT: Towards Predicting the Runtime of Large Scale Iterative Analytics
- On the Embeddability of Random Walk Distances
- Instant Loading for Main Memory Databases
- Adaptive Range Filters for Cold Data: Avoiding Trips to Siberia
- Scalable Progressive Analytics on Big Data in the Cloud
- Scalable XML Query Processing using Parallel Pushdown Transducers
- Understanding Insights into the Basic Structure and Essential Issues of Table Placement Methods in Clusters
- A Probabilistic Optimization Framework for the Empty-Answer Problem
- Summarizing Answer Graphs Induced by Keyword Queries
- Supporting Keyword Search in Product Database: A Probabilistic Approach
- A Sampling Algebra for Aggregate Estimation
- A Temporal-Probabilistic Database Model for Information Extraction
- Counter Strike: Generic Top-Down Join Enumeration for Hypergraphs
- Efficient Bulk Updates on Multiversion B-trees
- Query-Driven Approach to Entity Resolution
- Expressiveness and Complexity of Order Dependencies
- Counting and Sampling Triangles from a Graph Stream
- An Experimental Analysis of Iterated Spatial Joins in Main Memory
- Scaling Queries over Big RDF Graphs with Semantic Hash Partitioning
- Distributed SociaLite: A Datalog-Based Language for Large-Scale Graph Analysis
- Horton+: A Distributed System for Processing Declarative Reachability Queries over Partitioned Graphs
- Streaming Similarity Search over one Billion Tweets using Parallel Locality-Sensitive Hashing
- Anti-Caching: A New Approach to Database Management System Architecture
- Understanding Hierarchical Methods for Differentially Private Histograms
- Towards Social Data Platform: Automatic Topic-focused Monitor for Twitter Stream
- Simple, Fast, and Scalable Reachability Oracle
- Aggregation and Ordering in Factorised Databases
- Parallel Computation of Skyline and Reverse Skyline Queries Using MapReduce
- Fast Iterative Graph Computation with Block Updates
Volume 5
https://www.vldb.org/pvldb/volumes/5/
- Front Matter
- Explanation-Based Auditing
- Human-powered Sorts and Joins
- Verifying Computations with Streaming Interactive Proofs
- A Moving-Object Index for Efficient Query Processing with Peer-Wise Location Privacy
- ERA: Efficient Serial and Parallel Suffix Tree Construction for Very Long Strings
- Fast Updates on Read-Optimized Databases Using Multi-Core CPUs
- A Data-Based Approach to Social Influence Maximization
- Front Matter
- On Predictive Modeling for Optimizing Transaction Execution in Parallel OLTP Systems
- View Selection in Semantic Web Databases
- Building Wavelet Histograms on Large Data in MapReduce
- Summarization and Matching of Density-Based Clusters in Streaming Environments
- Multilingual Schema Matching for Wikipedia Infoboxes
- Controlling False Positives in Association Rule Mining
- Front Matter and Letter from the Associate Editor
- PARIS: Probabilistic Alignment of Relations, Instances, and Schema
- Answering Top-k Queries Over a Mixture of Attractive and Repulsive Dimensions
- PIQL: Success-Tolerant Query Processing in the Cloud
- gSketch: On Query Estimation in Graph Streams
- Indexing the Earth Mover's Distance Using Normal Distributions
- Generating Exact- and Ranked Partially-Matched Answers to Questions in Advertisements
- Size-l Object Summaries for Relational Keyword Search
- REX: Explaining Relationships between Entity Pairs
- PASS-JOIN: A Partition-based Method for Similarity Joins
- Relative Lempel-Ziv Factorization for Efficient Storage and Retrieval of Web Collections
- Front Matter and Letter from the Associate Editor
- Towards Cost-Effective Storage Provisioning for DBMSs
- B+-tree Index Optimization by Exploiting Internal Parallelism of Flash-based Solid State Drives
- High-Performance Concurrency Control Mechanisms for Main-Memory Databases
- Capturing Topology in Graph Pattern Matching
- Probabilistic Management of OCR Data using an RDBMS
- RTED: A Robust Algorithm for the Tree Edit Distance
- Putting Lipstick on Pig: Enabling Database-style Workflow Provenance
- Relational Approach for Shortest Path Discovery over Large Graphs
- Mining Flipping Correlations from Large Datasets with Taxonomies
- A Statistical Approach Towards Robust Progress Estimation
- Front Matter and Letter from the Associate Editor
- Relation Strength-Aware Clustering of Heterogeneous Information Networks with Incomplete Attributes
- Shortest Path and Distance Queries on Road Networks: An Experimental Evaluation
- The Filter-Placement Problem and its Application to Minimizing Information Multiplicity
- Bayesian Locality Sensitive Hashing for Fast Similarity Search
- Fast and Exact Top-k Search for Random Walk with Restart
- Densest Subgraph in Streaming and MapReduce
- Mining Attribute-structure Correlated Patterns in Large Attributed Graphs
- Semi-Automatic Index Tuning: Keeping DBAs in the Loop
- Aggregation in Probabilistic Databases via Knowledge Compilation
- Front Matter and Letter from the Associate Editor
- Stochastic Database Cracking: Towards Robust Adaptive Indexing in Main-Memory Column-Stores
- An Adaptive Mechanism for Accurate Query Answering under Differential Privacy
- SharedDB: Killing One Thousand Queries With One Stone
- Pushing the Boundaries of Crowd-enabled Databases with Query-driven Schema Expansion
- A Bayesian Approach to Discovering Truth from Conflicting Sources for Data Integration
- How to Price Shared Optimizations in the Cloud
- Dense Subgraph Maintenance under Streaming Edge Weight Updates for Real-time Story Identification
- ReStore: Reusing Results of MapReduce Jobs
- Front Matter and Letter from the Associate Editors
- PerfXplain: Debugging MapReduce Job Performance
- Uncertain Centroid based Partitional Clustering of Uncertain Data
- Scalable K-Means++
- Querying Schemas With Access Restrictions
- Definition, Detection, and Recovery of Single-Page Failures, a Fourth Class of Database Failures
- Concurrency Control for Adaptive Indexing
- Comments on "Stack-based Algorithms for Pattern Matching on DAGs"
- An Analysis of Structured Data on the Web
- Front Matter and Letter from the Associate Editors
- Shortest Path Computation with No Information Leakage
- V-SMART-Join: A Scalable MapReduce Framework for All-Pair Similarity Joins of Multisets and Vectors
- Distributed GraphLab: A Framework for Machine Learning in the Cloud
- Adding Logical Operators to Tree Pattern Queries on Graph-Structured Data
- Learning Semantic String Transformations from Examples
- Cologne: A Declarative Distributed Constraint Optimization Platform
- Optimizing I/O for Big Array Analytics
- Probabilistically Bounded Staleness for Practical Partial Quorums
- Front Matter and Letter from the Associate Editors
- Efficient Subgraph Matching on Billion Node Graphs
- Efficient Subgraph Similarity Search on Large Probabilistic Graph Databases
- Truss Decomposition in Massive Networks
- SEAL: Spatio-Textual Similarity Search
- On The Spatiotemporal Burstiness of Terms
- Efficient Reachability Query Evaluation in Large Spatiotemporal Contact Datasets
- Boosting Moving Object Indexing through Velocity Partitioning
- Type-Based Detection of XML Query-Update Independence
- Minuet: A Scalable Distributed Multiversion B-Tree
- Challenging the Long Tail Recommendation
- Front Matter and Letter from the Associate Editors
- Answering Table Queries on the Web using Column Keywords
- Efficient Verification of Web-Content Searching Through Authenticated Web Crawlers
- SODA: Generating SQL for Business Users
- Privacy Preservation by Disassociation
- Supercharging Recommender Systems using Taxonomies for Learning User Purchase Behavior
- DBToaster: Higher-order Delta Processing for Dynamic, Frequently Fresh Views
- Real Time Discovery of Dense Clusters in Highly Dynamic Graphs: Identifying Real World Events in Highly Dynamic Environments
- Sketch-based Querying of Distributed Sliding-Window Data Streams
- LogBase: A Scalable Log-structured Database System in the Cloud
- Efficient Processing of k Nearest Neighbor Joins using MapReduce
- Early Accurate Results for Advanced Analytics on MapReduce
- CDAS: A Crowdsourcing Data Analytics System
- Mining Statistically Significant Substrings using the Chi-Square Statistic
- Massively Parallel Sort-Merge Joins in Main Memory Multi-Core Database Systems
- hStorage-DB: Heterogeneity-aware Data Management to Exploit the Full Capability of Hybrid Storage Systems
- Front Matter
- Letter from the Editor-in-Chief
- A Scalable Algorithm for Maximizing Range Sum in Spatial Databases
- Spatial Queries with Two kNN Predicates
- Optimal Algorithms for Crawling a Hidden Database in the Web
- Diversifying Top-K Results
- Keyword-aware Optimal Route Search
- Answering Queries using Views over Probabilistic XML: Complexity and Tractability
- Probabilistic Databases with MarkoViews
- The Complexity of Social Coordination
- Efficient Multi-way Theta-Join Processing Using MapReduce
- Stubby: A Transformation-based Optimizer for MapReduce Workflows
- Labeling Workflow Views with Fine-Grained Dependencies
- Fundamentals of Order Dependencies
- FDB: A Query Engine for Factorised Relational Databases
- Optimization of Analytic Window Functions
- Opening the Black Boxes in Data Flow Optimization
- Spinning Fast Iterative Data Flows
- REX: Recursive, Delta-Based Data-Centric Computation
- K-Reach: Who is in Your Small World
- Performance Guarantees for Distributed Reachability Queries
- Efficient Indexing and Querying over Syntactically Annotated Trees
- Queries with Guarded Negation
- PrivBasis: Frequent Itemset Mining with Differential Privacy
- Low-Rank Mechanism: Optimizing Batch Queries under Differential Privacy
- Functional Mechanism: Regression Analysis under Differential Privacy
- Injecting Uncertainty in Graphs for Identity Obfuscation
- Publishing Microdata with a Robust Privacy Guarantee
- Measuring Two-Event Structural Correlations on Graphs
- Ranking Large Temporal Data
- Compacting Transactional Data in Hybrid OLTP & OLAP Databases
- Processing a Trillion Cells per Mouse Click
- OLTP on Hardware Islands
- Serializability, not Serial: Concurrency Control and Availability in Multi-Datacenter Datastores
- Automatic Partitioning of Database Applications
- CrowdER: Crowdsourcing Entity Resolution
- Whom to Ask? Jury Selection for Decision Making Tasks on Micro-blog Services
- ALAE: Accelerating Local Alignment with Affine Gap Exactly in Biosequence Databases
- sDTW: Computing DTW Distances using Locally Relevant Constraints based on Salient Feature Alignments
- SCOUT: Prefetching for Latent Feature Following Queries
- Accelerating Pathology Image Data Cross-Comparison on CPU-GPU Hybrid Systems
- Robust Estimation of Resource Consumption for SQL Queries using Statistical Techniques
- Who Tags What? An Analysis Framework
- A Generic Framework for Efficient and Effective Subsequence Retrieval
- Only Aggressive Elephants are Fast Elephants
- Multiple Location Profiling for Users and Relationships from Social Network and Content
- Flash-based Extended Cache for Higher Throughput and Faster Recovery
- Don't Thrash: How to Cache Your Hash on Flash
- Learning Expressive Linkage Rules using Genetic Programming
- Mining Frequent Itemsets over Uncertain Databases
- Uncertain Time-Series Similarity: Return to the Basics
- Statistical Distortion: Consequences of Data Cleaning
- Towards Energy-Efficient Database Cluster Design
- Front Matter
- Welcome Message from the VLDB 2012 General Chairs
- Message from the VLDB 2012 General Program Chair
- Data Management on the Spatial Web
- Data Analytics Opportunities in a Smarter Planet
- Challenges in Economic Massive Content Storage and Management (MCSAM) in the Era of Self-Organizing, Self-Expanding and Self-Linking Data Clusters
- Approximate Frequency Counts over Data Streams
- The MADlib Analytics Library or MAD Skills, the SQL
- Can the Elephants Handle the NoSQL Onslaught?
- Solving Big Data Challenges for Enterprise Application Performance Management
- M3R: Increased performance for in-memory Hadoop jobs
- A Storage Advisor for Hybrid-Store Databases
- From Cooperative Scans to Predictive Buffer Management
- The Unified Logging Infrastructure for Data Analytics at Twitter
- Transaction Log Based Application Error Recovery and Point In-Time Query
- The Vertica Analytic Database: C-Store 7 Years Later
- Interactive Analytical Processing in Big Data Systems: A Cross-Industry Study of MapReduce Workloads
- Muppet: MapReduce-Style Processing of Fast Data
- Building User-defined Runtime Adaptation Routines for Stream Processing Applications
- MOIST: A Scalable and Parallel Moving Object Indexer with School Tracking
- Serializable Snapshot Isolation in PostgreSQL
- Exploiting Evidence from Unstructured Data to Enhance Master Data Management
- Avatara: OLAP for Web-scale Analytics Products
- Dedoop: Efficient Deduplication with Hadoop
- MapReduce-based Dimensional ETL Made Easy
- CloudVista: Interactive and Economical Visual Cluster Analysis for Big Data in the Cloud
- Myriad: Scalable and Expressive Data Generation
- A Demonstration of DBWipes: Clean as You Query
- ASTERIX: An Open Source System for "Big Data" Management and Analysis
- Blink and It's Done: Interactive Queries on Very Large Data
- Massive Genomic Data Processing and Deep Analysis
- MonetDB/DataCell: Online Analytics in a Streaming Column-Store
- SWORS: A System for the Efficient Retrieval of Relevant Spatial Web Objects
- CyLog/Crowd4U: A Declarative Platform for Complex Data-centric Crowdsourcing
- Exploiting Database Similarity Joins for Metric Spaces
- Stethoscope: A platform for interactive visual analysis of query execution plans
- Hum-a-song: A Subsequence Matching with Gaps-Range-Tolerances Query-By-Humming System
- SkewTune in Action: Mitigating Skew in MapReduce Applications
- Playful Query Specification with DataPlay
- NoDB in Action: Adaptive Query Processing on Raw Data
- Complex Preference Queries Supporting Spatial Applications for User Groups
- Demonstration of the FDB Query Engine for Factorised Databases
- PET: Reducing Database Energy Cost via Query Optimization
- SPAM: A SPARQL Analysis and Manipulation Tool
- QueryMarket Demonstration: Pricing for Online Data Markets
- DISKs: A System for Distributed Spatial Group Keyword Search on Road Networks
- WETSUIT: An Efficient Mashup Tool for Searching and Fusing Web Entities
- Model-based Integration of Past & Future in TimeTravel
- DrillBeyond: Enabling Business Analysts to Explore the Web of Open Data
- Discovering and Exploring Relations on the Web
- MapRat: Meaningful Explanation, Interactive Exploration and Geo-Visualization of Collaborative Ratings
- Deco: A System for Declarative Crowdsourcing
- Developing and Analyzing XSDs through BonXai
- InfoPuzzle: Exploring Group Decision Making in Mobile Peer-to-Peer Databases
- Manage and Query Generic Moving Objects in SECONDO
- Chronos: Facilitating History Discovery by Linking Temporal Records
- TELEIOS: A Database-Powered Virtual Earth Observatory
- Efficient Big Data Processing in Hadoop MapReduce
- MapReduce Algorithms for Big Data Analysis
- Entity Resolution: Theory, Practice & Open Challenges
- I/O Characteristics of NoSQL Databases
- Mining Knowledge from Interconnected Data: A Heterogeneous Information Network Analysis Approach
- Understanding and Managing Cascades on Large Graphs
- Interoperability in eHealth Systems (Invited Tutorial)
- Secure and Privacy-Preserving Data Services in the Cloud: A Data Centric View
- Graph Synopses, Sketches, and Streams: A Survey
- Challenges and Opportunities with Big Data
- Social Networks and Mobility in the Cloud
Volume 4
https://www.vldb.org/pvldb/volumes/4/
- Letter from the Editor-in-Chief
- Generating Efficient Execution Plans for Vertically Partitioned XML Databases
- A Generic Framework for Handling Uncertain Data with Local Correlations
- SnipSuggest: Context-Aware Autocompletion for SQL
- The Complexity of Causality and Responsibility for Query Answers and non-Answers
- Letter from the General PC Co-Chair
- Distributed Threshold Querying of General Functions by a Difference of Monotonic Representation
- On Triangulation-based Dense Neighborhood Graphs Discovery
- Graph Indexing of Road Networks for Shortest Path Queries with Label Restrictions
- CRIUS: User-Friendly Database Design
- Efficient Processing of Top-k Spatial Preference Queries
- HYRISE - A Main Memory Hybrid Storage Engine
- Update Rewriting and Integrity Constraint Maintenance in a Schema Evolution Support System: PRISM++
- SXPath - Extending XPath towards Spatial Querying on Web Documents
- Personalized Privacy Protection in Social Networks
- Letter from the VLDB2011 General PC Co-Chair
- A Probabilistic Approach for Automatically Filling Form-Based Web Interfaces
- Output URL Bidding
- Fast Incremental and Personalized PageRank
- QSkycube: Efficient Skycube Computation using Point-Based Space Partitioning
- ZINC: Efficient Indexing for Skyline Computation
- Letter from the Research Track Co-Chair
- Large-Scale Collective Entity Matching
- Automatic Wrappers for Large Scale Web Extraction
- Fast Sparse Matrix-Vector Multiplication on GPUs: Implications for Graph Mining
- Using Paxos to Build a Scalable, Consistent, and Highly Available Datastore
- Fast Set Intersection in Memory
- Letter from the VLDB Proceedings Chair
- Human-assisted graph search: it's okay to ask questions
- Guided data repair
- Hyper-local, directions-based ranking of places
- Incrementally maintaining classification using an RDBMS
- High-throughput transaction executions on graphics processors
- Distributed inference and query processing for RFID tracking and monitoring
- Letter from the Research Track Co-Chair
- Similarity Join Size Estimation using Locality Sensitive Hashing
- Query Expansion Based on Clustered Results
- CoPhy: A Scalable, Portable, and Interactive Index Advisor for Large Workloads
- Tuffy: Scaling up Statistical Inference in Markov Logic Networks using an RDBMS
- Automatic Optimization for MapReduce Programs
- On Social-Temporal Group Query with Acquaintance Constraint
- Letter from the VLDB Proceedings Chair
- Synthesizing Products for Online Catalogs
- Column-Oriented Storage Techniques for MapReduce
- Implementing Performance Competitive Logical Recovery
- Personalized Social Recommendations - Accurate or Private?
- Efficient Diversification of Web Search Results
- Social Content Matching in MapReduce
- Front Matter
- Efficient Parallel Lists Intersection and Index Compression Algorithms using Graphics Processing Units
- gStore: Answering SPARQL Queries via Subgraph Matching
- Albatross: Lightweight Elasticity in Shared Storage Databases for the Cloud using Live Data Migration
- An Incremental Hausdorff Distance Calculation Algorithm
- Surrogate Parenthood: Protected and Informative Graphs
- Front Matter
- Recovering Semantics of Tables on the Web
- Efficiently Compiling Efficient Query Plans for Modern Hardware
- Distance-Constraint Reachability Computation in Uncertain Graphs
- iCBS: Incremental Cost-based Scheduling under Piecewise Linear SLAs
- CoHadoop: Flexible Data Placement and Its Exploitation in Hadoop
- Merging What’s Cracked, Cracking What’s Merged: Adaptive Indexing in Main-Memory Column-Stores
- Front Matter
- On Pruning for Top-K Ranking in Uncertain Databases
- PLP: Page Latch-free Shared-everything OLTP
- Entity Matching: How Similar Is Similar
- Active Complex Event Processing over Event Streams
- Structural Trend Analysis for Online Social Networks
- Compression Aware Physical Database Design
- Efficient Probabilistic Reverse Nearest Neighbor Query Processing on Uncertain Data
- Keyword Search in Graphs: Finding r-cliques
- Front Matter
- Towards a Global Brain
- Is It Still "Big Data" If It Fits In My Pocket?
- Generic Schema Matching, Ten Years Later
- A Framework for Supporting DBMS-like Indexes in the Cloud
- On Link-based Similarity Join
- On Querying Historical Evolving Graph Sequences
- RemusDB: Transparent High Availability for Database Systems
- Completeness of Queries over Incomplete Databases
- A Subsequence Matching with Gaps-Range-Tolerances Framework: A Query-By-Humming Application
- Approximate Substring Matching over Uncertain Strings
- Serializable Snapshot Isolation for Replicated Databases in High-Update Scenarios
- PALM: Parallel Architecture-Friendly Latch-Free Modifications to B+ Trees on Many-Core Processors
- Mining Top-K Large Structural Patterns in a Massive Network
- Structure-Aware Sampling: Flexible and Accurate Summarization
- Data Coordination: Supporting Contingent Updates
- Accelerating Queries with Group-By and Join by Groupjoin
- Lightweight Graphical Models for Selectivity Estimation Without Independence Assumptions
- Dissemination of Models over Time-Varying Data
- Efficient Subgraph Search over Large Uncertain Graphs
- Entangled Transactions
- Summary Graphs for Relational Database Schemas
- RecBench: Benchmarks for Evaluating Performance of Recommender System Architectures
- Business Policy Modeling and Enforcement in Databases
- Online Data Fusion
- Optimistic Concurrency Control by Melding Trees
- Linking Temporal Records
- Efficient Algorithms for Finding Optimal Meeting Point on Road Networks
- Optimal Schemes for Robust Web Extraction
- PathSim: Meta Path-Based Top-K Similarity Search in Heterogeneous Information Networks
- Optimizing Query Answering under Ontological Constraints
- OXPath: A Language for Scalable, Memory-efficient Data Extraction from Web Applications
- Optimizing and Parallelizing Ranked Enumeration
- Where in the World is My Data?
- Queries with Difference on Probabilistic Databases
- MRI: Meaningful Interpretations of Collaborative Ratings
- Storing Matrices on Disk: Theory and Practice Revisited
- Publishing Set-Valued Data via Differential Privacy
- Randomized Generalization for Aggregate Suppression Over Hidden Web Databases
- Profiling, What-if Analysis, and Cost-based Optimization of MapReduce Programs
- Scalable SPARQL Querying of Large RDF Graphs
- Online Aggregation for Large MapReduce Jobs
- Private Analysis of Graph Structure
- Stratification Criteria and Rewriting Techniques for Checking Chase Termination
- Optimizing Probabilistic Query Processing on Continuous Uncertain Data
- Massive Scale-out of Expensive Continuous Queries
- Keyword Search on Form Results
- Efficient Rank Join with Aggregation Constraints
- Front Matter
- Evaluation Strategies for Top-k Queries over Memory-Resident Inverted Indexes
- Consistent Synchronization Schemes for Workload Replay
- Inspector Gadget: A Framework for Custom Monitoring and Debugging of Distributed Dataflows
- Online Expansion of Largescale Data Warehouses
- HIWAS: Enabling Technology for Analysis of Clinical Data in XML Documents
- Jaql: A Scripting Language for Large Scale Semistructured Data Analysis
- Jaql: A Scripting Language for Large Scale Semistructured Data Analysis
- Auto-Grouping Emails For Faster E-Discovery
- Web Scale Taxonomy Cleansing
- Bridging Two Worlds with RICE Integrating R into the SAP In-Memory Computing Engine
- Tenzing A SQL Implementation On The MapReduce Framework
- An Algebraic Approach for Data-Centric Scientific Workflows
- Citrusleaf: A Real-Time NoSQL DB which Preserves ACID
- RAMP: A System for Capturing and Tracing Provenance in MapReduce Workflows
- BROAD: Diversified Keyword Search in Databases
- TrustedDB: A Trusted Hardware based Outsourced Database Engine
- IPL-P: In-Page Logging with PCRAM
- HyPer-sonic Combined Transaction AND Query Processing
- GrouPeer: A System for Clustering PDMSs
- CerFix: A System for Cleaning Data with Certain Fixes
- Online Visualization of Geospatial Stream Data using the WorldWide Telescope
- Debugging Data Exchange with Vagabond
- CrowdDB: Query Processing with the VLDB Crowd
- Analytics for the RealTime Web
- DivDB: A System for Diversifying Query Results
- HOMES: A Higher-Order Mapping Evaluation System
- Proactive Detection and Repair of Data Corruption: Towards a Hassle-free Declarative Approach with Amulet
- Automatic Workload Driven Index Defragmentation
- Whodunit: An Auditing Tool for Detecting Data Breaches
- EIRENE: Interactive Design and Refinement of Schema Mappings via Data Examples
- DataSynth: Generating Synthetic Data using Declarative Constraints
- InfoNetOLAPer: Integrating InfoNetWarehouse and InfoNetCube with InfoNetOLAP
- From SPARQL to MapReduce: The Journey Using a Nested TripleGroup Algebra
- FuDoCS: A Web Service Composition System Based on Fuzzy Dominance for Preference Query Answering
- A Demonstration of HYRISE—A Main Memory Hybrid Storage Engine
- #NAME?
- UpStream: A Storage-centric Load Management System for Real-time Update Streams
- MapReduce Programming and Cost-based Optimization? Crossing this Chasm with Starfish
- AIDA: An Online Tool for Accurate Disambiguation of Named Entities in Text and Tables
- Microsoft Codename "Montego" – Data Import, Transformation, and Publication for Information Workers
- SocialSpamGuard: A Data Mining-Based Spam Detection System for Social Media Networks
- Resiliency-Aware Data Management
- Guided Interaction: Rethinking the Query-Result Paradigm
- Data Generation for Application-Specific Benchmarking
- The Researcher’s Guide to the Data Deluge: Querying a Scientific Database in Just a Few Seconds
- Anthropocentric Data Systems
- Data Markets in the Cloud: An Opportunity for the Database Community
- Data is Dead... Without What-If Models
- Reverse Data Management
- Exploring the Coming Repositories of Reproducible Experiments: Challenges and Opportunities
- Databases will Visualize Queries too
- New Frontiers in Business Intelligence
- System Co-Design and Data Management for Flash Devices
- Exploration of Deep Web Repositories
- Crowdsourcing Applications and Platforms: A Data Management Perspective
- Graph Data Management Systems for New Application Domains
- Information Diffusion In Social Networks: Observing and Influencing Societal Interests
- Data Management for Meeting Global Health Challenges
- Panel Discussion: Maximizing Impact
Volume 3
https://www.vldb.org/pvldb/volumes/3/
- Enabling Real Time Data Analysis
- High-End Biological Imaging Generates Very Large 3D+ and Dynamic Datasets
- Dealing with Web Data: History and Look ahead
- Database Replication: a Tale of Research across Communities
- Building Disclosure Risk Aware Query Optimizers for Relational Databases
- Secure Personal Data Servers: a Vision Paper
- PolicyReplay: Misconfiguration-Response Queries for Data Breach Reporting
- Schism: a Workload-Driven Approach to Database Replication and Partitioning
- Ten Thousand SQLs: Parallel Keyword Queries Computing
- The Case for Determinism in Database Systems
- MapMerge: Correlating Independent Schema Mappings
- Chase Termination: A Constraints Rewriting Approach
- Scalable Data Exchange with Functional Dependencies
- Interactive Route Search in the Presence of Order Constraints
- Energy Management for MapReduce Clusters
- Toward Scalable Keyword Search over Relational Data
- From Regular Expressions to Nested Words: Unifying Languages and Query Execution for Relational and XML Sequences
- Avalanche-Safe LINQ Compilation
- Towards Certain Fixes with Editing Rules and Master Data
- Explaining Missing Answers to SPJUA Queries
- Sampling the Repairs of Functional Dependency Violations under Hard Constraints
- Evaluating Entity Resolution Results
- High-Performance Dynamic Pattern Matching over Disordered Streams
- SECRET: A Model for Analysis of the Execution Semantics of Stream Processing Systems
- Recognizing Patterns in Streams with Imprecise Timestamps
- x-RDF-3X: Fast Querying, High Update Rates, and Consistency for RDF Databases
- Graph Pattern Matching: From Intractable to Polynomial Time
- GRAIL: Scalable Reachability Index for Large Graphs
- HaLoop: Efficient Iterative Data Processing on Large Clusters
- The Impact of Virtual Views on Containment
- Updatable and Evolvable Transforms for Virtual Databases
- Navigating in Complex Mashed-Up Applications
- Dremel: Interactive Analysis of Web-Scale Datasets
- On Graph Query Optimization in Large Networks
- Proximity Rank Join
- Identifying the Most Influential Data Objects with Reverse Top-k Queries
- Retrieving Top-k Prestige-Based Relevant Spatial Web Objects
- Parsimonious Linear Fingerprinting for Time Series
- The HV-tree: a Memory Hierarchy Aware Version Index
- Transforming Range Queries To Equivalent Box Queries To Optimize Page Access
- Record Linkage with Uniqueness Constraints and Erroneous Values
- On-the-Fly Entity-Aware Query Processing in the Presence of Linkage
- Behavior Based Record Linkage
- iGraph: A Framework for Comparisons of Disk-Based Graph Indexing Techniques
- Runtime Measurements in the Cloud: Observing, Analyzing, and Reducing Variance
- The Performance of MapReduce: An In-depth Study
- Evaluation of entity resolution approaches on real-world match problems
- MRShare: Sharing Across Multiple Queries in MapReduce
- Towards Elastic Transactional Cloud Storage with Range Query Support
- Hadoop++: Making a Yellow Elephant Run Like a Cheetah (Without It Even Noticing)
- Slicing Long-Running Queries
- Sharing-Aware Horizontal Partitioning for Exploiting Correlations During Query Processing
- Advanced Processing for Ontological Queries
- Towards The Web of Concepts: Extracting Concepts from Large Datasets
- Exploiting Content Redundancy for Web Information Extraction
- Automatic Rule Refinement for Information Extraction
- Embellishing Text Search Queries To Protect User Privacy
- Small Domain Randomization: Same Privacy, More Utility
- Nearest Neighbor Search with Strong Location Privacy
- UPI: A Primary Index for Uncertain Databases
- Ranking Continuous Probabilistic Datasets
- Set Similarity Join on Probabilistic Data
- Complex Event Detection at Wire Speed with FPGAs
- Database Compression on Graphics Processors
- Aether: A Scalable Approach to Logging
- Scalable Discovery of Best Clusters on Large Graphs
- An Architecture for Parallel Topic Models
- Keyword++: A Framework to Improve Keyword Search Over Entity Databases
- Swarm: Mining Relaxed Temporal Moving Object Clusters
- An Adaptive Updating Protocol for Reducing Moving Object Databases Workload
- Shortest Path Computation on Air Indexes
- Efficient and Effective Similarity Search over Probabilistic Data based on Earth Mover's Distance
- Probabilistic XML via Markov Chains
- MCDB-R: Risk Analysis in the Database
- Scalable Probabilistic Databases with Factor Graphs and MCMC
- On Multi-Column Foreign Key Discovery
- Explore or Exploit? Effective Strategies for Disambiguating Large Databases
- Building Ranked Mashups of Unstructured Sources with Uncertain Information
- Computing Closed Skycubes
- Generating Databases for Query Workloads
- Processing Top-k Join Queries
- Two-way Replacement Selection
- XPath Whole Query Optimization
- Fast Optimal Twig Joins
- Destabilizers and Independence of XML Updates
- Searching Workflows with Hierarchical Views
- Data-Oriented Transaction Execution
- Optimal Top-K Query Evaluation for Weighted Business Processes
- Behavioral Simulations in MapReduce
- A*-tree: A Structure for Storage and Modeling of Uncertain Multidimensional Arrays
- On Dense Pattern Mining in Graph Streams
- Efficient Proximity Detection among Mobile Users via Self-Tuning Policies
- k-Nearest Neighbors in Uncertain Graphs
- Mining Significant Semantic Locations From GPS Data
- Boosting the Accuracy of Differentially Private Histograms Through Consistency
- rho-uncertainty: Inference-Proof Transaction Anonymization
- Minimizing Minimality and Maximizing Utility: Analyzing Method-based attacks on Anonymized Data
- Querying Probabilistic Information Extraction
- Read-Once Functions and Query Evaluation in Probabilistic Databases
- Foundations of Uncertain-Data Integration
- Identifying, Attributing and Describing Spatial Bursts
- CORADD: Correlation Aware Database Designer for Materialized Views and Indexes
- Regret-Minimizing Representative Databases
- An Access Cost-Aware Approach for Object Retrieval over Multiple Sources
- On the Stability of Plan Costs and the Costs of Plan Stability
- Xplus: A SQL-Tuning-Aware Query Optimizer
- Graph Homomorphism Revisited for Graph Matching
- SigMatch: Fast and Scalable Multi-Pattern Matching
- SAPPER: Subgraph Indexing and Approximate Matching in Large Graphs
- Tree Indexing on Solid State Drives
- Efficient B-tree Based Indexing for Cloud Data Processing
- Trie-Join: Efficient Trie-based String Similarity Joins with Edit-Distance Constraints
- VoR-Tree: R-trees with Voronoi Diagrams for Efficient Processing of Spatial Nearest Neighbor Queries
- Efficient RkNN Retrieval with Arbitrary Non-Metric Similarity Measures
- Efficient Skyline Evaluation over Partially Ordered Domains
- Achieving High Output Quality under Limited Resources through Structure-based Spilling in XML Streams
- Dynamic Join Optimization in Multi-Hop Wireless Sensor Networks
- Database-support for Continuous Prediction Queries over Streaming Data
- Conditioning and Aggregating Uncertain Data Streams: Going Beyond Expectations
- TRAMP: Understanding the Behavior of Schema Mappings through Provenance
- Entity Resolution with Evolving Rules
- Annotating and Searching Web Tables Using Entities, Types and Relationships
- Interesting-Phrase Mining for Ad-Hoc Text Analytics
- Global Detection of Complex Copying Relationships Between Sources
- Fragments and Loose Associations: Respecting Privacy in Data Publishing
- Net-Fli: On-the-fly Compression, Archiving and Indexing of Streaming Network Traffic
- From a Stream of Relational Queries to Distributed Stream Processing
- UASMAs: a set of algorithms to instantaneously map SNPs in real time to aid functional SNP discovery
- FlashStore: High Throughput Persistent Key-Value Store
- MEET DB2: Automated Database Migration Evaluation
- SSD Bufferpool Extensions for Database Systems
- DataGarage: Warehousing Massive Performance Data on Commodity Servers
- Cheetah: A High Performance, Custom Data Warehouse on Top of MapReduce
- Distance-Based Outlier Detection: Consolidation and Renewed Bearing
- Adaptive Logging for Mobile Device
- RoadTrack: Scaling Location Updates for Mobile Clients on Road Networks with Query Awareness
- Confucius and Its Intelligent Disciples: Integrating Social with Search
- The Picasso Database Query Optimizer Visualizer
- CODS: Evolving Data Efficiently and Scalably in Column Oriented Databases
- Efficient Event Processing through Reconfigurable Hardware for Algorithmic Trading
- CareDB: A Context and Preference-Aware Location-Based Database System
- Cloudy: A Modular Cloud Storage System
- Geospatial Stream Query Processing using Microsoft SQL Server StreamInsight
- Using XMorph to Transform XML Data
- Active Complex Event Processing: Applications in Real-Time Health Care
- Thirteen New Players in the Team: A Ferry-based LINQ to SQL Provider
- AXART - Enabling Collaborative Work with AXML Artifacts
- iFlow: An Approach for Fast and Reliable Internet-Scale Stream Processing Utilizing Detouring and Replication
- Peer coordination through distributed triggers
- Seaform: Search-As-You-Type in Forms
- TimeTrails: A System for Exploring Spatio-Temporal Information in Documents
- QUICK: Expressive and Flexible Search over Knowledge Bases and Text Collections
- Transforming XML Documents as Schemas Evolve
- XSACT: A Comparison Tool for Structured Search Results
- ObjectRunner: Lightweight, Targeted Extraction and Querying of Structured Web Data
- ROXXI: Reviving witness dOcuments to eXplore eXtracted Information
- EXTRUCT: Using Deep Structural Information in XML Keyword Search
- SQL QueRIE Recommendations
- P2PDocTagger: Content management through automated P2P collaborative tagging
- InZeit: Efficiently Identifying Insightful Time Points
- iAVATAR: An Interactive Tool for Finding and Visualizing Visual-Representative Tags in Image Search
- Deep Web Integration with VisQI
- SOLOMON: Seeking the Truth Via Copying Detection
- Just-in-time Data Integration in Action
- Massively Parallel Data Analysis with PACTs on Nephele
- Using Sentinel Technology in the TARGIT BI Suite
- CoDA: Interactive Cluster Based Concept Discovery
- Keymantic: Semantic Keyword-based Searching in Data Integration Systems
- Data Auditor: Exploring Data Quality and Semantics using Pattern Tableaux
- Distributed Caching Platforms
- Big Data and Cloud Computing: New Wine or just New Bottles?
- Techniques for Similarity Searching in Multimedia Databases
- Event Processing - past, present and future
- Similarity Search and Mining in Uncertain Databases
- Data Management and Mining in Internet Ad Systems
- Cloud Databases: What's New?
- Time for Our Field to Grow Up
Volume 2
https://www.vldb.org/pvldb/volumes/2/
- Believe It or Not: Adding Belief Annotations to Databases
- Similarity Search on Bregman Divergence: Towards Non-Metric Indexing
- Comparing Stars: On Approximating Graph Edit Distance
- Indexing Boolean Expressions
- Scalable Delivery of Stream Query Results
- Schema-Based Independence Analysis for XML Updates
- Tagging Stream Data for Rich Real-Time Services
- Randomized Multi-pass Streaming Skyline Algorithms
- Managing Massive Time Series Streams with MultiScale Compressed Trickles
- Promotion Analysis in Multi-Dimensional Space
- Measure-driven Keyword-Query Expansion
- Using Trees to Depict a Forest
- Online Piece-wise Linear Approximation of Numerical Streams with Precision Guarantees
- A Wavelet Transform for Efficient Consolidation of Sensor Relations with Quality Guarantees
- Enabling epsilon-Approximate Querying in Sensor Networks
- HAMSTER: Using Search Clicklogs for Schema and Taxonomy Matching
- Cooperative Update Exchange in the Youtopia System
- Reference-Based Alignment in Large Sequence Databases
- Thread Cooperation in Multicore Architectures for Frequency Counting over Multiple Data Streams
- Streams on Wires - A Query Compiler for FPGAs
- On-the-fly Progress Detection in Iterative Stream Queries
- Consistency Rationing in the Cloud: Pay only when it matters
- Locking Key Ranges with Unbundled Transaction Services
- A Scalable, Predictable Join Operator for Highly Concurrent Data Warehouses
- Answering Table Augmentation Queries from Unstructured Lists on the Web
- Efficient Rewriting of XPath Queries Using Query Set Specifications
- Structured Search Result Differentiation
- A Hierarchical Approach to Model Web Query Interfaces for Web Source Integration
- Efficient Retrieval of the Top-k Most Relevant Spatial Web Objects
- Stop Word and Related Problems in Web Interface Integration
- Lazy-Adaptive Tree: An Optimized Index Structure for Flash Devices
- MCC-DB: Minimizing Cache Conflicts in Multi-core Processors for Databases
- SIMD-Scan: Ultra Fast in-Memory Table Scan using on-Chip Vector Processing Units
- Mining Document Collections to Facilitate Accurate Approximate Entity Matching
- Reasoning about Record Matching Rules
- Turbo-Charging Estimate Convergence in DBO
- Composable, Scalable, and Accurate Weight Summarization of Unaggregated Data Sets
- Distributed Online Aggregation
- A Recall-Based Cluster Formation Game in Peer-to-Peer Systems
- Quantifying Isolation Anomalies
- Improving OLTP Scalability using Speculative Lock Inheritance
- Segment-based recovery: Write ahead logging revisited
- A Unified Approach to Ranking in Probabilistic Databases
- Learning String Transformations From Examples
- Probabilistic Histograms for Probabilistic Data
- Autocompletion for Mashups
- Integrating Conflicting Data: The Role of Source Dependence
- Truth Discovery and Copying Detection in a Dynamic World
- Sequential Dependencies
- SHARC: Framework for Quality-Conscious Web Archiving
- Modeling and Querying Possible Repairs in Duplicate Detection
- Discovering Relative Importance of Skyline Attributes
- A Particle-and-Density Based Evolutionary Clustering Method for Dynamic Networks
- Summarizing Relational Databases
- Coordinated Weighted Sampling for Estimating Aggregates Over Multiple Weight Assignments
- Power-Law Based Estimation of Set Similarity Join Size
- Optimality and Scalability in Lattice Histogram Construction
- Adaptively Parallelizing Distributed Range Queries
- Mining Tree-Structured Data on Multicore Systems
- Predictable Performance for Unpredictable Workloads
- Graph Clustering Based on Structural/Attribute Similarities
- Output Space Sampling for Graph Patterns
- Mining Graph Patterns Efficiently via Randomized Summaries
- Group Recommendation: Semantics and Efficiency
- Class-based graph anonymization for social network data
- Improved Search for Socially Annotated Data
- Data Publishing against Realistic Adversaries
- Scalable Verification for Outsourced Dynamic Databases
- Optimal Random Perturbation at Multiple Privacy Levels
- Anticipatory DTW for Efficient Similarity Search in Time Series Databases
- Improving the Performance of List Intersection
- Consistent Histograms In The Presence of Distinct Value Counts
- GConnect: A Connectivity Index for Massive Disk-resident Graphs
- A Shared Execution Strategy for Multiple Pattern Mining Requests over Streaming Data
- DistanceJoin: Pattern Match Query In a Large Graph Database
- Creating Competitive Products
- Data Processing on FPGAs
- HadoopDB: An Architectural Hybrid of MapReduce and DBMS Technologies for Analytical Workloads
- Anonymization of Set-Valued Data via Top-Down, Local Generalization
- K-Automorphism: A General Framework For Privacy Preserving Network Publication
- Distribution-based Microdata Anonymization
- On Chase Termination Beyond Stratification
- Preventing Bad Plans by Bounding the Impact of Cardinality Estimation Errors
- Exact Cardinality Query Optimization for Optimizer Testing
- Laconic Schema Mappings: Computing the Core with SQL Queries
- Inverting Schema Mappings: Bridging the Gap between Theory and Practice
- Full-Fidelity Flexible Object-Oriented XML Access
- Privacy-Aware Mobile Services over Road Networks
- A Fair Assignment Algorithm for Multiple Preference Queries
- Pangea: An Eager Database Replication Middleware guaranteeing Snapshot Isolation without Modification of Database Servers
- Harvesting Relational Tables from Lists on the Web
- Data Integration for the Relational Web
- Normalization and Optimization of Schema Mappings
- Continuous Monitoring of Nearest Neighbors on Land Surface
- Efficient Method for Maximizing Bichromatic Reverse Nearest Neighbor
- Lazy Updates: An Efficient Technique to Continuously Monitoring Reverse kNN
- NEAR-Miner: Mining Evolution Associations of Web Site Directories for Efficient Maintenance of Web Archives
- An Audit Environment for Outsourcing of Frequent Itemset Mining
- Publishing Naive Bayesian Classifiers: Privacy without Accuracy Loss
- Workload-Aware Indexing of Continuously Moving Objects
- Effectively Indexing Uncertain Moving Objects for Predictive Queries
- Path Oracles for Spatial Networks
- Correlation Maps: A Compressed Access Method for Exploiting Soft Functional Dependencies
- Index Interactions in Physical Design Tuning: Modeling, Analysis, and Applications
- Tuning Database Configuration Parameters with iTuned
- An Evaluation of Checkpoint Recovery for Massively Multiplayer Online Games
- Evaluating Clustering in Subspace Projections of High Dimensional Data
- Framework for Evaluating Clustering Algorithms in Duplicate Detection
- Declarative Database Management in SQLServer
- StatAdvisor: Recommending Statistical Views
- An Object Placement Advisor for DB2 Using Solid State Storage
- XPEDIA: XML ProcEssing for Data IntegrAtion
- XQuery Reloaded
- Binary XML Storage and Query Processing in Oracle 11g
- Enhanced Subquery Optimizations in Oracle
- Sort vs. Hash Revisited: Fast Join Implementation on Modern Multi-Core CPUs
- Efficient Outer Join Data Skew Handling in Parallel DBMS
- SQL/MapReduce: A practical approach to self-describing, polymorphic, and parallelizable user-defined functions
- Building a HighLevel Dataflow System on top of MapReduce: The Pig Experience
- PLANET: Massively Parallel Learning of Tree Ensembles with MapReduce
- Robust Distributed Top-N Frequent Pattern Mining Using the SAP BW Accelerator
- 1, 000 Tables Inside the From
- Efficient Index Compression in DB2 LUW
- Storing Scientific Workflows in a Database
- MAD Skills: New Analysis Practices for Big Data
- DBLP - Some Lessons Learned
- Oracle SecureFiles: Prepared for the Digital Deluge
- Scalable Web Data Extraction for Online Market Intelligence
- Kosmix: Exploring the Deep Web using Taxonomies and Categorization
- Query Mesh: Multi-Route Query Processing Technology
- A Demonstration of SciDB: A Science-Oriented DBMS
- MOIR/MT: Monitoring Large-Scale Road Network Traffic in Real-Time
- Oracle Database Replay
- DIADS: A Problem Diagnosis Tool for Databases and Storage Area Networks
- Artemis: A System for Analyzing Missing Answers
- Demonstration of the TrajStore System
- Microsoft CEP Server and Online Behavioral Targeting
- A Testbed for Managing Dynamic Mixed Workloads
- DBToaster: A SQL Compiler for High-Performance Delta Processing in Main-Memory Databases
- ANGIE: Active Knowledge for Interactive Exploration
- Comparative evaluation of entity resolution approaches with FEVER
- RankIE: Document Retrieval on Ranked Entity Graphs
- Concise and Expressive Mappings with +Spicy
- AgreementMaker: Efficient Matching for Large Real-World Schemas and Ontologies
- Linkage Query Writer
- SMDM: Enhancing Enterprise-Wide Master Data Management Using Semantic Web Technologies
- IBM UFO Repository
- Mashup by Surfing a Web of Data APIs
- DEMo: Data Exchange Modeling Tool
- Lahar Demonstration: Warehousing Markovian Streams
- WOLVES: Achieving Correct Provenance Analysis by Detecting and Resolving Unsound Workflow Views
- TIAMAT: a Tool for Interactive Analysis of Microdata Anonymization Techniques
- iNextCube: Information Network-Enhanced Text Cube
- Hive - A Warehousing Solution Over a Map-Reduce Framework
- Tolkien: An Event Based Storytelling System
- Enabling social networking in ad hoc networks of mobile phones
- PDiffView: Viewing the Difference in Provenance of Workflow Results
- Goal-Oriented Web-site Navigation for On-line Shoppers
- Answering Web Questions Using Structured Data - Dream or Reality?
- How Best to Build Web-Scale Data Managers? A Panel Discussion
- Database Architecture Evolution: Mammals Flourished long before Dinosaurs became Extinct
- Data fusion - Resolving Data Conflicts for Integration
- Data visualization & social data analysis
- Keyword querying and Ranking in Databases
- Efficient Approximate Search on String Collections
- Information Theory For Data Management
- Column oriented Database Systems
Volume 1
https://www.vldb.org/pvldb/volumes/1/
- Is transactional memory an oxymoron?
- Databases and the silification of health
- What's wrong with high-dimensional similarity search?
- Constrained physical design tuning
- Scalable multi-query optimization for exploratory queries overfederated scientific databases
- Clustera: an integrated computation and data management system
- Performance profiling with EndoScope, an acquisitional softwaremonitoring framework
- Mining search engine query logs via suggestion sampling
- Plan-based complex event detection across distributed sources
- Finding relevant patterns in bursty sequences
- Constrained locally weighted clustering
- Resisting structural re-identification in anonymized social networks
- Privacy-preserving anonymization of set-valued data
- Authenticating the query results of text search engines
- Structural signatures for tree data structures
- Maintaining dynamic channel profiles on the web
- WYSIWYG development of data driven web applications
- Web page language identification based on URLs
- Parallelizing query optimization
- Hashed samples: selectivity estimators for set similarity selectionqueries
- Tighter estimation using bottom k sketches
- STBenchmark: towards a benchmark for mapping systems
- Interactive source registration in community-oriented informationintegration
- Data exchange with data-metadata translations
- Out-of-order processing: a new architecture for high-performancestream systems
- StreamTX: extracting tuples from streaming XML data
- Sliding-window top-k queries on uncertain streams
- Conditioning probabilistic databases
- Efficient search for the top-k probable nearest neighbors in uncertaindatabases
- BayesStore: managing large, uncertain data repositories withprobabilistic graphical models
- Type inference and type checking for queries on execution traces
- Taming verification hardness: an efficient algorithm for testingsubgraph isomorphism
- On generating near-optimal tableaux for conditional functionaldependencies
- Propagating functional dependencies with conditions
- Simrank++: query rewriting through link analysis of the click graph
- Accuracy estimate and optimization techniques for SimRank computation
- End-to-end support for joins in large-scale publish/subscribe systems
- Scalable ranked publish/subscribe
- Dependable cardinality forecasts for XQuery
- Hash-base subgraph query processing method for graph-structured XMLdocuments
- Generating XML structure using examples and constraints
- Read-optimized databases, in depth
- Flashing up the storage layer
- Rose: compressed, log-structured replication
- WebTables: exploring the power of tables on the web
- Scalable query result caching for web applications
- Optimization of multi-domain queries on the web
- Fault-tolerant stream processing using a distributed, replicated filesystem
- LeeWave: level-wise distribution of wavelet coefficients forprocessing kNN queries over distributed streams
- A practical scalable distributed B-tree
- Main-memory scan sharing for multi-core CPUs
- Row-wise parallel predicate evaluation
- Dynamic partitioning of the cache hierarchy in shared data centers
- RDF-3X: a RISC-style engine for RDF
- Multidimensional content eXploration
- Relaxation in text search using taxonomies
- Learning to extract form labels
- Automated creation of a forms-based database query interface
- Efficient network aware search in collaborative tagging sites
- Cleaning uncertain data with quality guarantees
- On the provenance of non-answers to queries over extracted data
- Dynamic active probing of helpdesk databases
- Graceful database schema evolution: the PRISM workbench
- Analyzing and revising data integration schemas to improve theirmatchability
- Learning to create data-integrating queries
- Approximate lineage for probabilistic databases
- Exploiting shared correlations in probabilistic databases
- Access control over uncertain data
- Anonymizing bipartite graph data using safe groupings
- Privacy preserving serial data publishing by role composition
- Output perturbation with query relaxation
- Transaction time indexing with version compression
- Managing and querying transaction-time databases under schemaevolution
- On efficiently searching trajectories and archival data for historicalsimilarities
- Keyword query cleaning
- Reasoning and identifying relevant matches for XML keyword search
- Ed-Join: an efficient algorithm for similarity joins with editdistance constraints
- Scalable ad-hoc entity extraction from text collections
- Scheduling shared scans of large data files
- Online maintenance of very large random samples on flash storage
- A skip-list approach for efficiently processing forecasting queries
- A request-routing framework for SOA-based enterprise computing
- Hexastore: sextuple indexing for semantic web data management
- Indexing land surface for efficient kNN query
- Efficient skyline querying with variable user preferences on nominalattributes
- Efficient top-k processing over query-dependent functions
- FINCH: evaluating reverse k-Nearest-Neighbor queries on location data
- Discovery of convoys in trajectory databases
- TraClass: trajectory classification using hierarchicalregion-based and trajectory-based clustering
- The V*-Diagram: a query-dependent approach to moving KNN queries
- Rewriting procedures for batched bindings
- Identifying robust plans through plan diagram reduction
- A pay-as-you-go framework for query execution feedback
- Evita raced: metacompilation for declarative networks
- Discovering data quality rules
- Mining non-redundant high order correlations in binary data
- Keyword search on external memory data graphs
- Sorting hierarchical data in external memory for archiving
- SLEUTH: Single-pubLisher attack dEtection Using correlaTion Hunting
- Energy cost, the key challenge of today's data centers: a powerconsumption analysis of TPC-C results
- Google's Deep Web crawl
- Industry-scale duplicate detection
- SCOPE: easy and efficient parallel processing of massive data sets
- PNUTS: Yahoo!'s hosted data serving platform
- Relational support for flexible schema scenarios
- Oracle SecureFiles System
- Efficient implementation of sorting on multi-core SIMD CPUarchitecture
- Efficiently approximating query optimizer plan diagrams
- Brighthouse: an analytic data warehouse for ad-hoc queries
- Optimizer plan change management: improved stability and performancein Oracle 11g
- Towards a physical XML independent XQuery/SQL/XML engine
- Closing the query processing loop in Oracle 11g
- Towards a streaming SQL standard
- eXtract: a snippet generation system for XML search
- Language-integrated querying of XML data in SQL server
- XTCcmp: XQuery compilation on XTC
- Periscope/GQ: a graph querying toolkit
- SEDA: a system for search, exploration, discovery, and analysis of XMLData
- Process spaceship: discovering and exploring process views from eventlogs in data spaces
- P3N: profiling the potential of a peer-based datamanagement system
- P2P logging and timestamping for reconciliation
- AlvisP2P: scalable peer-to-peer text retrieval in a structured P2Pnetwork
- WebContent: efficient P2P Warehousing of web data
- DObjects: enabling distributed data services for metacomputingplatforms
- EasyTicket: a ticket routing recommendation engine for enterpriseproblem resolution
- AJAXSearch: crawling, indexing and searching web 2.0 applications
- ManyAspects: a system for highlighting diverse concepts in documents
- XTreeNet: democratic community search
- An effective and versatile keyword search engine on heterogenous datasources
- DBPubs: multidimensional exploration of database publications
- Semandaq: a data quality system based on conditional functionaldependencies
- RIDE: a tool for interactive source registration in community-orientedinformation integration
- Comparing and evaluating mapping systems with STBenchmark
- Ad-hoc data processing in the cloud
- Large-scale collaborative analysis and extraction of web data
- Making SENSE: socially enhanced search and exploration
- AuditGuard: a system for database auditing under retentionrestrictions
- QueryScope: visualizing queries for repeatable database tuning
- When is it time to rethink the aggregate configuration of your OLAPserver?
- H-store: a high-performance, distributed main memory transactionprocessing system
- Organizing and indexing non-convex regions
- Capri/MR: exploring protein databases from a structural andphysicochemical point of view
- C-DEM: a multi-modal query system for Drosophila Embryo databases
- Querying and monitoring distributed business processes
- A first tutorial on dataspaces
- Ontologies and databases: myths and challenges
- Systems aspects of probabilistic data management
- A revival of integrity constraints for data cleaning
- XML Structural Summaries
- Scheduling continuous queries in data stream management systems
- Detecting clusters in moderate-to-high dimensional data: subspaceclustering, pattern-based clustering, and correlation clustering
- Finding frequent items in data streams
- Querying and mining of time series data: experimental comparison ofrepresentations and distance measures
- Column-store support for RDF data management: not all swans are white
- Prefix based numbering schemes for XML: techniques, applications andperformances
- A benchmark for evaluating moving object indexes
- Dwarfs in the rearview mirror: how big are they really?
- Challenges and techniques for effective and efficient similaritysearch in large video databases
- Studying interaction methodologies in video retrieval
- Mining patterns and rules for software specification discovery
- Towards efficient main-memory use for optimum tree index update
- Implementing filesystems by tree-aware DBMSs
- Adaptive workflow scheduling under resource allocation constraints andnetwork dynamics
- Privacy preserving document indexing infrastructure for a distributedenvironment
- GS-TMS: a global stream-based threat monitor system
- Incompleteness in information integration
- Querying web-based applications under models of uncertainty
- XML-document-filtering automaton
- Community-driven data grids
Thoughts & opinions
- My subconscious doesn't like LLMs 2025 Jul 16 | ~7 pages
- Computers understanding humans makes codebases irrelevant 2023 Apr 08 | ~5 pages
- Own your email's domain 2023 Feb 12 | ~4 pages
- Isolates + storage over http + orchestrators is the future that has arrived 2023 Jan 03 | ~4 pages
Articles
I learn through writing, so I write a lot. Most of these are ever evolving pieces.
Data Engineering
- The Spark Field Manual 2025 Oct 16 | ~23 pages
Python
- Unicode string normalization schemes in Python 2024 May 06 | ~5 pages
Resources
- Bookmarks 2025 Jun 02 | ~4 pages
- PVLDB - links only 2026 Sep 10 | ~162 pages
- PVLDB - links with abstracts (large document) 2026 Sep 10 | ~3377 pages
Work
- Lecture - You and your research by Dr. Richard Hamming 2024 Oct 14 | ~49 pages