Evaluating Embedding Models and Pipeline Optimization for AI Search Quality

📅 2025-11-27
📈 Citations: 0
✨ Influential: 0
📄 PDF
🤖 AI Summary
This study systematically evaluates how text embedding models and retrieval pipeline configurations impact AI search performance, using high-quality evaluation data derived from U.S. city council meeting transcripts. Methodologically, it compares sentence-transformers models (All-MPNet, BGE, GTE) with a generative embedding model (Qwen3-Embedding-8B), incorporating fine-grained text chunking (512 characters), high-dimensional embeddings (4096 dimensions), Milvus indexing (HNSW/IVF), and neural re-ranking. It further introduces a local LLM-driven synthetic data generation framework and a CI/CD-automated evaluation pipeline. Key contributions include: (1) empirical validation that high-dimensional generative embeddings substantially improve long-tail query recall (Top-3 accuracy = 0.571); (2) identification of synergistic gains from fine-grained chunking and neural re-ranking; and (3) proposal of a reproducible, end-to-end optimized evaluation paradigm for AI search systems.

Technology Category

Search and Optimization: Learning to SearchData Mining & Knowledge Management: Conversational Systems for Recommendation & RetrievalNatural Language Processing: Sentence-level Semantics, Textual Inference, etc.

Application Category

Search and Retrieval-Augmented AI: Web evaluation methodologies and metricsUser Modeling, Personalization and Recommendation: Fairness-aware retrieval and rankingGraph Algorithms and Modeling for the Web: Querying, indexing, and retrieval in Web-related graphs
📝 Abstract
We evaluate the performance of various text embedding models and pipeline configurations for AI-driven search systems. We compare sentence-transformer and generative embedding models (e.g., All-MPNet, BGE, GTE, and Qwen) at different dimensions, indexing methods (Milvus HNSW/IVF), and chunking strategies. A custom evaluation dataset of 11,975 query-chunk pairs was synthesized from US City Council meeting transcripts using a local large language model (LLM). The data pipeline includes preprocessing, automated question generation per chunk, manual validation, and continuous integration/continuous deployment (CI/CD) integration. We measure retrieval accuracy using reference-based metrics: Top-K Accuracy and Normalized Discounted Cumulative Gain (NDCG). Our results demonstrate that higher-dimensional embeddings significantly boost search quality (e.g., Qwen3-Embedding-8B/4096 achieves Top-3 accuracy about 0.571 versus 0.412 for GTE-large/1024), and that neural re-rankers (e.g., a BGE cross-encoder) further improve ranking accuracy (Top-3 up to 0.527). Finer-grained chunking (512 characters versus 2000 characters) also improves accuracy. We discuss the impact of these factors and outline future directions for pipeline automation and evaluation.
Problem

Research questions and friction points this paper is trying to address.

Evaluating embedding models for AI search quality
Optimizing pipeline configurations for retrieval accuracy
Comparing chunking strategies and indexing methods
Innovation

Methods, ideas, or system contributions that make the work stand out.

Evaluated embedding models and pipeline configurations for search quality
Used custom dataset from LLM-processed transcripts for evaluation
Applied neural re-rankers and fine-grained chunking to improve accuracy
🔎 Similar Papers
No similar papers found.
P
Philip Zhong
Webex Suite AI, Cisco Systems, Inc., San Jose, California, USA
K
Kent Chen
Webex Suite AI, Cisco Systems, Inc., San Jose, California, USA
D
Don Wang
Webex Suite AI, Cisco Systems, Inc., San Jose, California, USA