Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation

Análisis del Tamaño de Fragmentos y Solapamiento de Vectores en la Optimización de Bases de Datos Vectoriales para la Automatización de Agentes de IA

Authors

Keywords:

Artificial Intelligence, Natural Language Processing, Retrieval-Augmented Generation, Large Language Models, Information Retrieval, Document Vectorization, Unstructured Data, AI Agent Automation (en).

Keywords:

Inteligencia Artificial, Procesamiento del Lenguaje Natural, Generación Aumentada por Recuperación (RAG), Modelos de Lenguaje a Gran Escala (LLMs), Recuperación de Información, Vectorización de Documentos, Datos No Estructurados, Automatización de Agentes de IA (es).

Abstract (en)

Recent advances in language models and retrieval-augmented generation (RAG) systems have highlighted the importance of optimizing parameters such as chunk size and overlap when vectorizing unstructured data for efficient information retrieval. This study explores the impact of varying chunking configurations on the performance of a RAG system designed to answer queries regarding the Regulations of the Social Service of the Faculty of Science, UNAM. Using N8N as the integration platform and OPENAI gpt-4o-mini as the LLM tool, different chunking strategies were evaluated based on four key metrics: correctness, semantic similarity, context relevance, and answer relevance. Results suggest that while overall performance differences between chunking strategies were not statistically significant, variations in chunk size and overlap can influence the consistency and quality of responses, particularly regarding answer relevance. These findings offer practical guidelines for optimizing chunking parameters in a RAG system for retrieving information from regulations documents to enhance retrieval accuracy and response reliability. 

Abstract (es)

Avances recientes en modelos de lenguaje y sistemas de generación aumentada por recuperación (RAG) han destacado la importancia de optimizar parámetros como el tamaño de los fragmentos (chunk size) y su solapamiento (overlap) al vectorizar datos no estructurados para una recuperación de información eficiente. Este estudio explora el impacto de diferentes configuraciones de fragmentación en el rendimiento de un sistema RAG diseñado para responder consultas sobre el Reglamento del Servicio Social de la Facultad de Ciencias de la UNAM. Utilizando N8N como plataforma de integración y OPENAI gpt-4o-mini como herramienta de LLM, se evaluaron diferentes estrategias de fragmentación con base en cuatro métricas clave: corrección, similitud semántica, relevancia del contexto y relevancia de la respuesta. Los resultados sugieren que, si bien las diferencias generales de rendimiento entre las estrategias de fragmentación no fueron estadísticamente significativas, las variaciones en el tamaño de los fragmentos y su solapamiento pueden influir en la consistencia y calidad de las respuestas, particularmente en lo que respecta a la relevancia de la respuesta. Estos hallazgos ofrecen lineamientos prácticos para optimizar los parámetros de fragmentación en un sistema RAG destinado a recuperar información de documentos reglamentarios, con el fin de mejorar la precisión de la recuperación y la confiabilidad de las respuestas. 

Author Biography

Francisco Valdés-Souto, Universidad Nacional Autónoma de México

Departamento de Matemáticas

References

Chen, T., Wang, H., Chen, S., Yu, W., Ma, K., Zhao, X., Zhang, H., & Yu, D. (2024). Dense X retrieval: What retrieval granularity should we use? arXiv preprint. https://doi.org/10.48550/arXiv.2312.06648

Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint. https://doi.org/10.48550/arXiv.1810.04805

Duarte, A. V., Marques, J., Graça, M., Freire, M., Li, L., & Oliveira, A. L. (2024). LumberChunker: Long-form narrative document segmentation. arXiv preprint. https://doi.org/10.48550/arXiv.2406.17526

Google Cloud. (n.d.). What are AI agents? Definition, examples, and types. https://cloud.google.com/discover/what-are-ai-agents

Juvekar, K., & Purwar, A. (2024). Introducing a new hyper-parameter for RAG: Context window utilization. arXiv preprint. https://doi.org/10.48550/arXiv.2407.19794

Keselman, H. J., Algina, J., & Kowalchuk, R. K. (2001). The analysis of repeated measures designs: A review. British Journal of Mathematical and Statistical Psychology, 54(1), 1-20. https://doi.org/10.1348/000711001159357

Kimothi, A. (2024, September 23). Breaking it down: Chunking for better RAG. Medium.

https://medium.com/data-science/breaking-it-down-chunking-techniques-for-better-rag-3fd288bf25a0

Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., Küttler, H., Lewis, M., Yih, W., Rocktäschel, T., Riedel, S., & Kiela, D. (2020). Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv preprint. https://doi.org/10.48550/arXiv.2005.11401

Marcus, G. (2020). The next decade in AI: The steps towards robust artificial intelligence. arXiv preprint.

https://doi.org/10.48550/arXiv.2002.06177

Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient estimation of word representations in vector space. arXiv preprint. https://doi.org/10.48550/arXiv.1301.3781

OpenAI (n.d.). What are tokens and how to count them? OpenAI Help Center.

https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them

Pinecone (n.d.). Vector similarity explained. https://www.pinecone.io/learn/vector-similarity/

Radford, A., Narasimhan, K., Salimans, T., & Sutskever, I. (2018). Improving language understanding by generative pre-training. OpenAI. https://openai.com/research/language-unsupervised

Sheldon, R., & Yasar, K. (2024, November 13). What is an AI prompt? TechTarget.

https://www.techtarget.com/searchenterpriseai/definition/AI-prompt

Singh, I. S., Aggarwal, R., Allahverdiyev, I., Taha, M., Akalin, A., Zhu, K., & O'Brien, S. (2024). ChunkRAG: Novel LLM-chunk filtering method for RAG systems. arXiv. https://doi.org/10.48550/arXiv.2410.19572

Stryker, C., & Holdsworth, J. (2024, August 11). What is NLP (natural language processing)? IBM Think.

https://www.ibm.com/think/topics/natural-language-processing

Superteams.ai (2025). A deep dive into chunking strategy, chunking methods, and precision in RAG applications.

https://www.superteams.ai/blog/a-deep-dive-into-chunking-strategy-chunking-methods-and-precision-in-ragapplications

Taipalus, T. (2024). Vector database management systems: Fundamental concepts, use-cases, and current challenges. Cognitive Systems Research, 85, 101216. https://doi.org/10.1016/j.cogsys.2024.101216

Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T., Rozière, B., Goyal, N., Hambro, E., Azhar, F., Rodriguez, A., Joulin, A., Grave, E., & Lample, G. (2023). LLaMA: Open and efficient foundation language models. arXiv preprint. https://doi.org/10.48550/arXiv.2302.13971

Zhang, Y., Li, Y., Cui, L., Cai, D., Liu, L., Fu, T., Huang, X., Zhao, E., Zhang, Y., Chen, Y., Wang, L., Luu, A. T., Bi, W., Shi, F., & Shi, S. (2023). Siren's song in the AI ocean: A survey on hallucination in large language models. arXiv preprint. https://doi.org/10.48550/arXiv.2309.01219

Zhong, Z., Liu, H., Cui, X., Zhang, X., & Qin, Z. (2024). Mix-of-granularity: Optimize the chunking granularity for retrieval-augmented generation. arXiv preprint. https://doi.org/10.48550/arXiv.2406.00456

Zhou, J., Zhang, G., Alfarraj, O., Li, X., Tolba, A., & Zhang, H. (2024). DC-Graph: A chunk optimization model based on document classification and graph learning. Artificial Intelligence Review, 57, Article 143.

https://doi.org/10.1007/s10462-024-10771-w

How to Cite

APA

Valdés-Souto, F., Richard, D., Dominguez-Valenzuela, E., Rodriguez-Flores, M., and Mejía-Bautista, N. (2026). Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation. Revista Científica, 53(1), e24600. https://doi.org/10.14483/23448350.24600

ACM

[1]
Valdés-Souto, F. et al. 2026. Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation. Revista Científica. 53, 1 (Jul. 2026), e24600. DOI:https://doi.org/10.14483/23448350.24600.

ACS

(1)
Valdés-Souto, F.; Richard, D.; Dominguez-Valenzuela, E.; Rodriguez-Flores, M.; Mejía-Bautista, N. Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation. Rev. Cient. 2026, 53, e24600.

ABNT

VALDÉS-SOUTO, Francisco; RICHARD, Daniela; DOMINGUEZ-VALENZUELA, Emilio; RODRIGUEZ-FLORES, Manuel; MEJÍA-BAUTISTA, Natalia. Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation. Revista Científica, [S. l.], v. 53, n. 1, p. e24600, 2026. DOI: 10.14483/23448350.24600. Disponível em: https://revistas.udistrital.edu.co/index.php/revcie/article/view/24600. Acesso em: 29 jul. 2026.

Chicago

Valdés-Souto, Francisco, Daniela Richard, Emilio Dominguez-Valenzuela, Manuel Rodriguez-Flores, and Natalia Mejía-Bautista. 2026. “Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation”. Revista Científica 53 (1):e24600. https://doi.org/10.14483/23448350.24600.

Harvard

Valdés-Souto, F. (2026) “Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation”, Revista Científica, 53(1), p. e24600. doi: 10.14483/23448350.24600.

IEEE

[1]
F. Valdés-Souto, D. Richard, E. Dominguez-Valenzuela, M. Rodriguez-Flores, and N. Mejía-Bautista, “Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation”, Rev. Cient., vol. 53, no. 1, p. e24600, Jul. 2026.

MLA

Valdés-Souto, Francisco, et al. “Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation”. Revista Científica, vol. 53, no. 1, July 2026, p. e24600, doi:10.14483/23448350.24600.

Turabian

Valdés-Souto, Francisco, Daniela Richard, Emilio Dominguez-Valenzuela, Manuel Rodriguez-Flores, and Natalia Mejía-Bautista. “Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation”. Revista Científica 53, no. 1 (July 23, 2026): e24600. Accessed July 29, 2026. https://revistas.udistrital.edu.co/index.php/revcie/article/view/24600.

Vancouver

1.
Valdés-Souto F, Richard D, Dominguez-Valenzuela E, Rodriguez-Flores M, Mejía-Bautista N. Analysis of Vector Chunk and Overlap Sizes in Optimizing Vector Databases in Artificial Intelligence Agent Automation. Rev. Cient. [Internet]. 2026 Jul. 23 [cited 2026 Jul. 29];53(1):e24600. Available from: https://revistas.udistrital.edu.co/index.php/revcie/article/view/24600

Download Citation

Visitas

15

Dimensions


PlumX


Downloads

Download data is not yet available.

Publication Facts

Metric
This article
Other articles
Peer reviewers 
2
2.4

Reviewer profiles  N/A

Author statements

Author statements
This article
Other articles
Data availability 
N/A
16%
External funding 
No
32%
Competing interests 
No
11%
Metric
This journal
Other journals
Articles accepted 
38%
33%
Days to publication 
217
145

Indexed in

Editor & editorial board
profiles
Loading...