hoangsonww/RAG-LangChain-AI-System

Feature: Entity Graph Augmentation for Multi-Hop Portfolio Q&A

Open

#23 opened on Mar 8, 2026

View on GitHub
 (0 comments) (0 reactions) (1 assignee)Jupyter Notebook (13 forks)auto 404
bugdocumentationenhancementgood first issuehelp wantedquestion

Repository metrics

Stars
 (46 stars)
PR merge metrics
 (PR metrics pending)

Description

Summary

Introduce an entity-relationship graph layer (companies, people, sectors, consultations, investments) to improve multi-hop reasoning and queries that span multiple documents/tools.

Why this matters

Vector retrieval is strong for semantic similarity but weak on relationship traversal and compositional questions (for example: "Which portfolio companies in sector X had consultations on topic Y?").

Scope

  • Entity extraction pipeline from documents + backend APIs.
  • Graph schema for core domain entities and relations.
  • Graph-aware query planner that augments retrieval context.
  • Evidence packaging combining graph paths + textual citations.

Non-goals

  • Replacing the existing retrieval stack.
  • Building a full external graph database dependency in v1 (in-memory/networkx or lightweight store is acceptable first step).

Proposed implementation

  1. Define canonical entity IDs and resolver (deduping aliases).
  2. Build graph construction jobs from ingestion output and backend datasets.
  3. Add query intent detection for graph-eligible questions.
  4. Inject graph traversal results into answer prompt/context assembly.
  5. Return graph path explanations in response metadata for traceability.

Acceptance criteria

  • Graph includes at minimum company, sector, team member, consultation entities.
  • Multi-hop question set shows measurable answer improvement vs baseline retrieval-only.
  • Responses can include relation-path evidence (e.g., Company -> Sector -> Consultation).
  • Graph updates incrementally as sources refresh.
  • Tests cover entity resolution, traversal correctness, and fallback behavior.

Relationship to existing issues

  • Distinct from issue #4 (hybrid retrieval): this adds relationship reasoning, not lexical+dense retrieval fusion.

Labels

enhancement, rag, knowledge-graph, backend

Contributor guide