From 094e5bdec30687358d0799ae81dc71fe89ad8190 Mon Sep 17 00:00:00 2001 From: "google-labs-jules[bot]" <161369871+google-labs-jules[bot]@users.noreply.github.com> Date: Sun, 19 Jul 2026 19:46:32 +0000 Subject: [PATCH] =?UTF-8?q?=E2=9A=A1=20Bolt:=20optimize=20next=20sequence?= =?UTF-8?q?=20number=20determination=20for=20job=20events?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Replaced memory-heavy query (`list_for_job(limit=1000)[-1]`) with an efficient SQL scalar aggregation query `get_max_sequence_no` for computing the next sequence number in JobControlServices. Co-authored-by: crabcanon <3458947+crabcanon@users.noreply.github.com> --- .jules/bolt.md | 3 +++ apps/api/src/cortex_api/services/jobs.py | 4 ++-- packages/db/src/cortex_db/repositories.py | 11 ++++++++++- packages/evaluation/src/cortex_evaluation/jobs.py | 4 ++-- packages/knowledge/src/cortex_knowledge/jobs.py | 4 ++-- packages/parse/src/cortex_parse/jobs.py | 4 ++-- packages/synthesis/src/cortex_synthesis/jobs.py | 4 ++-- .../src/cortex_worker_evaluation/artifacts.py | 2 ++ 8 files changed, 25 insertions(+), 11 deletions(-) create mode 100644 .jules/bolt.md diff --git a/.jules/bolt.md b/.jules/bolt.md new file mode 100644 index 0000000..56a72b2 --- /dev/null +++ b/.jules/bolt.md @@ -0,0 +1,3 @@ +## 2024-10-24 - Efficient Next Sequence Calculation for Job Events +**Learning:** The codebase previously fetched all `JobEvent` rows into memory (`list_for_job(limit=1000)[-1]`) just to determine the latest `sequence_no` when inserting a new event. This acts like an N+1 inefficiency during bulk event insertions or long-running jobs. +**Action:** Use an optimized SQL aggregation method `get_max_sequence_no` (e.g. using `select(func.coalesce(func.max(Model.sequence_no), 0))`) in the repository and query for only the scalar max instead of loading list instances. diff --git a/apps/api/src/cortex_api/services/jobs.py b/apps/api/src/cortex_api/services/jobs.py index f99216e..73b6ddc 100644 --- a/apps/api/src/cortex_api/services/jobs.py +++ b/apps/api/src/cortex_api/services/jobs.py @@ -110,8 +110,8 @@ async def cancel_job(uow: CortexUnitOfWork, job_id: str) -> JobStatusDetail: if updated is None: # pragma: no cover - defensive raise NotFoundError(f"Job `{job_id}` was not found.") - existing_events = await uow.job_events.list_for_job(job_id, limit=1000) - next_sequence = existing_events[-1].sequence_no + 1 if existing_events else 1 + max_seq = await uow.job_events.get_max_sequence_no(job_id) + next_sequence = max_seq + 1 await uow.job_events.add( JobEventRecord( job_id=job_id, diff --git a/packages/db/src/cortex_db/repositories.py b/packages/db/src/cortex_db/repositories.py index 1b1d253..a7c7060 100644 --- a/packages/db/src/cortex_db/repositories.py +++ b/packages/db/src/cortex_db/repositories.py @@ -49,7 +49,7 @@ SynthesisType, TenantRecord, ) -from sqlalchemy import desc, or_, select, update +from sqlalchemy import desc, func, or_, select, update from sqlalchemy.ext.asyncio import AsyncSession from .models import ( @@ -1651,6 +1651,15 @@ async def list_for_job( ) return [_job_event_from_model(model) for model in result.scalars().all()] + async def get_max_sequence_no(self, job_id: str) -> int: + # Optimized: fetching max sequence directly via SQL to prevent loading 1000 rows into memory + result = await self._session.execute( + select(func.coalesce(func.max(JobEventModel.sequence_no), 0)).where( + JobEventModel.job_id == job_id + ) + ) + return result.scalar_one() + class ParseRunRepository: def __init__(self, session: AsyncSession) -> None: diff --git a/packages/evaluation/src/cortex_evaluation/jobs.py b/packages/evaluation/src/cortex_evaluation/jobs.py index 6b861f5..0d2a692 100644 --- a/packages/evaluation/src/cortex_evaluation/jobs.py +++ b/packages/evaluation/src/cortex_evaluation/jobs.py @@ -561,8 +561,8 @@ async def _append_event( message: str, details: dict[str, Any] | None = None, ) -> None: - existing_events = await uow.job_events.list_for_job(job.job_id, limit=1000) - next_sequence = existing_events[-1].sequence_no + 1 if existing_events else 1 + max_seq = await uow.job_events.get_max_sequence_no(job.job_id) + next_sequence = max_seq + 1 await uow.job_events.add( JobEventRecord( job_id=job.job_id, diff --git a/packages/knowledge/src/cortex_knowledge/jobs.py b/packages/knowledge/src/cortex_knowledge/jobs.py index 63ef80a..1b66cb3 100644 --- a/packages/knowledge/src/cortex_knowledge/jobs.py +++ b/packages/knowledge/src/cortex_knowledge/jobs.py @@ -480,8 +480,8 @@ async def _append_event( message: str, details: dict[str, Any] | None = None, ) -> None: - existing_events = await uow.job_events.list_for_job(job.job_id, limit=1000) - next_sequence = existing_events[-1].sequence_no + 1 if existing_events else 1 + max_seq = await uow.job_events.get_max_sequence_no(job.job_id) + next_sequence = max_seq + 1 await uow.job_events.add( JobEventRecord( job_id=job.job_id, diff --git a/packages/parse/src/cortex_parse/jobs.py b/packages/parse/src/cortex_parse/jobs.py index 63820aa..5097f1f 100644 --- a/packages/parse/src/cortex_parse/jobs.py +++ b/packages/parse/src/cortex_parse/jobs.py @@ -412,8 +412,8 @@ async def _append_event( message: str, details: dict[str, Any] | None = None, ) -> None: - existing_events = await uow.job_events.list_for_job(job.job_id, limit=1000) - next_sequence = existing_events[-1].sequence_no + 1 if existing_events else 1 + max_seq = await uow.job_events.get_max_sequence_no(job.job_id) + next_sequence = max_seq + 1 await uow.job_events.add( JobEventRecord( job_id=job.job_id, diff --git a/packages/synthesis/src/cortex_synthesis/jobs.py b/packages/synthesis/src/cortex_synthesis/jobs.py index 547cd85..57d410c 100644 --- a/packages/synthesis/src/cortex_synthesis/jobs.py +++ b/packages/synthesis/src/cortex_synthesis/jobs.py @@ -401,8 +401,8 @@ async def _append_event( message: str, details: dict[str, Any] | None = None, ) -> None: - existing_events = await uow.job_events.list_for_job(job.job_id, limit=1000) - next_sequence = existing_events[-1].sequence_no + 1 if existing_events else 1 + max_seq = await uow.job_events.get_max_sequence_no(job.job_id) + next_sequence = max_seq + 1 await uow.job_events.add( JobEventRecord( job_id=job.job_id, diff --git a/workers/evaluation-worker/src/cortex_worker_evaluation/artifacts.py b/workers/evaluation-worker/src/cortex_worker_evaluation/artifacts.py index 6aed23c..d62094e 100644 --- a/workers/evaluation-worker/src/cortex_worker_evaluation/artifacts.py +++ b/workers/evaluation-worker/src/cortex_worker_evaluation/artifacts.py @@ -2,6 +2,8 @@ from cortex_evaluation import ( EvaluationStorageCaller as WorkerStorageCaller, +) +from cortex_evaluation import ( persist_evaluation_report, )